计算机行业:浅析AI大模型训练数据来源与版权挑战-240719-广发证券-38页_3mb
报告摘要
计算机行业:AI大模型训练数据来源与版权挑战
核心内容
AI大模型的训练数据来源广泛,包括公开渠道、企业自研、直接购买和合作交换等方式。训练数据的规模、质量和多样性对模型性能具有重要影响,因此AI领域正经历从“以模型为中心”向“以数据为中心”的转变。
主要观点
- 训练数据的重要性:训练数据是AI大模型性能的关键因素,影响模型的准确性、泛化能力和上下文理解能力。
- 数据来源分类:包括维基百科、书籍期刊、论坛、代码和网页数据,其中网页数据(如CommonCrawl)是大模型训练的重要组成部分。
- 版权挑战日益凸显:AI训练数据的版权问题引发大量诉讼,内容持有者态度不一,部分选择诉讼,部分选择授权合作。
- 版权诉讼与合作趋势:2023年下半年,AI数据版权诉讼进入白热化阶段,2024年上半年内容合作加速,显示出行业对数据版权问题的关注度提升。
- 未来趋势预测:2024年有望成为AI训练数据版权之争的关键年,重点案例的判决将对行业产生深远影响。
关键信息
一、训练数据来源分类
| 数据来源 | 说明 |
|---|---|
| 维基百科 | 多语言、跨领域,常用于预训练 |
| 书籍期刊 | 提供丰富的科学知识,但授权进展缓慢 |
| 论坛 | 包含真实语言表达,提升模型泛化能力 |
| 代码 | 用于代码生成与补全,提高模型在编程任务中的表现 |
| 网页 | 涵盖多种内容,提供广泛信息,如CommonCrawl和C4数据集 |
二、数据版权挑战
- 版权诉讼:已有数十起版权诉讼正在进行,主要涉及未经授权使用受版权保护内容。
- 内容持有者态度:作家和艺术家普遍抵制AI公司,而新闻媒体则难以统一立场,部分选择合作。
- 法律与商业利益:版权纠纷实质是商业利益之争,内容持有者选择诉讼或合作取决于其商业模式、内容独特性和行业结构。
三、授权合作案例
| AI公司 | 内容持有方 | 协议形式与金额 | 授权内容 |
|---|---|---|---|
| OpenAI | Shutterstock | 金额未公布 | 训练 |
| OpenAI | 美联社 | 金额未公布 | 部分训练 |
| OpenAI | Axel Springer | 未来三年支付数千万欧元 | 训练、展示 |
| OpenAI | 金融时报 | 500-1000万美元 | 部分训练、展示 |
| OpenAI | 6000万美元/年 | 训练、展示 | |
| OpenAI | 新闻集团 | 5年协议,超过2.5亿美元 | 训练、展示 |
| 苹果 | 康泰纳仕,NBC新闻,IAC | 5000万美元的多年期合同 | 训练 |
| 苹果 | Shutterstock | 5000万美元 | 训练 |
| 谷歌 | 6000万美元/年 | 训练、展示 |
四、未来授权趋势
- 定价模式变化:未来内容授权可能基于内容对AI模型的贡献,如利润分享、按API访问次数收费等。
- 内容稀缺性:内容持有者通过提供稀缺数据增强议价能力,如新闻档案、视频资料等。
- 行业差异:新闻媒体因生命周期短、价值易下降,授权进展缓慢;艺术与音乐行业因独特性和版权管理组织,更倾向于诉讼。
投资建议
风险提示
- 内容价值难以量化:AI模型对内容的使用可能影响其商业价值评估。
- 行业竞争加剧:AI数据版权问题可能引发更多竞争。
- 数据侵权阻碍应用发展:未经授权的数据使用可能影响下游应用的商业化进程。
行业评级
- 评级:买入
- 前次评级:买入
- 报告日期:2024-07-19
重点案例关注
- 《纽约时报》诉OpenAI案:作为重点案例,其判决将对AI训练数据版权界定产生重要影响。
- 汤森路透诉Ross Intelligence案:预计2024年8月26日庭审,初步揭示法院对训练数据版权的态度。
未来展望
- 法律与监管介入:2024年可能成为AI数据版权之争的关键年,诉讼与合作并行,授权合作或快于法律变革。
- 技术与版权融合:随着多模态大模型的发展,数据授权将从文本扩展至图像、视频和语音等多模态数据。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载