科技行业:AI大模型需要什么样的数据-20230511-华泰证券-44页_3mb
报告摘要
AI大模型需要什么样的数据
核心内容
AI大模型的发展依赖于高质量、大规模、多样化的数据集。数据作为关键竞争要素,直接影响模型的训练效果和性能。随着AI技术的不断进步,数据的重要性日益凸显,尤其是在模型架构相对固定的情况下,数据质量与数量的提升成为推动模型性能优化的主要手段。
主要观点
-
数据的重要性
- 高质量数据能够提高模型精度与可解释性,并减少训练时长。
- 大规模数据有助于模型泛化能力的提升。
- 多样化数据能够防止模型过度拟合训练数据,增强其适应性。
-
数据集的产生流程
- 数据采集:包括系统日志采集、网络数据采集和ETL。
- 数据清洗:处理缺失值、噪声数据、重复数据等问题。
- 数据标注:是数据集建设中最重要的环节,包括文本、图像和语音标注。
- 模型训练与测试:通过标注数据训练模型,并进行性能评估。
- 数据维护:持续监测与维护数据集,确保其长期有效性。
-
海外数据集情况
- 海外拥有丰富的开源数据集,包括维基百科、书籍、期刊、Reddit链接和CommonCrawl等。
- 数据集的多样性与质量是海外大模型成功的关键因素之一。
- 未来AI合成数据将逐步取代真实数据,以缓解高质量数据耗尽的担忧。
-
中国数据集现状与挑战
- 国内开源数据集数量少、规模小,难以满足大模型训练需求。
- 国内大模型多依赖海外数据集进行训练。
- 数字中国战略将促进数据要素市场的完善,推动数据集的发展。
-
数据产业链投资机会
- 数据生产环节:包括通用数据和行业数据,如文本、图像等。
- 数据处理环节:模型研发企业对外包需求强烈,利好具备技术优势的数据服务企业。
- 数据资产储备公司和行业数据服务公司值得关注。
-
隐私保护与监管
- 随着AI的发展,个人数据的采集、存储和处理引发隐私保护问题。
- 隐私保护可通过监管和技术手段实现,如《个人信息保护法》和隐私保护计算技术。
关键信息
-
数据集类型
- 语言模型数据集:包括维基百科、书籍、期刊、Reddit链接、CommonCrawl等。
- 多模态数据集:包括语音+文本、图像+文本、视频+图像+文本、图像+语音+文本、视频+语音+文本等。
-
主要数据集示例
- 维基百科:包含多种语言和领域,是大模型训练的重要数据来源。
- 书籍:如Project Gutenberg和BookCorpus,提供丰富的文本内容。
- 期刊:如ArXiv和PubMed,为学术研究提供高质量数据。
- Reddit链接:作为流行内容的风向标,提供多样化的文本数据。
- CommonCrawl/C4:提供大规模的英文文本数据。
- The Pile:由多个高质量数据集组成,用于训练大规模语言模型。
- 多模态数据集:如COCO、ImageNet、LAION-400M、LAION-5B、SEMAINE、OpenViDial、YFCC100M、CH-SIMS、IEMOCAP、MELD等。
-
数据来源与发布方
- 非营利组织/开源组织:如Project Gutenberg、CommonCrawl、LAION等。
- 学术界:如多伦多大学、麻省理工学院、卡内基梅隆大学等。
- 互联网巨头研究部门:如Google Research、OpenAI、Meta、Facebook等。
- 政府机构:如美国国家卫生研究院、中国数据交易所等。
- 多类型机构合作:如Facebook、伦敦大学学院、DeepMind、卡内基梅隆大学、雅虎研究院等。
-
未来趋势
- 合成数据将逐步成为AI模型训练的主要数据来源。
- 中国数据要素市场将逐步完善,助力数据集的发展和流通。
- 数据成本在大模型开发中的占比将提升,包括数据采集、清洗和标注等环节。
风险提示
- AI及技术落地不及预期。
- 本研报中涉及的未上市公司或未覆盖个股信息为客观整理,不代表推荐或覆盖。
结论
AI大模型的训练依赖于高质量、大规模、多样化的数据集,而数据集的构建涉及多个环节,包括数据采集、清洗、标注、训练和维护。海外在数据集积累方面较为领先,而中国在数据集建设上仍面临挑战,但数字中国战略将推动数据要素市场的发展。未来合成数据有望成为重要补充,同时数据产业链中的生产与处理环节将带来新的投资机会。隐私保护和数据合规性也将在AI发展过程中扮演重要角色。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载