2023-12-25-语势科技-语势主题观察_网安协发布首批中文语料库_基础语料库是主权AI重要构成_4页_394kb
报告摘要
中文语料库发布总结
事件发生在2023年12月20日,中国网络空间安全协会人工智能安全治理专业委员会发布了首批中文基础语料库,用于大规模语言模型训练。
语料库细节显示,数据总量约120GB,包含超出1亿条数据记录和500亿个token,这些数据通过“共建-共享”机制与国家权威机构合作采集,确保高质量和可信度。
此举旨在应对中文高质量语料稀缺的挑战,解决了大模型训练中以中文为核心的不足。举例来说,谷歌Gemini被指控抄袭百度文心一言的事件,凸显了中文数据获取的基础问题。
展望未来,AI被视为像电网一样的基础设施,发展重点在于普惠和安全。开放共享的语料库是构建AI基础设施的关键,而“可信”语料库则是确保AI生成内容合规的前提。已有的相关进展包括:2023年7月北京市发布第一批大模型高质量数据集;8月上海人工智能实验室开源“书生·万卷”语料;11月北京智源人工智能研究院发布可信中文互联网语料库。
此外,AI时代的IP价值提升显而易见,OpenAI与德国出版商Axel Springer的合作表明,即使开源语料存在,媒体内容仍具有高变现潜力。
免责声明:本报告基于公开信息撰写,仅供参考,不保证准确性和完整性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载