中文大模型基准测评报告2023-ChatGPT发布一周年特别报告-SuperCLUE_38页_6mb
报告摘要
2023年中文大模型基准测评报告总结
一、国内大模型发展三阶段
自2022年11月30日ChatGPT发布后,国内大模型发展经历三个阶段。准备期(2022年12月-2023年6月)形成产学研共识,成长期(2023年6月-8月)数量与质量逐步提升,爆发期(2023年8月-11月)出现百模大战格局。主要企业如百度、阿里云、科大讯飞、腾讯等陆续发布文心一言40、通义千问20、星火30、混元等模型,百川智能、元象科技等创业公司亦推出Baichuan2-192K、XVERSE-65B等开源模型。
二、SuperCLUE测评体系特点
SuperCLUE基于CLUE基准发展,构建了涵盖通用大模型在语言理解与生成、专业技能与知识、工具使用、安全性四大维度的测评框架。采用多轮对话场景与开放主观题结合方式,通过1052道多轮简答题(OPEN)和3213道客观选择题(OPT)进行评估,权重设置为OPEN占60%、OPT占40%。测评采用高保密性措施,每月使用全新原创评测集,避免训练集与评测集污染。
三、测评结果关键发现
(1) 国内外差距:GPT-4 Turbo总分8979分,领先国内最高分文心一言40(7402分)1577分。国内8个模型综合能力超过GPT35,其中文心一言40、Yi-34B-Chat等模型在特定任务上表现优异。
(2) 模型象限:分为潜力探索者(如昆仑万维天工10)、技术领跑者(如华为盘古30)、实用主义者(如字节云雀)、卓越领导者(如文心一言40)四类。
(3) 开源模型表现:国内开源模型在中文任务上优于国外开源模型,如Baichuan2-13B-Chat、XVERSE-13B-Chat-2等模型在语言理解、生成能力上接近GPT35,部分场景表现更优。
四、四大能力维度分析
- 语言理解与生成:GPT-4 Turbo独占鳌头,国内文心一言40(8174分)、Yi-34B-Chat(8096分)、Moonshot(8017分)表现突出,开源模型在中文场景优势显著。
- 专业技能与知识:GPT-4 Turbo保持领先,国内文心一言40(8174分)得分超GPT35,通义千问20、Yi-34B-Chat等模型在计算、代码、百科等任务表现突出。
- 工具使用能力:GPT-4 Turbo取得满分,国内文心一言40(9038分)、通义千问20(8762分)表现优异,开源模型Baichuan2-13B-Chat(6538分)超越GPT35。
- 传统安全能力:Claude2(6972分)表现最佳,国内Yi-34B-Chat(5897分)、文心一言40(5678分)等模型在偏见歧视、违法犯罪等任务上均超过GPT系列。
五、竞争格局与行业应用
国内大厂与创业公司表现接近,大厂凭借用户数据优势在安全性和场景适配性上更优,创业公司则以更快的技术迭代速度占据先机。部分中大型模型如文心一言40在知识百科、逻辑推理等维度表现均衡,适合搜索查询、任务规划、办公自动化等场景;Baichuan2-13B-Chat在开源模型中表现最佳,适用于内容创作、智能客服等场景;Moonshot凭借长上下文处理能力(20万汉字)在对话理解、文档处理等任务上优势显著,适合AI智能体应用。整体显示国内大模型在中文场景表现优异,但核心能力仍需提升。
六、测评意义与展望
SuperCLUE通过多层次多维度测评体系,为模型优化和场景应用提供了科学依据。测评结果反映国内大模型在语言理解和生成能力已基本达到国际头部水平,但在专业技能与知识、工具使用等维度仍需加强。未来国内模型应聚焦技术深度与场景适配性,特别是在逻辑推理、代码生成等复杂能力上追赶国际先进水平。
试读结束,高清完整版pdf/doc/ppt,请点下载