SuperCLUE-中文大模型基准测评报告2023暨ChatGPT发布一周年特别报告-2023.11.28-38页_2mb
报告摘要
中文大模型基准测评报告(2023)
一、背景与进展
- ChatGPT发布后,AI大模型在国内外掀起新浪潮。国内大模型发展分为三个阶段:
- 准备期:2022年12月-2023年3月,学术与产业形成共识。
- 成长期:2023年上半年,大模型数量与质量快速提升。
- 爆发期:2023年下半年,百模大战格局形成,大量开源与闭源模型涌现。
- 2023年国内大模型发布密集,包括文心一言4.0、零一万物Yi系列、月之暗面MoonShot、百川智能Baichuan系列等。
二、测评体系与方法
SuperCLUE Benchmark
- 测评目标:评估通用大模型在语言理解、专业技能、安全性及工具使用等核心能力。
- 五大特点:多维度测评、开放性主观任务、学术与产业视角、高保密性、自动化。
- 测评维度:
- 语言理解与生成
- 专业技能与知识
- 工具使用
- 传统安全
- 方法说明:
- OPEN:多轮对话测评,需模型在真实场景中作答。
- OPT:客观选择题,衡量模型基础应答能力。
- 总分公式:0.6 × OPEN分 + 0.4 × OPT分
三、测评结果
- 模型能力分布:
- GPT-4 Turbo总分领先,达89.79分。
- 国内模型表现:
- 文心一言4.0:总分74.02分,在中文任务中全面均衡。
- Yi-34B-Chat、MoonShot 分别接近或超过GPT-4。
- 国内开源模型整体表现优异,如Baichuan2-B-Chat在逻辑推理得分领先。
- 对战胜率:
- GPT-4 Turbo对GPT-3.5胜率为49.34%,远超其他模型。
- 国内模型中,Yi-34B-Chat与文心一言4.0表现最稳定,胜率约20%-25%。
- 四大维度表现:
- 语言理解:国内领先,清华大学、字节系模型突出。
- 专业技能与知识:尚有差距,国内多个模型仍在追赶。
- 工具使用:Baichuan2系列、通义千问在排片优化等任务中表现优秀。
- 安全能力:Claude2与国内模型如Yi、云雀领先,重点领域在隐私与社会规范。
四、市场格局
- 开源竞争:
- 百川、智谱、零一万物等创业公司成为开源主力。
- 国内开源模型在中文场景中优势明显,Baichuan2、XVERSE等开源版本接近GPT-3.5水平。
- 竞争态势:
- 大厂(如百度、阿里)与创业公司水平趋近。
- 国内TOP15模型中,大厂与创业公司平均分相差仅1分。
五、总结与洞察
- 大模型逐渐成为中文领域的追赶者,通用能力逼近或领先国际开源模型。
- 安全性与工具使用能力成为国内厂商发力重点。
- 开源生态成熟,推动中文落地应用,但专业领域模型还有优化空间。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载