中文大模型基准测评2025年上半年报告
报告摘要
中文大模型2025年上半年测评报告总结
一、关键进展与趋势
2025年上半年,大模型迈向“智能体崛起与AGI探索期”,国内外模型在技术深度、智能体Agent和跨模态能力上均有突破。海外模型如o3、o4-mini(high)和Gemini-2.5-Pro在推理任务上领先近10分,国内模型如DeepSeek-R1和GLM-4.5正在缩小研
究与开发领域差距。
二、模型测评总结
1. 综合能力排名
- 总榜第一:
o3(73.78分,OpenAI) - 国内领先:
DeepSeek-R1-0528(68.04分)和GLM-4.5(68.04分),在幻觉控制、Agent、中文创作等任务上表现良好。 - 开源模型:
DeepSeek-R1以66.15分领先,与闭源模型差距仅7.63分。
2. 分项任务表现
- 推理任务:海外头部模型领先明显,尤其在数学和科学推理中得分高出近20分。
- 智能体Agent:字节跳动的
Doubao-Seed-1.6-thinking-250715以90.67分全球第一。 - 幻觉控制:国际模型如
Claude-Opus-4-Reasoning领先,国内多模强(如Doubao)排名前三。 - 代码生成:国外模型(
o4-mini(high))优势显著,但国内部分开源模型进步迅速。
3. 价格与性能
- 性价比:国内模型(如
DeepSeek-R1)价格仅为海外模型(o3)的三分之一,性价比优势明显 - 推理效能:海外模型响应速度普遍更优,但国内头部模型(如
SenseNova V6 Reasoner)开始逼近。
三、行业动态
- 国产虚拟偶像、视频生成等领域涌现新应用,如
豆包、可灵AI。 - 开源生态增强:阿里、智谱、深度求索等多家机构发布大小模型矩阵,形成完整生态。
四、趋势展望
中文大模型发展呈现双轨格局:推理能力仍依赖海外领先技术,但智能体、中文场景、性价比正成为国内核心优势。SuperCLUE测评结果验证了开放测评基准的有效性,开启跨语言测评基准互认时代。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载