中文大模型基准测评2025年年度报告_74页_26mb
报告摘要
中文大模型基准测评2025年年度报告总结
核心内容
2025年中文大模型在技术、应用和生态方面取得了显著进展,SuperCLUE团队发布的年度测评报告揭示了海内外大模型在多个维度的表现和差距,为AGI发展提供了量化依据和路线图。报告涵盖了多个测评任务,包括数学推理、科学推理、代码生成、智能体(任务规划)、幻觉控制和精确指令遵循,通过细致的对比分析,展示了中国大模型的竞争力和挑战。
主要观点
- 海外闭源模型仍占据榜单头部位置:Claude-Opus-4.5-Reasoning、Gemini-3-Pro-Preview和GPT-5.2(high)分别以68.25分、65.59分和64.32分位居全球前三,而国内开源模型Kimi-K2.5-Thinking和闭源模型Qwen3-Max-Thinking分列第四和第六。
- 国产大模型正从“跟跑”向“并跑”阶段加速演进:在数学推理和代码生成任务上,国产模型已取得全球领先,特别是在Kimi-K2.5-Thinking和Qwen3-Max-Thinking的推动下,国内模型在多个领域实现了追赶甚至超越。
- 海内外开闭源模型结构性差异显著:闭源模型在推理、任务规划和幻觉控制上具有明显优势,而开源模型则在代码生成和部分应用任务上表现出色,但整体仍落后于闭源模型。
关键信息
2025年年度大模型关键进展
- 百模大战与多模态萌芽:2022年ChatGPT发布后,全球AI大模型进入快速发展阶段,OpenAI、Meta、Google等机构相继发布多模态模型,中国也开始探索文生图、文生视频能力。
- 多模态爆发与推理突破:OpenAI发布Sora,实现高质量视频生成,GPT-40实现文本+图像+语音的实时交互,国内模型在多模态领域快速跟进,并在部分任务上取得领先。
- 智能体崛起与生态重构:2025年1月,深度求索发布DeepSeek-R1开源推理模型,进入全球前五。国内大量AI Agent产品涌现,如Auto GLM、扣子空间、天工Agent等,推动了AI Agent的实用化进程。
SuperCLUE2025年年度测评六大任务国内Top3
| 测评任务 | 海外第一 | 国内第一 | 国内第二 | 国内第三 |
|---|---|---|---|---|
| 数学推理 | Gemini-3-Pro-Preview | Qwen3-Max-Thinking | Kimi-K2.5-Thinking | DeepSeek-V3.2-Thinking |
| 科学推理 | GPT-5.2(high) | DeepSeek-V3.2-Thinking | Qwen3-Max-Thinking、Doubao-Seed-1.8-251228(Thinking) | Kimi-K2.5-Thinking、GLM-4.7、Tencent HY 2.0 Think |
| 代码生成 | Grok-4 | Kimi-K2.5-Thinking | Qwen3-Max-2025-09-23 | Kimi-K2-Thinking、ERNIE-5.0 |
| 智能体(任务规划) | GPT-5.2(high) | Qwen3-Max-Thinking | Kimi-K2.5-Thinking | Qwen3-Max-Preview-Thinking |
| 精确指令遵循 | Claude-Opus-4.5-Reasoning | ERNIE-5.0 | Doubao-Seed-1.8-251228(Thinking) | DeepSeek-V3.2-Thinking |
| 幻觉控制 | GPT-5.2(high) | GLM-4.7 | Doubao-Seed-1.8-251228(Thinking) | Kimi-K2.5-Thinking |
海内外大模型对比分析
- 数学推理:国内模型Qwen3-Max-Thinking与Gemini-3-Pro-Preview并列全球第一,Kimi-K2.5-Thinking排名第四。国内模型整体表现偏后,海外模型密度更高。
- 科学推理:海外模型包揽前四,GPT-5.2(high)以75.21分领先,国内模型DeepSeek-V3.2-Thinking、Qwen3-Max-Thinking和Doubao-Seed-1.8-251228(Thinking)进入前五。国内模型整体分布偏向中部,与国际顶尖模型差距较大。
- 代码生成:Kimi-K2.5-Thinking以53.33分位居全球第一,Qwen3-Max-2025-09-23以47.23分进入Top5。WebCoding子任务成为国产模型的超车区,差距显著缩小。
- 智能体(任务规划):GPT-5.2(high)以81.39分领先,Qwen3-Max-Thinking和Kimi-K2.5-Thinking分别以70.13分和68.06分位列第三和第四。国内模型在任务规划领域仍有提升空间。
- 精确指令遵循:海外模型Claude-Opus-4.5-Reasoning以51.10分领先,国内模型ERNIE-5.0和Doubao-Seed-1.8-251228(Thinking)分别以19.97分和21.37分紧随其后。国内模型整体表现欠佳,平均分差距明显。
- 幻觉控制:GPT-5.2(high)和Claude-Opus-4.5-Reasoning以88.56分和88.31分领先,GLM-4.7以83.85分进入Top3,国内模型在该任务上表现出一定竞争力。
开源与闭源模型对比
- 闭源模型全方位领先:在六大任务中,闭源模型的平均分均高于开源模型,差距在10分以上,特别是在智能体、精确指令遵循和幻觉控制上。
- 开源模型实现头部突破:Kimi-K2.5-Thinking在代码生成任务中以53.33分位列全球第一,成为开源模型的代表。国内开源模型在代码生成和部分任务上实现突破,但整体仍需提升。
总榜排名
| 排名 | 模型名称 | 机构 | 开/闭源 | 总分 | 数学推理 | 科学推理 | 代码生成 | 智能体 | 幻觉控制 | 精确指令遵循 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude-Opus-4.5-Reasoning | Anthropic | 闭源 | 68.25 | 73.04 | 88.31 | 48.40 | 74.87 | 88.56 | 51.10 |
| 2 | Gemini-3-Pro-Preview | 闭源 | 65.59 | 80.87 | 83.16 | 47.17 | 65.02 | 83.16 | 43.56 | |
| 3 | GPT-5.2(high) | OpenAI | 闭源 | 64.32 | 72.04 | 88.56 | 30.91 | 81.39 | 64.32 | 37.81 |
| 4 | Kimi-K2.5-Thinking | 月之暗面 | 开源 | 61.50 | 77.39 | 78.54 | 53.33 | 68.06 | 78.54 | 24.45 |
| 5 | Qwen3-Max-Thinking | 阿里巴巴 | 闭源 | 60.61 | 80.87 | 74.05 | 41.56 | 70.13 | 74.05 | 28.22 |
| 6 | Doubao-Seed-1.8-251228(Thinking) | 字节跳动 | 闭源 | 58.17 | 68.70 | 80.37 | 40.33 | 58.15 | 80.37 | 32.60 |
| 7 | DeepSeek-V3.2-Thinking | 深度求索 | 开源 | 57.55 | 72.17 | 76.57 | 39.84 | 55.53 | 76.57 | 29.86 |
| 8 | GLM-4.7 | 智谱AI | 开源 | 56.22 | 68.42 | 66.39 | 41.26 | 56.03 | 66.39 | 21.37 |
| 9 | ERNIE-5.0 | 百度 | 闭源 | 56.18 | 65.22 | 74.61 | 45.63 | 49.32 | 74.61 | 37.53 |
| 10 | Kimi-K2-Thinking | 月之暗面 | 开源 | 54.02 | 70.43 | 62.30 | 46.00 | 49.32 | 62.30 | 16.99 |
SuperCLUE模型象限
- 潜力探索者:模型处于探索阶段,具有较大潜力。
- 技术领跑者:模型在基础技术方面具备领先性。
- 实用主义者:模型在场景应用深度上具备领先性。
- 卓越领导者:模型在基础和场景应用上处于领先位置,引领国内大模型发展。
SuperCLUE模型能力格局
- 横轴(PCA1):代表模型的整体实力,越往右,综合得分越高。
- 纵轴(PCA2):代表模型自身技能树的结构差异,上方模型在稳健型任务上表现突出,下方模型在理科任务上表现更佳。
- 区域解读:右上模型为全能稳健型,右下模型为硬核理科型,左侧模型为综合能力待提升区。
总结
2025年,中文大模型在技术、应用和生态方面取得了显著进展,特别是在数学推理和代码生成任务上,国内模型实现了全球领先。尽管在精确指令遵循和幻觉控制上仍有短板,但整体表现已接近国际水平。未来,随着技术的不断进步和应用场景的拓展,中国大模型有望在更多领域实现突破。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载