中文大模型基准测评2025年3月报告_46页_17mb
报告摘要
2025年3月SuperCLUE测评报告总结
主要进展与趋势
- 大模型发展:2025年大模型进入深化期,国内外机构在推理、多模态和应用领域有实质性突破。
- 差距缩小:国内外TOP大模型能力差距从2023年5月的15.05%缩小至2025年3月的7.46%。DeepSeek-R1的发布贡献了这一缩小。
- 模型多样性:国内模型如DeepSeek-R1、Qwen系列、讯飞星火等迅速迭代,海外模型如o3-mini(high)、GPT-4.5等持续领先。
通用能力测评基准
- 基准特征:SuperCLUE是独立、动态更新的测评基准,涵盖通用能力、文本专项、多模态和推理维度。
- 测评维度:包括数学推理、科学推理、代码生成、智能体Agent、指令遵循和文本理解与创作。
- 评价方式:基于人工校验、代码单元测试和规则脚本的综合评估,强调客观性。
测评结果与分析
- 整体表现:
- o3-mini(high) 总分76.01,数学推理近满分,指令遵循能力领先。
- DeepSeek-R1 总分70.34,排名国内第一,数学推理和指令遵循表现优异。
- 国内模型整体进步显著,QwQ-32B、 Claude 3.7 Sonnet等也表现强劲。
- 推理模型:
- 国内排名前三模型(DeepSeek-R1、QwQ-32B)平均分78.04,领先海外市场。
- 数学推理能力强,但科学推理和代码任务需优化。
- 性价比:
- 国产模型提供高性能且价格优势明显(如DeepSeek-R1、QwQ-32B)。
- o3-mini(high)性价比如中,Claude系列性价比较低。
- 能力成熟度(SC指数):
- 文本理解与创作成熟度高(>0.8)。
- 科学推理和代码中成熟度(0.5–0.8)。
- 数学推理和指令遵循低成熟度(0.2–0.5)。
- 智能体Agent极低成熟度(<0.2)。
- 开源与小模型:
- DeepSeek-R1系列蒸馏模型(如14B版)数学推理得79.46分,超越闭源模型。
- 小模型如Qwen2.5-3B-Instruct在端侧应用中效率高。
DeepSeek-R1与DeepSeek系列深度分析
- R1表现:
- 推理能力突出,尤其数学和代码任务领先。
- 与国际顶级模型相比仍有差距,科学推理需加强。
- 第三方测试:
- 联网搜索能力在腾讯元宝、Perplexity等平台表现稳定。
- 稳定性测试显示付费API性价比高,回复和准确率更佳。
总体结论
综述展示中文大模型研发快速进展,国内模型正逐步缩小与国际的差距,强推理能力和高性价比是核心优势,但智能体Agent和科学推理依然是短板。SuperCLUE为模型发展提供有效评估方向。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载