中文大模型基准测评2025年5月报告
报告摘要
SuperCLUE 2025年5月中文大模型基准测评报告总结
报告概述
该报告由SuperCLUE团队发布,旨在量化2025年上半年通用人工智能(AGI)的进展,聚焦中文大模型的阶段性评估。报告使用动态更新的SuperCLUE基准体系,覆盖从基础能力到多模态和应用功能的全方位测评框架,强调独立第三方客观性。评测包括1579道原创问题,用以评估模型在数学推理、科学推理、代码生成、智能体Agent、精确指令遵循和文本理解与创作六大维度的表现。
主要进展与趋势
- 2025年大模型发展分五个阶段:准备期、跃进期、繁荣期、深化期和融合期。海外模型(如GPT系列、Gemini、Claude)继续保持领导地位,伴随着模型能力边界突破和智能体技术深耕。
- 国内模型反应迅速,多家企业加入开源和闭源竞争,推理性能显著提升。重点领域如文本生成和端侧小模型表现出色,部分领域缩小与海外差距,但指令遵循和复杂推理仍是短板。
- 小参数模型(如Qwen系列)在推理任务中超越许多闭源模型,展示了高性价比,推动AI普惠。
测评体系分析
- SuperCLUE基准每2个月Live更新题库和评价方式,减少数据污染风险,与用户交互方式一致。
- 测评体系包括通用基准、文本专项、多模态、推理、Agent等多个子基准,采用混合评估方法(如人工校验、代码测试),确保全面性和客观性。
- 评价方式包括分数标准化和并列处理,适应题目得分分布。
总体测评结果
- 领先者:OpenAI的o4-mini(high) 总分70.51分,遥遥领先,尤其在代码生成(91.52)和推理任务表现卓越。
- 国内亮点:国内模型在文本创作(如Doubao-1.5-thinking-pro-250415得分81.04)和数学推理(部分模型逼近国际水平)中崛起,但指令遵循整体得分较低(国内第一为36.97,与海外领先差距达31.1分)。
- 能力分布不均:各维度得分差异大,例如数学推理高维模型得分高但低分段差距显著,反映出模型开发需平衡多方面能力。
- 性价比分析:国产小参数模型(如DeepSeek-R1、Qwen系列)以低成本提供高质量输出,在推理和效能比上竞争力强。
- 模型象限定位:o4-mini(high) 等海外模型主导“卓越领导者”象限,国内模型则偏向“技术领跑者”和“潜力探索者”,显示不同发展路径。
国内模型成熟度评估(SC指数)
依据国内闭源模型表现,文本理解与创作成熟度最高(SC指数0.91),代码生成和智能体Agent中等(0.68-0.51),而数学、科学推理和指令遵循低成熟度(0.38-0.42),需加强研发。
一致性和未来建议
- 测评与Chatbot Arena人类偏好投票高度相关(皮尔逊相关0.86、斯皮尔曼0.89),验证了基准的可靠性。
- 建议模型开发者优先提升指令遵循和多模态能力,小参数模型可作场景适配首选。未来AGI进展需持续关注能效优化和实际应用落地。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载