2025-03-20-SuperCLUE-中文大模型基准测评2025年3月报告_46页_20mb
报告摘要
中文大模型基准测评2025年3月报告总结
-
关键进展与趋势
2025年大模型快速发展,中国模型在通用能力上逐步缩小与海外的差距,DeepSeek-R1将国内外Top1差距从15.05%缩小至7.46%。 -
SuperCLUE基准测评
报告包含六大测评维度(数学推理、科学推理、代码生成、智能体Agent、精确指令遵循、文本理解与创作),采用动态Live更新机制,确保与时偕行。 -
推理模型表现
DeepSeek-R1在总榜与推理任务榜单上分别以70.34分、78.97分领先,推理能力与Claude 3.7 Sonnet、Gemini-2.0 Flash Thinking差距逐渐缩小。QwQ-32B以79.15分紧随其后。 -
价格与效能
国产模型如DeepSeek-R1、QwQ-32B在性价比上优势明显,Claude 3.7 Sonnet因高性能API价格较高,属于低性价比。海外GPT-4o Mini保持高性价比。 -
小模型与蒸馏模型表现
DeepSeek-R1蒸馏系列(如7B、14B)在数学推理上已超越众多闭源模型,性价比极高。10B级别模型DeepSeek-R1-Distill-Qwen-7B表现最佳。 -
国内成熟度指数(SC指数)
国内模型在文本理解与创作表现最佳(0.89),科学推理次之(0.69),数学推理和指令遵循差距明显(<0.5)。 -
DeepSeek-R1专项分析
在第三方平台中表现稳定,联网搜索和稳定性测试中腾讯元宝、字节火山引擎等平台回复率最优;API使用中Together.ai生成效率最高。 -
总体结论
国产模型在加速追赶,特别是DeepSeek、Qwen、讯飞等在推理和应用侧表现出色。Small模型和蒸馏技术大幅降低大模型应用门槛,推动国产生态普惠。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载