2024-05-07-清华大学-superBench大模型综合能力评测报告_2024年3月_24页_1mb
报告摘要
SuperBench大模型综合能力评测报告(总结)
核心背景
SuperBench致力于构建可客观、科学衡量大模型能力的评测体系,推动大模型健康发展。
大模型能力趋势
- 从2018-2023年:从自然语言理解能力向语义对齐、代码能力、智能体能力、安全性跨领域迁移
- 未来重点:模型可控性与价值观评估、通用人工智能(AGI)路径探索
评测体系构成
采用5大能力维度:
- 语义理解
- 代码能力
- 人类对齐
- 智能体能力
- 安全评测
关键发现(2024年3月版)
国际模型表现
- GPT-4系列:在语言理解、数学、数学-科学类任务综合领先
- Claude-3:展现全面提升,尤其突出于语义理解、安全合规
国内模型表现
- 头部模型:混合智能模型(GLM-4)、文心一言4.0表现优秀,接近国际领先水平
- 有力追赶者:通义千问、Yi(零一万物)、百川智能等表现稳步提升
具体能力维度
- 语义理解:国内顶级模型表现仅落后国际模型3分以内
- 代码能力:整体水平偏低,国内外先进模型1次通过率不足50%
- 智能体/角色扮演:国内外所有模型表现较弱,尚难作为实用代理
- 安全能力:文心一言4.0总分领先,国内“顶级+头部”模型在偏见判断优于国际大模型
整体结论
GPT-4和Claude-3仍是处在第一梯队的国际领先大模型。中国头部大模型在语言能力和基础应用上已初具世界竞争力,但在代码生成和智能体交互维度尚需追赶。总体而言,国内与国际先进水平差距正在缩小中。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载