清华大学:superBench大模型综合能力评测报告_2024年3月__24页_1mb
报告摘要
SuperBench 大模型综合能力评测报告(2024年3月版)总结
一、大模型能力发展时间线
-
语言理解阶段(2018-2021)
- 早期语言模型聚焦自然语言理解任务(如分词、句法分析),代表性模型包括BERT、GPT、T5等。
-
代码生成阶段(2021-2023)
- 随着语言模型能力增强,代码模型兴起。CNN等新闻媒体曾报道模型在代码生成任务中展现出强大的逻辑推理能力,代表性模型包括Codex、CodeLLaMa、CodeGeeX等。
-
对齐与规划阶段(2022-2024)
- 研究重心转向模型对人类指令的理解与偏好对齐,代表性工作包括InstructGPT、ChatGPT、AutoGPT、AutoGen等。强调模型在复杂任务中的规划与执行能力。
-
智能体与安全阶段(2023至今)
- 研究开始关注模型的安全性、价值观判断与伦理道德,如偏见识别、隐私保护、违法内容防范等。代表性模型包括Claude-3、GLM-4、GPT-4 Turbo等。
二、SuperBench评测体系
SuperBench团队推出五大核心评测基准,覆盖五大类能力维度:
-
语义理解能力
- 极具挑战的双语复合评测,Claude-3、GLM-4、文心一言40位居前列。
-
代码编写能力
- 编程任务涉及Python、Java等多语言,GPT-4系列在英文指令场景领先,国内模型如GLM-4、文心一言40表现优异。
-
人类对齐能力
- 测评模型对指令的响应质量、有用性和综合能力,GPT-4网页版居首,国内模型在中文语境下表现接近甚至领先。
-
智能体能力
- 模拟操作数据库、网页浏览器、游戏角色等多类情境任务,Claude-3、GPT-4系列仍领先,国内模型GLM-4表现突出。
-
安全与价值观能力
- 评估模型对偏见、攻击性、隐私保护等的识别与响应,文心一言40表现最佳,国内头部模型与国际模型差距逐渐缩小。
三、主要模型排名概述
-
国外模型:
- Claude-3、GPT-4系列在语义、代码、智能体等方面仍处顶尖。
-
国内模型:
- 第一梯队:GLM-4(智谱华章)、文心一言40(百度)、讯飞星火35、通义千问21。
- 第二梯队:Kimi-chat、云雀大模型、百川AI。
国内头部模型在语义理解、人类对齐等任务中表现出色,尤其在中文任务中具备优势,但在代码生成和智能体交互方面仍有较大发展余地。
四、SuperBench的价值主张
- 开放性与动态性:评测数据集持续更新,兼顾公开与秘密测试题,防止模型刷题。
- 第三方公益性:由清华大学和中关村实验室联合发布,保持独立、公正性,不为商业利益导向。
- 科研与产业结合:服务模型研发优化和行业特定评测,推动AGI发展。
总结
SuperBench作为支撑大模型评测的权威平台,覆盖了从语言能力到安全伦理的多维场景,支持海内外代表模型的公平对比。报告显示,国际领先模型(如Claude-3、GPT-4)在综合能力上仍占优势,但国内头部模型已迅速追赶,特别是在中文语境和对齐任务中表现亮眼。未来评测将持续优化,助力AI技术的规范化发展和实际应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载