中文大模型基准测评2023年度报告—AI跃迁的2023,中文大模型进展评估-SuperCLUE团队-2023.12.28-49页_2mb
报告摘要
中文大模型基准测评2023年度报告总结
SuperCLUE团队 • 2023年12月28日
核心发展脉络
- 三大阶段:ChatGPT发布后国内形成共识(准备期) → 国内大模型数量质量提升(成长期) → 百模大战形成爆发期,国内模型综合实力赶超国际。
- 代表性模型发布:百川智能Baichuan2、零一万物Yi-34B、清华智谱ChatGLM3等,国内模型在中文场景表现显著优于国外开源模型。
- 闭源与开源生态:大厂(百度、阿里、字节)与创业公司(百川、智谱AI)协同推进,国产大模型进入“大”“强”融合阶段。
SuperCLUE测评体系
- 三大特征:产业与用户双视角、真实用户场景模拟、自动化客观评估。
- 多层次结构:
- 基础能力:专业与技能、语言与知识、传统安全
- 应用能力:工具使用、角色扮演
- 专项测评:智能体、安全、行业基准
- 测评方法:
- SuperCLUE-OPEN:1380余道多轮简答题,考察真实生成能力(权重70%)
- SuperCLUE-OPT:3213道客观选择题,考察标准化准确性(权重30%)
2023年度核心发现
-
国内与国际差距:
- 国外GPT-4-Turbo(90.63分)领先,但11个国内模型(如文心一言40)跨过GPT-3.5基准线(清35分)
- 开源领域:Qwen-72B、Yi-34B性能接近甚至超越GPT-3.5
- 国内均分(6595分)较11月提升9分,差距缩小区。
-
主要发现:
- 能力维度:工具使用(智谱清言83.78)、语言知识(AndesGPT接近90分)、安全(Claude2中文表现最佳、文心一言68分)
- 量级差距:34B模型整体优于13B,但参数非唯一决定因素
- 企业格局:百度、阿里系与创业公司形成生态竞争,大厂在稳定性与综合能力略优
重点推荐模型及适用场景
-
文心一言40(百度)
- 特点:均衡能力,逻辑推理国内领先
- 场景:科研教育、任务规划、代码纠错、查询搜索
-
通义千问20(阿里云)
- 特点:代码能力与专业知识最优
- 场景:金融、医疗等专业垂类,复杂场景任务规划
-
AndesGPT(OPPO)
- 特点:端云协同,移动设备深度适配
- 场景:智能助手、创作工具、日程管理
未来趋势
- 技术迭代:从参数规模转向效能优化,端云协同方案将兴起
- 落地融合:专注行业场景,Agent与安全能力将成为破局关键,行业基准将促进供需精准对接
- 生态共建:SuperCLUE计划开放行业测评基准建设,推动开发者生态完善
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载