大语言模型综合能力测评报告(2023)-31页
报告摘要
大语言模型综合能力测评报告总结
核心内容
本报告分析了2023年大语言模型的发展背景、产品特征、测评结果及未来展望,涵盖了国内外大语言模型的对比、模型参数规模、训练方式、核心能力、测评维度及结果等。
主要观点
- 大语言模型在2023年进入爆发阶段,国内外厂商纷纷发布大模型产品。
- 模型参数规模是大语言模型研发的门槛,百亿参数是进入该领域的“入场券”。
- 大语言模型研发需要具备数据资源、算法和模型、资金和资源三大要素,其中算法和模型是区分研发能力的核心。
- 大语言模型的综合能力主要体现在语言理解、写作、翻译、知识问答、逻辑推理等方面。
- 写作能力和语句理解是当前大语言模型最擅长的能力板块。
- 国际产品在编程能力方面表现优于国内产品,而国内产品在中文知识问答方面表现更佳。
- 逻辑推理能力整体挑战较大,但国内部分产品在中文特色推理题中表现接近GPT3.5。
关键信息
一、大语言模型发展背景
- 2017年:谷歌推出Transformer模型,为大语言模型奠定基础。
- 2018年:OpenAI发布GPT-1,开启大语言模型的探索阶段。
- 2022年:OpenAI推出ChatGPT-3.5,进入爆发阶段。
- 2023年:微软推出New Bing,Facebook发布LLaMA-13B,谷歌推出Bard和PaLM2,复旦发布MOSS,百度发布文心一言,以及多款国产大模型。
二、大语言模型产品特征和核心能力
- 大语言模型将计算机能力从搜索拓展到认知、学习和行动层面。
- 核心能力包括语言理解、语法结构、知识问答、逻辑推理、代码能力、上下文理解、多模态能力等。
- 写作能力和语句理解是当前大语言模型最为擅长的能力板块。
三、大语言模型产品测评结果和特征
测评维度
| 标号 | 权重 | 一级分类 | 二级分类 | 具体任务 | 测试方法 | 题目类型 |
|---|---|---|---|---|---|---|
| 1 | 70% | 语言模型的准确性 | 语义理解 | 语言理解能力-词句级 | 古诗文识记等 | 知识题 |
| 1 | 70% | 语言模型的准确性 | 语法结构 | 生成连贯文本 | 摘要生成等 | 应用写作题 |
| 1 | 70% | 语言模型的准确性 | 知识问答 | 知识问答、知识误导 | 问答测试 | 知识题 |
| 1 | 70% | 语言模型的准确性 | 逻辑推理 | 数学计算、数学应用题 | 问题测试 | 逻辑推理题 |
| 1 | 70% | 语言模型的准确性 | 代码能力 | 编程题 | 问题测试 | 编程类 |
| 1 | 70% | 语言模型的准确性 | 上下文理解 | 陌生概念的新词理解 | 问题测试 | 知识题 |
| 1 | 70% | 语言模型的准确性 | 多模态能力 | 文生图等 | 问题测试 | 多模态题 |
| 2 | 10% | 数据基础 | - | - | 专家访谈 | - |
| 3 | 15% | 模型和算法能力 | - | - | 专家访谈 | - |
测评结果
| 排名 | 大模型产品 | 综合得分率 |
|---|---|---|
| 1 | ChatGPT | 77.13% |
| 2 | 文心一言 | 74.98% |
| 3 | Claude | 68.29% |
| 4 | 讯飞星火 | 68.24% |
| 5 | Sage | 66.82% |
| 6 | 天工3.5 | 62.03% |
| 7 | 通义千问 | 53.74% |
| 8 | Moss | 51.52% |
| 9 | ChatGLM | 50.09% |
| 10 | vicuna-13B | 43.08% |
四、大语言模型未来展望
- 国内大语言模型能力接近GPT3.5水平,但与GPT4仍存在较大差距。
- 数据和语料门槛、研发经验门槛、芯片门槛是大语言模型发展的关键制约因素。
- 逻辑推理能力是大语言模型的重要能力,但整体表现仍有较大提升空间。
- 多模态能力是少数大语言模型的独特优势,需进一步提升。
- 中文方言理解仍是大语言模型的薄弱环节,整体准确率仅为40%。
总结
本报告全面展示了2023年大语言模型的发展现状和测评结果,揭示了模型在不同能力板块的表现差异,以及国内外产品在技术、数据、资金和人才等方面的差距。同时,报告指出未来大语言模型的发展方向和挑战,为行业提供了有价值的参考。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载