大语言模型综合能力测评报告(2023)-30页
报告摘要
大语言模型综合能力测评报告总结
核心内容
本报告分析了2023年大语言模型的发展背景、产品特征、测评结果及未来展望,重点探讨了模型在不同任务上的表现与挑战。
主要观点
- 大语言模型的发展经历了诞生、探索和爆发三个阶段,2023年是其进入爆发阶段的关键年份。
- 国内外厂商在大语言模型领域均有显著进展,国际模型如GPT-4参数规模达到5万亿以上,而国内模型如百度Ernie 3.0和华为盘古也达到百亿级别。
- 大语言模型研发需要数据资源、算法模型和资金资源三大要素,其中算法和模型是区分模型能力的核心要素。
- 模型的参数规模、训练计算量和数据集的丰富性是影响其性能的关键因素,模型在参数规模达到一定程度后,性能和能力会显著提升。
- 大语言模型展现出强大的中文创意写作能力,尤其在商务写作和文学题方面表现优异。
- 在编程能力方面,国际产品如Claude表现优于国内产品,而国内产品在中文知识题上表现更优。
- 多模态能力和中文方言理解仍是大语言模型的薄弱环节,需要进一步提升。
- 逻辑推理能力是大语言模型的重要挑战,国内部分产品表现接近GPT-3.5水平,但仍与GPT-4存在差距。
关键信息
大语言模型产品测评结果
| 排名 | 大模型产品 | 综合得分率 |
|---|---|---|
| 1 | ChatGPT | 77.13% |
| 2 | 文心一言 | 74.98% |
| 3 | Claude | 68.29% |
| 4 | 讯飞星火 | 68.24% |
| 5 | Sage | 66.82% |
| 6 | 天工3.5 | 62.03% |
| 7 | 通义千问 | 53.74% |
| 8 | Moss | 51.52% |
| 9 | ChatGLM | 50.09% |
| 10 | vicuna-13B | 43.08% |
大语言模型综合测评题库分布
| 题目类别 | 问题总量 | 分类 | 题目数 |
|---|---|---|---|
| 知识题 | 60 | 科学常识 | 8 |
| 历史常识 | 7 | ||
| 医学常识 | 5 | ||
| 法律常识 | 5 | ||
| 地理常识 | 7 | ||
| 生活常识 | 8 | ||
| 娱乐明星 | 5 | ||
| 购物推荐 | 10 | ||
| 商业常识 | 5 | ||
| 词句理解题 | 40 | ||
| 逻辑推理题 | 38 | ||
| 编程类 | 60 | ||
| 翻译题 | 15 | ||
| 多模态 | 7 | ||
| 上下文理解 | 10 | ||
| 安全和隐私 | 10 |
各类题目得分率
| 题目类别 | 得分率 | 国际最高分率 | 国内最高分率 |
|---|---|---|---|
| 安全和隐私 | 95.50% | - | - |
| 商务写作 | 78.68% | - | - |
| 文学题 | 75.50% | - | - |
| 语句理解题 | 72.63% | - | - |
| 翻译题 | 68.33% | - | - |
| 知识题 | 65.07% | - | - |
| 编程题 | 64.59% | - | - |
| 逻辑推理题 | 34.74% | - | - |
| 多模态 | -0.71% | - | - |
各类题目细分得分率
-
商务写作题:
- 访谈提纲:95%(国际最高分率100%,国内最高分率100%)
- 市场分析报告:83.33%(国际最高分率100%,国内最高分率100%)
- 市场运营报告:90%(国际最高分率100%,国内最高分率100%)
- 视频脚本:75%(国际最高分率100%,国内最高分率92.85%)
- 营销文案写作:97.14%(国际最高分率100%,国内最高分率100%)
- 邮件写作:95%(国际最高分率100%,国内最高分率100%)
-
文学题:
- 对联题:55%(国际最高分率100%,国内最高分率90%)
- 简单写作题:91%(国际最高分率96%,国内最高分率96%)
- 诗词写作题:78%(国际最高分率90%,国内最高分率90%)
- 中文特色写作题:71%(国际最高分率100%,国内最高分率100%)
-
知识题:
- 医学常识:86%(国际最高分率90%,国内最高分率90%)
- 购物推荐:85%(国际最高分率90%,国内最高分率90%)
- IT知识问答:82.67%(国际最高分率96.67%,国内最高分率93.3%)
- 法律常识:68%(国际最高分率80%,国内最高分率80%)
- 地理常识:63.57%(国际最高分率71.43%,国内最高分率78.57%)
- 商业常识:55%(国际最高分率70%,国内最高分率70%)
- 历史常识:50.71%(国际最高分率64.28%,国内最高分率71.42%)
- 科学常识:46.88%(国际最高分率56.25%,国内最高分率62.25%)
- 娱乐明星:24%(国际最高分率20%,国内最高分率60%)
-
编程题:
- 代码自动补全:41.67%(国际最高分率36.60%,国内最高分率50%)
- 错误提示和修复:82.50%(国际最高分率86.11%,国内最高分率83.33%)
- 软件安装及环境:65%(国际最高分率70.00%,国内最高分率70%)
- Android相关:74.38%(国际最高分率94%,国内最高分率75%)
-
逻辑推理题:
- 商务制表题:26.00%(国际最高分率50.00%,国内最高分率50%)
- 数学计算题:26.50%(国际最高分率55.00%,国内最高分率45.00%)
- 数学应用题:39%(国际最高分率85.71%,国内最高分率86%)
- 幽默题:55.00%(国际最高分率79%,国内最高分率75%)
- 中文特色推理题:31.67%(国际最高分率44.44%,国内最高分率61.11%)
未来发展展望
-
国内大语言模型发展挑战:
- 虽然国内大语言模型在中文知识和写作能力上表现优异,但整体上仍与GPT-4存在较大差距。
- 数据和语料门槛、研发经验门槛以及芯片门槛是当前国内大语言模型面临的主要挑战。
-
能力提升方向:
- 提升逻辑推理和编程能力,特别是代码自动补全和数学应用题。
- 加强多模态和方言理解能力,以应对更复杂的应用场景。
- 增强人类情感共情能力,使模型能够更好地理解和回应人类情感需求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载