2023中国大模型行研能力评测报告_53页_4mb
报告摘要
中国大模型行研能力评测报告总结
1. 评测背景与目标
- 头豹研究院联合沙利文通过百人分析师团队匿名投票机制,筛选12个主流大模型进行综合评测。
- 目标:评估大模型在行研报告撰写、模型基础能力及行业理解能力的表现,梳理中国大模型在行业研究中的应用价值和发展潜力。
2. 评测方法
- 分为三大核心模块:报告撰写能力(权重40%)、模型基础能力(权重30%)、行业理解能力(权重30%)。
- 采用双盲机制,由20人资深研究团队围绕1,800+题目进行为期四周的测试,确保公正性。
- 报告撰写能力基于“8-D方法论”(定义、分类、行业特征、发展历程、产业链、市场规模、政策分析、竞争格局),权重为100%。
3. 核心结果
-
报告撰写能力:
- 排名第一:商汤商量、科大讯飞星火、文心一言3.5。
- 表现亮点:在产业链、竞争格局、市场规模等高阶难度模块表现突出;低阶模块得分较高,行业定义与分类表现稳定。
- 局限性:部分模型因信息库更新不足或答案完整性问题失分较多,如GPT-3.5因信息过时导致高权重模块表现不佳。
-
模型基础能力:
- 排名第一:商汤商量、GPT-3.5、文心一言3.5。
- 优势领域:逻辑推理、知识储备、文本生成表现优异。
- 波动性:天工和智谱清言在单一模块表现突出,但整体稳定性不足。
-
行业理解能力:
- 排名第一:GPT-3.5、文心一言3.5、智谱清言、商汤商量。
- 行业表现:GPT-3.5在互联网科技、金融、医疗等14个行业普遍优异;国产模型在特定行业有优势,如文心一言在零售业分析中得分领先。
4. 发现与建议
- 优势:头部模型在报告撰写与行业分析中能生成结构化、高价值内容,提升研究效率,尤其在信息溯源和文本校对辅助方面表现突出。
- 挑战:
- 小模型因知识库陈旧、信息整合能力弱,在高阶模块表现不稳定。
- 行业细分领域分析需模型具备专业的领域知识储备,如医疗、能源等需要深度数据支持。
- 建议:
- 国产模型需加强知识更新与多行业覆盖;
- 企业应甄别不同场景下的模型适配性,避免因信息滞后导致分析偏差。
备注:排名基于2023年11月15日至11月30日评测结果,模型版本截至报告发布前,部分未公开模型未纳入评估。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载