2024-03-23-中国工业互联网研究院-人工智能大模型工业应用准确性测评报告_22页_4mb
报告摘要
人工智能大模型工业应用准确性测评(2024年3月版)总结
1. 报告背景
本报告由中国工业互联网研究院联合香港科技大学、中国经济信息社发布,测评了国内外具有代表性的大模型在工业领域的应用性能,涵盖知识问答、工程建模、数据分析、文档生成、代码理解五大场景。
2. 测评目标与方法
- 测评场景:新增工程建模、数据分析、文档生成、代码理解等场景,结合调研构建测试数据集。
- 得分方法:通过人工客观题测试、步骤赋分、最终归一化处理评分,依赖GPT-4辅助生成标准答案与判分标准以确保科学性和保密性。
3. 测评结果
- 综合排名:GPT-4国际领先,国内模型如文心一言、ChatGLM表现优异甚至超越GPT-3.5。
- 各场景亮点:
- 工业知识问答:国内模型优势明显,建材、采矿领域表现突出。
- 工程建模:GPT系列领先,建模能力和数学推理需优化。
- 数据分析:文心一言表现优秀,但准确度整体偏低。
- 文档生成(总结):国内领先,应用于摘要效果佳;观点分析需强化。
- 代码理解:GPT-4与文心一言优势显著,识别安全风险能力较强。
4. 总体评价与建议
- 国内模型在工业知识问答、文档总结等领域已有超越国际领先的趋势;在工程建模、代码理解、“观点分析”等场景仍需提升。
- 全面提升模型对工业语料的训练覆盖面、行业知识储备,提高小样本学习能力,加强代码与多模态能力支持等。
5. 后续计划
- 汇聚高质量工业语料支持模型训练;
- 增加多模态(图像、视频理解等)能力测评;
- 围绕“代码解释器”等模块挖掘更深层场景潜力;
- 推行重点行业大模型推荐目录建设,促进工业场景应用广泛化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载