2024人工智能大模型工业应用准确性测评报告-v3.5-中国工业互联网研究院_22页_4mb
报告摘要
2024年3月版人工智能大模型工业应用准确性测评报告总结
一、报告背景与目标
为贯彻国家人工智能发展战略,中国工业互联网研究院联合港科大、中国经济信息社开展测评。基于工业场景需求,本次报告在原有知识问答基础上新增数据分析、工程建模、文档生成、代码理解四大测评维度,构建工业语料库,对国内外典型模型进行评估,形成综合排名及场景分析。
二、测评方法与数据
- 测评流程:采用问答题为主,由大模型自评生成评分标准,经人工校验后实施。
- 题目设置:
- 知识问答:144题
- 数据分析:20题
- 工程建模:100题
- 文档生成(总结):40题
- 文档生成(观点分析):150题
- 评分规则:按步骤赋分,最后进行归一化处理,各场景得分取平均值。
三、综合测评结果
- 总体排名:GPT4处于绝对领先地位,国内模型中文心一言、ChatGLM紧随其后;多款国内模型(如文心一言、星火35、通义千问等)综合能力超GPT35,但未达GPT4水平。
- 场景得分对比:
- 工业知识问答:国内平均52分(国际41分)
- 工程建模:国内外平均43分
- 数据分析:国内平均53分(国际56分)
- 文档生成(总结):国内87分(国际85分)
- 文档生成(观点分析):国内65分(国际71分)
- 代码理解:国内平均45分(国际51分)
四、场景分析
- 工业知识问答:
- 国内模型在建材、采矿行业表现突出,装备制造、钢铁行业与国际接近。
- 应用场景包括员工培训、故障诊断、售后服务、市场调研等。
- 工程建模:
- 国内外平均分均为43分,建模能力整体偏低。
- 应用场景涵盖成本模型建立、生产计划优化、人员排班、营销收益分析等。
- 数据分析:
- 文心一言与GPT4、Mistral构成第一梯队,但整体表现偏弱。
- 应用包含产品评价分析、时序数据异常检测、库存预警、安全数据分析等。
- 文档生成:
- 文档生成能力成熟度较高,技术方案、操作手册、运行报告等场景表现优异。
- 观点分析能力尚处及格水平,需加强逻辑推理与批判性思考。
- 代码理解:
- GPT4和文心一言优势明显,但国内外模型代码安全检测能力均需提升。
- 应用场景涉及代码生成、错误检测、注释生成、工控代码审查等。
五、能力对比与发展趋势
- 国内模型在知识问答、文档生成领域已超GPT4,工程建模存在明显差距。
- 相较2023年下半年,国内模型能力提升显著,尤其在数据分析、代码理解等场景。
- 专业领域储备不足:钢铁、电力行业知识储备良好,纺织、装备制造等行业需加强训练。
六、问题与建议
- 现存不足:
- 工程建模、代码理解等场景能力待提升
- 数学建模专业语料储备不足
- 观点分析存在逻辑偏差风险
- 改进方向:
- 汇聚高质量工业语料库支持模型训练
- 引入代码解释器等工具增强建模能力
- 完善观点分析评分标准,提升逻辑性
- 建议开展多模态测评(如图像识别、视频理解)探索更多工业场景
七、附录要点
- 测试模型涵盖GPT4、文心一言、星火35、通义千问等国内外主流大模型
- 评分规则强调:①避免随机答案 ②增强过程评价 ③确保评分一致性 ④提升判分效率
报告指出尽管测评结果具有参考价值,但因模型迭代快、技术复杂,可能存在分析不足,建议业界持续关注模型优化及场景适配研究。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载