人工智能大模型工业应用准确性测评报告-中国工业互联网研究院_22页_4mb
报告摘要
2024年3月版人工智能大模型工业应用准确性测评报告分析如下:
一、背景与目标
本报告旨在贯彻落实国家人工智能发展战略,联合中国工业互联网研究院、香港科技大学及中国经济信息社,研究大模型在工业领域的应用性能、技术架构及标准体系。通过调研工业企业实际需求,在原有工业知识问答测评基础上,新增数据分析、工程建模、文档生成、代码理解四大场景,构建测试数据集对国内外代表性大模型进行测评,为行业提供参考。报告测评结果经专家论证,但受限于模型迭代速度和技术复杂性,分析可能存在不足,结果仅适用于测试期间。
二、测评内容
测评聚焦工业重点行业,利用国家工业互联网大数据中心语料库支撑测试。新增场景包括:
- 工业知识问答:覆盖员工培训、故障诊断、客服咨询等,提升知识获取与工艺优化能力。
- 工程建模:基于数学建模技术解决生产规划、异常检测、人员排班等问题。
- 文档生成:包括技术文档、操作手册等,辅助设计与运维效率。
- 代码理解:涉及代码安全审查、功能检测及注释生成,增强编程能力。
三、测评方法
- 流程:以问答题为主,通过大模型判分并按步骤赋分,确保评分一致性。
- 数据与评分:
- 题目数量:知识问答144道,工程建模100道,数据分析20道,文档生成40道,代码理解150道,考察要点总量相近。
- 评分标准:由GPT4整理标准答案并人工校验,按步骤赋分,最终归一化处理。
- 评分规则:
- 题目抽取需符合场景需求,得分依据细则分项计算,场景得分取各小项平均。
- 综合评分由各场景算术平均分得出,避免信息泄露并减少误差。
四、测评结果
- 综合排名:
- GPT4在综合能力上领先,国内文心一言、ChatGLM紧随其后;部分国内模型(如文心一言、ChatGLM、星火35、通义千问)综合能力超过GPT35。
- 国外模型普遍优于国内,但差距逐季缩小。
- 能力对比:
- 工业知识问答:国内模型优势显著,建材、采矿行业表现突出;钢铁、电力行业知识储备较强,纺织、装备制造需加强。
- 工程建模:GPT4与文心一言领先,国内外平均分相近(43分),建模能力整体偏低,需强化专业语料训练。
- 数据分析:文心一言、GPT4及Mistral处于第一梯队,国内外平均分分别为53与56,但均存在信息遗漏或偏差风险。
- 文档生成:国内外模型在要点总结场景成绩接近满分(国内87,国际85),观点分析场景国内平均65,国际71,需提升逻辑推理能力。
- 代码理解:GPT4与文心一言表现突出,国内平均45分,国际51分,代码解析能力需优化。
五、场景分析
- 工业知识问答:国内模型在多行业实现领先,尤其在建材、采矿领域优势显著,但装备制造、化工行业仍需提升。
- 工程建模:国内外模型在基础数学建模能力接近,但实际应用中存在逻辑漏洞或模型缺陷,需结合代码解释器等工具增强。
- 数据分析:模型可提取数据结论,但描述准确性不足,建议通过微调或提示词优化提升效果。
- 文档生成:要点总结任务表现稳定,观点分析仍需强化,尤其关注逻辑性及行业知识匹配度。
- 代码理解:国内模型在代码安全审查和功能检测上与GPT4差距缩小,但整体代码逻辑掌握仍显薄弱。
六、总体评价与规划
- 当前不足:工业知识问答、工程建模、代码理解等场景成熟度较低,需针对性优化;国内外模型在部分行业知识储备差异明显。
- 趋势:国内大模型近半年能力显著提升,尤其在知识问答和文档生成领域,部分场景已接近或赶超GPT4。
- 后续计划:
- 构建工业知识语料库支持模型训练;
- 开展多模态能力测评(如图像、视频识别);
- 针对低成熟度场景提供稳定性与准确性优化指导;
- 在重点领域推动行业大模型推广与应用。
附录包含测评模型版本号及评分规则说明,如以GPT35为基准计算国内模型相对成绩,采用问答题步骤评分以提高科学性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载