2023人工智能大模型在工业领域知识问答稳定性评测报告-中国工业互联网研究院_31页_4mb
报告摘要
人工智能大模型在工业领域知识问答稳定性评测总结
核心内容
本报告由中国工业互联网研究院联合香港科技大学与新华指数共同发布,旨在评估人工智能大模型在工业领域知识问答中的稳定性表现。评测围绕数据、文法、精简表达、扩充表达四大类八个子维度展开,选取了工业领域典型的八大行业,构建了基础知识测试集与变体测试集,对国内外具有代表性的AI大模型进行了深入评测。
主要观点
- 稳定性定义:指大模型在保持高回答准确性的前提下,面对一定参数扰动时仍能维持性能特性的能力。
- 评测体系:涵盖数据、文法、精简表达、扩充表达四大能力维度,共八个子维度。
- 评测方法:通过原问题与变体问题对比测试,题型包括单选题和判断题,评分标准为1分(一致)或0分(不一致)。
- 评测结果:公布了性能前五名的模型,并发布前十名数据,供业界参考。
关键信息
一、数据稳定能力
- 整体表现:国内外头部大模型能力接近90分,数据稳定性较高;国内尾部模型低于50分,提升空间较大。
- 测试样例:
- 原提问:分度头的主轴轴心线能相对于工作台平面向上()和向下 $10^{\circ}$。
- 扰动提问:分度头的主轴轴心线能相对于工作台平面向上 ( )和向下10°。
- 建议:
- 国内尾部模型需引入训练语料、知识库、工具函数集等进行专门强化。
- 工业企业在应用大模型时,应对数据密集型任务进行结果校验,尤其是数据单位的多重描述。
二、文法稳定能力
- 整体表现:GPT-4/3.5在文法稳定性上表现突出,国内外大模型差距较大。
- 测试样例:
- 原判断题:受力物体内一点只要不受力,就不会发生塑性变形。
- 扰动判断题:如果物体内的某点没发生塑性变形,那么该点一定没有受力。
- 建议:
- 国内大模型需提升对逻辑变化和顺序变化的稳定性,加强问题理解能力。
- 工业企业在逻辑密集型场景中应谨慎使用大模型,必要时进行人工校验。
三、精简表达稳定能力
- 整体表现:国内外头部大模型能力在90分左右,尾部模型低于60分,提升空间较大。
- 测试样例:
- 原提问:结合中华人民共和国工业和信息化部钢铁行业生产经营规范,对于钢铁行业,判断正确或错误:一般富氧 $1.0%$,可提高理论燃烧温度 $35 \sim 45^{\circ} \mathrm{C}$,增加喷煤率 $4.0%$。
- 扰动提问:对于钢铁行业,判断正确或错误:一般富氧 $1.0%$,可提高理论燃烧温度 $35 \sim 45^{\circ} \mathrm{C}$,增加喷煤率 $4.0%$。
- 建议:
- 国内尾部模型需加强上下文处理能力和知识提取能力。
- 工业企业在安全操作要求高的场景中应慎重评估大模型的应用能力。
四、扩充表达稳定能力
- 整体表现:国内外头部大模型能力在80分以上,尾部模型低于50分,提升空间明显。
- 测试样例:
- 原提问:噪声最小的织机是()。
- 扰动提问1:噪声最小的织机是(),E、以上选项都相关。
- 扰动提问2:今天天气不太好,噪声最小的织机是()。
- 建议:
- 国内尾部模型需扩大上下文窗口,强化对齐能力。
- 工业企业应通过精确指令和背景信息提升回答稳定性。
行业维度稳定性
- 整体表现:国内大模型整体水平较国外头部模型有较大提升空间。
- 行业差异:
- 国外头部大模型在电子设备行业稳定性表现突出。
- 国内大模型在八大行业知识问答稳定性差距较小,但波动性较大。
评测结论与建议
- 整体结论:国外头部大模型在稳定性表现上优于国内模型,国内大模型在数据稳定、精简、扩充表达方面差距较小,但在文法稳定方面仍有较大提升空间。
- 建议:
- 国内尾部大模型应加强数据、文法、精简表达和扩充表达的稳定性。
- 工业企业应根据应用场景选择合适的模型,并进行结果校验和人工审核。
附录信息
-
评测模型版本:
大模型名称 公司名称 版本信息 Web链接 GPT-4 OpenAI gpt-4-0613 https://chat.openai.com GPT-3.5 OpenAI gpt-3.5-turbo-0301 https://chat.openai.com 通义千问 阿里巴巴 v1.0.5 https://qianwen.aliyun.com 文心一言 百度 v2.2.2 https://yiyan.baidu.com 星火 科大讯飞 v2.0 https://xinghuo.xfyun.cn ChatGLM2 智谱华章 6b https://open/bigmodel.cn Minimax Minimax V5.5 https://api.minimax chat 天工* 昆仑万维 v3.5.20230705.a https://tiangong.kunlun.com 从容* 云从科技 v20230518 https://maas.cloudwalk.com 360智脑 360 V4.0 https://chat.360.cn -
说明:本报告评测模型包括但不限于上述通用大模型,此处仅列举部分效果优异的模型版本信息,排名不分先后。标*处采用Web端测试方式,其余为API调用测试。
后续计划
- 中国工业互联网研究院将联合港科大、新华指数共同发布“中国AI大模型工业应用指数”,推动人工智能技术与实体经济的融合创新。
- 后续将在大模型问答性能、应用安全、标准制定等方面展开研究。
联系方式
- 联系人:叶老师 13661350566
- 吴老师 15210188099
- 地址:北京市朝阳区酒仙桥北路甲10号403号楼
- 电话:010-87901276
- 网址:www.china-aii.com
请注明出处:中国工业互联网研究院。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载