2023-09-29-中国工业互联网研究院-2023人工智能大模型在工业领域知识问答稳定性评测报告_31页_4mb
报告摘要
报告分析总结:人工智能大模型工业领域知识问答稳定性评测
目标与方法
本报告由中国工业互联网研究院联合香港科技大学及新华指数共同研究,通过选取八大典型工业行业,构建基础与变体测试集,围绕数据、语法规则、精简表达和扩展表达四大维度的八大子项,对国内外代表性大模型进行了深入评测。选取性能前五的模型结果予以公布,并提供前十名数据供业界参考。
主要结论
- 国内外头部大模型在数据稳定、精简表达及扩展表达方面的性能差距较小,但国内模型在语法规则稳定性方面仍有提升空间。
比如对于文本内容或逻辑变化的适应能力,国外模型表现更为优异。特别是在逻辑判断、表达顺序和否定转换方面,国内模型需进一步加强理解力和处理能力。
-
国内大模型在钢铁、采矿、装备制造业等领域的应用与国外差距较小,而在石化、电力等行业还有较大提升空间。这一点反映了国内大模型在特定垂直领域的适应能力和知识局限性。
-
国内头部大模型的数据稳定能力与国际领先模型接近,但仍存在一定差距,尤其在数据单位单位等细节问题上。国内尾部模型的数据处理能力甚至低于及格线水平,需要专门的优化和训练数据强化。
此外,报告还指出国外大模型在电子设备等行业表现突出,而国内模型在不同行业的表现存在分化。
行业建议
针对测评结果及行业特点,报告提出以下建议:
-
数据处理:在高密度数据任务中,应优先使用数据稳定性能较强的大模型,并对输出结果进行多重校验,特别是涉及单位差异的情况。
-
文法稳定性:对于逻辑判断密集型任务需谨慎使用国内模型,而在单纯的文本整理等任务中可尝试应用。
-
精简表达:在安全操作规程等关键场景,应当加强人工校验,确保模型输出的安全性和准确性。
-
扩展能力:对于复杂行业知识,应使用提示工程(Prompting)优化上下文,提升回答质量;同时,模型开发者应扩展上下文窗口并增强关键信息提取能力。
-
尾部模型改进:需在训练数据、知识库和工具函数等方面进行全面优化,以提升模型的整体性能。
总结
总体上,国际领先的大模型在稳定性方面表现优异,而国内模型在部分核心能力上仍需追赶。报告建议各大模型供应商加强稳定性的专项优化,并建议企业在应用大模型知识问答功能时,应根据具体场景和模型特性做出审慎选择。未来应进一步推动产业标准的建立及国内外技术的交流融合,以促进人工智能技术在工业领域的深度应用。
试读结束,高清完整版pdf/doc/ppt,请点下载