2023-07-11-中国工业互联网研究院-通用人工智能大模型工业领域知识问答性能评估_29页_3mb
报告摘要
工业领域知识问答评测报告总结
报告概述
本报告由中国工业互联网研究院发布,评估了人工智能大模型在工业领域的知识问答性能。评估涵盖八大工业行业,包括电子设备制造、装备制造业、钢铁行业、采矿行业、电力行业、石化化工业、建材行业和纺织行业。
评测方法
- 测试范围:选取八大工业行业,构建行业知识测试集。
- 评分标准:包含客观题(选择题和判断题)和主观题(三维度简答题)。
- 客观题权重为70%。
- 主观题权重为30%,包括基础能力、语句能力和概括能力。
- 最终得分在100分制下进行归一化处理。
- 测评模型:包括GPT4、GPT3.5、文心一言、ChatGLM、360智脑、天工大模型等。
测评结果分析
模型维度
- GPT4在整体表现上领先,尤其在工业知识问答中优势明显。
- 国内头部模型与GPT3.5水平相当,部分已有赶超迹象。
行业维度
- 电子设备与装备制造业表现最优,综合得分最高。
- 纺织、采矿和电力行业的问答准确率相对较低,需进一步优化。
多维能力分析
- 客观题:准确率提升空间较大,GPT4和文心一言表现较优。
- 主观题:
- 基础能力、语句能力和逻辑能力方面,国内模型与GPT4差距较小。
- 概括能力和语句通顺性需加强,尤其在专业性强的行业中。
- 自我认知能力:GPT4优于国内模型,能主动识别知识盲区。
- 违背常理问题识别能力:在识别“污染问题”方面,GPT4领先,国内模型表现薄弱。
总结与建议
- 当前现状:通用大模型在工业知识领域的应用尚处初级阶段,GPT还处于领先地位,国内模型与之尚有差距。
- 存在问题:模型对行业知识的泛化能力较弱,尤其在专业性强或数据覆盖较少的行业中。
- 改进建议:
- 扩充训练数据,提高行业专业知识覆盖率。
- 优化模型结构,提升逻辑推理与输入合理性判断能力。
- 加强模型对自身能力的识别和反馈能力。
下一步计划
中国工业互联网研究院计划持续推进多维度评测工作,涵盖模型的鲁棒性、安全性、AI价值观等方面,期待与各界合作。
联系方式
- 联系人:叶老师、吴老师、何老师
- 联系电话:请参考报告内相关信息
- 地址:北京市朝阳区酒仙桥北路电子城IT产业园D3楼
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载