人工智能大模型工业应用准确性测评-2024.3-22页_4mb
报告摘要
2024年大模型工业应用准确性测评
这份报告由 中国工业互联网研究院、香港科技大学、中国经济信息社 联合发布,是评测人工智能大模型在工业领域应用能力的重要文献。
本报告基于工业知识问答、数据分析、工程建模、文档生成、代码理解等五大核心场景的测试,对国内外代表性大模型进行了综合评估,并对各细分领域的能力进行了横向对比。测评结果显示:
- 知识问答:国内模型表现亮眼,部分对 GPT-4 已实现超越,优势体现在建材、采矿等特定行业。
- 工程建模、代码理解:GPT-4 领先,但建模与代码场景整体得分仍较低,反映出模型在复杂任务中的结构化处理能力不足。在 工程建模 方面,国内外平均得分仅43分,差距明显。
- 数据分析、文档生成(总结):基础能力尚可,国内模型如文心一言、GPT-4 表现较优,但 文档生成(观点分析、代码理解、工程建模) 仍需提升。其中,文档生成(总结)场景表现较好(如87分),但观点分析与建模能力待强化。
总的来看,GPT-4 综合能力和工程建模、知识问答等场景仍领先;中国在文档生成、数据分析等场景具备优势,但在需要强逻辑推理与数学建模的能力中还有追赶空间。结合当前趋势,国内多个模型半年内实现进化,差距缩小明显。
未来规划包括采集更多工业高质量语料用于训练,拓展多模态能力(图像、视频等),优先优化工程建模、观点分析等应用场景,推动国产大模型在工业领域的实际落地应用。
附录简述:
报告附有大模型列表,包括 GPT-4、Claude、Ernie、Spark、Gemini 等版本信息,并通过严谨的评分与挑战题验证模型表现。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载