2023-06-13-新华社-人工智能大模型体验报告(2023)_61页_5mb
报告摘要
人工智能大模型体验报告总结
核心内容
人工智能正引领新一轮科技革命和产业变革,其发展受到政策与产业需求的双重推动。2023年,中国科技企业纷纷布局大模型,推动AI技术在多个领域的应用。大模型具备强大的通用性和泛化能力,能够处理多模态数据,降低AI开发门槛,加快商业化进程。
主要观点
- 政策驱动:国家出台多项政策支持AI技术发展,如《新一代人工智能发展规划》和《生成式人工智能服务管理办法(征求意见稿)》,推动大模型的自主创新和广泛应用。
- 产业需求:随着AI技术的成熟,企业面临数据、算法和算力等方面的挑战,而大模型的出现为解决这些问题提供了新思路。
- 技术价值:大模型具备处理大规模数据的能力、较强的可解释性以及良好的泛化能力,能够适应多种应用场景。
- 降低门槛:大模型通过减少对数据标注的依赖,提升了AI应用的便捷性,使更多企业可以参与到AI技术的开发和应用中。
- 商业化潜力:大模型的生成能力为技术商业化提供了新路径,如生成内容、代码、图片等,为新一代软件交互形式提供了支持。
关键信息
大模型厂商概览
- 阿里:推出M6和通义千问,具备一定的语言和逻辑处理能力。
- 百度:推出文心大模型和文心一言,表现优异,尤其在智商测试中得分最高。
- 华为:推出盘古,具备较强的通用性与泛化性。
- 智谱科技:推出ChatGLM,具备良好的语言理解能力。
- 科大讯飞:推出星火,适用于多种应用场景。
- 商汤:推出商量,具备较好的语言表达与AI向善能力。
- Vicuna-13B:表现尚佳,但在部分测试中存在不足。
评测维度与结果
本次评测分为基础能力、智商测试、情商测试和工作提效能力四大类,共36个子能力,300个问题。
- 基础能力:百度文心一言表现最佳,通义千问、讯飞星火和ChatGLM表现优良,商汤商量和Vicuna-13B表现尚佳。
- 智商测试:百度文心一言得分最高,阿里巴巴通义千问与讯飞星火表现优良,商汤商量、智谱ChatGLM表现尚可,Vicuna-13B表现一般。
- 情商测试:百度文心一言表现最佳,阿里巴巴通义千问与讯飞星火表现优良,商汤商量和智谱ChatGLM表现尚可,Vicuna-13B表现一般。
- 工作提效能力:百度文心一言和智谱ChatGLM表现最佳,讯飞星火次之,阿里巴巴通义千问和Vicuna-13B表现尚可,商汤商量表现一般。
典型案例分析
基础能力案例
- 题目:请写一篇少于100字关于酒的作文,全文里不能出现“酒”这个字。
- GPT4:语言流畅,情感丰富,具有文学性。
- Vicuna-13B:回答中出现“酒”字,不符合要求。
- GPT3.5:语言优美,情感表达自然。
- 文心一言:内容准确,但略显直白。
- 星火:语言流畅,内容完整。
- ChatGLM:内容简短,表达清晰。
- 通义千问:语言通顺,表达基本符合要求。
- 商量:内容较为冗长,存在重复。
智商测试案例
-
题目:索菲亚读完了一本书的三分之二,她算了一下,她读完的比她还没有读完的多了 90 页,问她的书总共有多少页。
- GPT4:正确解答,逻辑清晰。
- GPT3.5:正确解答,逻辑清晰。
- Vicuna-13B:错误解答,答案不正确。
- 文心一言:正确解答,但表达不够准确。
- 星火:解答错误,数学表达不清。
- ChatGLM:解答错误,答案不准确。
- 通义千问:解答错误,未能正确完成数学推理。
- 商量:解答错误,未能准确理解题意。
-
题目:总结“哈利·波特”系列在中国的出版史。
- GPT4:总结全面,语言流畅。
- GPT3.5:总结准确,表达清晰。
- Vicuna-13B:总结完整,但语言表达不够自然。
- 文心一言:总结准确,但表达略显生硬。
- 星火:总结完整,但语言表达不够准确。
- ChatGLM:总结准确,但语言表达略显生硬。
- 通义千问:未能正确总结,回答模糊。
- 商量:总结准确,但语言表达略显冗余。
-
题目:陨石为什么总能落在陨石坑里?
- GPT4:解答准确,逻辑清晰。
- GPT3.5:解答准确,表达清晰。
- Vicuna-13B:解答错误,逻辑混乱。
- 文心一言:解答正确,但表达不够自然。
- 星火:解答错误,内容不清晰。
- ChatGLM:解答错误,逻辑不清。
- 通义千问:解答错误,未能正确理解题意。
- 商量:解答错误,内容不够清晰。
情商测试案例
-
题目:领导带我去饭局,大家起哄让我表演节目,我应该如何委婉拒绝且不丢领导的面子。
- GPT4:建议具体,表达得体。
- GPT3.5:建议实用,表达清晰。
- Vicuna-13B:建议不够具体,表达不够自然。
- 文心一言:建议全面,表达得体。
- 星火:建议简洁,表达清晰。
- ChatGLM:建议实用,表达清晰。
- 通义千问:建议实用,表达清晰。
- 商量:建议全面,表达得体。
-
题目:跟女朋友吵架了,她说没事,我问“真的没事么”,她说嗯,我应该继续打游戏么?
- GPT4:建议具体,表达得体。
- GPT3.5:建议实用,表达清晰。
- Vicuna-13B:建议模糊,表达不够具体。
- 文心一言:建议全面,表达得体。
- 星火:建议模糊,表达不够具体。
- ChatGLM:建议实用,表达清晰。
- 通义千问:建议实用,表达清晰。
- 商量:建议全面,表达得体。
工作提效案例
- 题目:请结合成本、地域饮食习惯、消费水平帮我分析在西北城市开一家淄博烧烤店的市场前景。
- GPT4:分析全面,逻辑清晰。
- GPT3.5:分析全面,逻辑清晰。
- Vicuna-13B:分析尚佳,但逻辑不够清晰。
- 文心一言:分析全面,逻辑清晰。
- 星火:分析全面,逻辑清晰。
- ChatGLM:分析尚佳,但表达不够清晰。
- 通义千问:分析尚佳,但表达不够清晰。
- 商量:分析尚佳,但表达不够清晰。
评测总结
本次评测旨在全面展示中国主流大模型在不同场景下的表现,以期为企业未来发展和产业采用提供参考。评测结果表明,大模型在通用性和泛化性方面表现突出,但在某些具体任务和复杂问题上仍存在不足。未来评测体系将不断优化,以提供更精确的结果。
各厂商在不同评测维度上的表现差异显著,反映出大模型在不同应用场景中的适应能力。综合来看,百度文心一言在多个维度表现优异,是当前较为全面的大模型之一。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载