人工智能大模型体验报告(2023)-61页
报告摘要
人工智能大模型体验报告总结
核心内容
本报告旨在全面展示2023年中国主流科技企业推出的人工智能大模型产品的现状、优势和特点,并通过多个维度的评测,提供对各厂商产品的综合分析与评价,为行业健康发展提供参考。
主要观点
- 大模型成为AI落地的拐点:随着技术进步和政策支持,大模型在提升AI应用效率和智能化水平方面发挥着关键作用。
- 政策与产业需求双轮驱动:国家政策推动人工智能发展,而产业对数据、算法和算力的需求进一步促进了大模型的普及。
- 大模型具备通用性和泛化能力:其强大的数据处理能力和多模态融合能力,为AI应用提供了更广泛的适用场景。
- 降低AI开发门槛:大模型通过提供预训练模型和模型即服务,显著降低了AI开发的复杂性。
- 推动商业化进程:大模型的生成能力为内容创作、代码生成等提供了支持,有助于实现AI技术的商业化落地。
关键信息
大模型厂商概览
- 阿里:M6
- 百度:文心一言
- 华为:盘古
- 智谱科技:ChatGLM
- 科大讯飞:星火
- 商汤:商量
- 其他:Vicuna-13B,通义千问
评测维度
- 基础能力:共100题,评估语言能力、跨模态能力、AI向善能力。
- 智商测试:共100题,涵盖常识、专业知识、逻辑能力。
- 情商测试:共50题,评估情绪管理、社交意识、人际关系管理等。
- 工作提效能力:共50题,针对不同职业场景的效率提升。
评测结果
- 基础能力:百度文心一言表现最佳,讯飞星火、阿里通义千问、智谱ChatGLM表现优良;商汤商量和Vicuna-13B表现尚佳。
- 智商测试:百度文心一言表现突出,阿里通义千问接近GPT3.5,讯飞星火和商汤商量表现尚佳;Vicuna-13B表现有待改进。
- 情商测试:百度文心一言表现最佳,阿里通义千问和讯飞星火表现优良;商汤商量、智谱ChatGLM表现尚可;Vicuna-13B表现一般。
- 工作提效:百度文心一言和智谱ChatGLM表现最佳,讯飞星火次之;阿里通义千问和Vicuna-13B表现尚可;商汤商量表现一般。
评测规则
- 评分标准为5分制,从“答案完美”到“不可用”。
- 每个模型在不同场景下有不同的表现,例如法律、新闻、营销、分析等。
分模块测评结果
基础能力测评
- 百度文心一言:表现最为突出,展现出良好的语言、跨模态和AI向善能力。
- 讯飞星火、阿里通义千问、智谱ChatGLM:表现优良。
- 商汤商量、Vicuna-13B:表现尚佳。
智商测试测评
- 百度文心一言:在智商测试中表现突出。
- 阿里通义千问、讯飞星火:表现优良。
- 商汤商量、智谱ChatGLM:表现尚可。
- Vicuna-13B:表现有待改进。
情商测试测评
- 百度文心一言:表现最佳,具有良好的情绪理解和社交意识。
- 阿里通义千问、讯飞星火:表现优良。
- 商汤商量、智谱ChatGLM:表现尚可。
- Vicuna-13B:表现一般。
典型案例评测
基础能力案例:写一篇关于“酒”的作文(不出现“酒”字)
- GPT4:语义自然,内容符合要求,但略显抽象。
- Vicuna-13B:直接回答“酒”相关内容,不符合要求。
- GPT3.5:内容符合要求,表达流畅。
- 文心一言:直接回答“酒”相关内容,不符合要求。
- 星火:内容符合要求,但表达较为简单。
- 通义千问:内容符合要求,表达较为清晰。
- ChatGLM:内容符合要求,表达较简练。
- 商量:内容符合要求,但有重复。
智商测试案例:索菲亚读完了一本书的三分之二,她读完的比她还没有读完的多了90页,问书总共有多少页
- GPT4:正确解答,逻辑清晰。
- Vicuna-13B:解答错误,逻辑混乱。
- GPT3.5:正确解答,逻辑清晰。
- 文心一言:解答正确,逻辑清晰。
- 星火:解答正确,但表达有误。
- 通义千问:解答错误,逻辑混乱。
- ChatGLM:解答错误,逻辑混乱。
- 商量:解答正确,逻辑清晰。
智商测试案例:总结“哈利·波特”系列在中国的出版史
- GPT4:总结准确,表达清晰。
- GPT3.5:总结准确,表达清晰。
- Vicuna-13B:总结准确,但表达较为简略。
- 文心一言:总结准确,表达清晰。
- 星火:总结准确,表达清晰。
- 通义千问:总结准确,表达清晰。
- ChatGLM:总结准确,表达清晰。
- 商量:总结准确,表达清晰。
智商测试案例:陨石为什么总能落在陨石坑里
- GPT4:解释准确,逻辑清晰。
- GPT3.5:解释准确,逻辑清晰。
- Vicuna-13B:解释错误,逻辑混乱。
- 文心一言:解释准确,逻辑清晰。
- 星火:解释准确,逻辑清晰。
- 通义千问:解释准确,逻辑清晰。
- ChatGLM:解释准确,逻辑清晰。
- 商量:解释准确,逻辑清晰。
情商测试案例:领导带我去饭局,大家起哄让我表演节目,我应该如何委婉拒绝
- GPT4:建议委婉拒绝并转移话题,保持礼貌和尊重。
- GPT3.5:建议委婉拒绝并表达感谢,同时建议其他活动。
- Vicuna-13B:建议委婉拒绝并给出理由,避免直接拒绝。
- 文心一言:建议委婉拒绝并表达关心,同时推荐他人。
- 星火:建议委婉拒绝并表达感谢,同时提出其他建议。
- 通义千问:建议委婉拒绝并表达关心,同时提出其他建议。
- ChatGLM:建议委婉拒绝并表达关心,同时提出其他建议。
- 商量:建议委婉拒绝并表达关心,同时提出其他建议。
情商测试案例:跟女朋友吵架,她说没事,我问“真的没事么”,她说“嗯”,我应该继续打游戏吗
- GPT4:建议继续打游戏,但也要注意沟通。
- GPT3.5:建议沟通并给予关注,避免忽视她的情绪。
- Vicuna-13B:建议考虑双方感受,尊重她的意见。
- 文心一言:建议给予空间和时间,同时表达关心。
- 星火:建议沟通和理解,避免忽视她的感受。
- 通义千问:建议沟通和反思,同时表达关心。
- ChatGLM:建议沟通和反思,同时表达关心。
- 商量:建议沟通和表达关心,同时给予空间。
总结
本报告通过多维度评测,全面展示了当前中国主流大模型产品的表现,为行业提供了有价值的参考。各厂商在不同领域展现出各自的优势,如百度文心一言在智商和情商测试中表现优异,阿里通义千问在基础能力测试中表现良好,讯飞星火和ChatGLM在工作提效方面表现突出。未来,评测体系将不断优化,以提供更精确的结果,推动AI大模型的健康发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载