深度报告-20230319-国金证券-计算机行业研究_文心一言_GPT3.5及GPT-4的应用测评对比_32页_6mb
报告摘要
计算机行业研究总结
核心内容
本报告对文心一言、GPT-3.5和GPT-4三大生成式大模型在多个领域的性能进行了详细测评,涵盖常识和创作、归纳和推理、数学和代码以及现实应用场景测试,包括AI生活助手、售后客服、办公协同、产品推荐和教学辅导等。测评结果显示,三大模型在问答、文字生成等方面表现良好,但在逻辑推理、情感理解、数学计算和代码生成等方面仍有待提升。此外,文心一言在图像生成方面表现突出,而GPT-4在多轮对话和复杂任务处理方面略胜一筹。
主要观点
- 常识问答:三大模型均能正确回答客观常识类问题,但GPT-4在表述上更为严谨。
- 文字创作:文心一言的分词能力仍有待提升,而GPT-4在情节设置和细节描述上表现更为丰富。
- 图像创作:目前文心一言是唯一具备文生图能力的模型,而GPT-3.5和GPT-4尚未开放图像生成功能。
- 归纳和推理:文心一言在归纳总结任务中表现较好,但演绎推理和逻辑推理方面略逊于GPT系列;情感推理方面,只有文心一言给出正确结果,但其推理过程存在偏差。
- 数学和代码:GPT-3.5在数学计算上表现最佳,而GPT-4在代码生成上虽然给出了正确的解,但在细节处理上仍有不足;文心一言在数学和代码方面表现较弱。
- 应用场景:三大模型在AI助手、售后客服、产品推荐、办公协同等方面均能胜任,但在古诗词理解和文言文表达方面仍有提升空间。
关键信息
-
文心一言:
- 在图像创作和归纳总结方面表现突出。
- 在逻辑推理和情感推理方面有不足。
- 分词能力需提升,影响文字创作的准确性。
- 在文言文修饰和古诗词理解方面表现不佳。
-
GPT-3.5:
- 在数学计算和代码生成方面表现较好,但并非最优。
- 在情感推理和逻辑推理方面有误判。
- 在售后客服和办公协同场景中表现较为优秀。
- 在文言文和古诗词方面能力较弱。
-
GPT-4:
- 在数学计算和代码生成方面表现优异。
- 在逻辑推理和情感推理方面存在一定的偏差。
- 在多轮对话和场景处理方面表现更佳。
- 文言文和古诗词处理能力仍有待加强。
投资建议
- 文心一言已能基本满足AI助手、售后客服、产品推荐等场景需求。
- 随着百度文心与OpenAI合作生态的增长和数据量的提升,模型性能有望进一步优化。
- 建议关注在AI领域持续布局且具备成熟应用场景的公司,例如:
- 万兴科技
- 汉得信息
- 凌志软件
- 同花顺
- 金山办公
风险提示
- 海外基础软硬件使用受限。
- 应用落地不及预期。
- 行业竞争加剧。
- 测评问题有限,可能导致结果有偏差。
结论
总体来看,三大模型在常识问答和文字生成方面表现良好,但在逻辑推理、情感理解、数学计算和代码生成等方面仍有待提升。随着训练数据的增加和模型优化,它们的性能有望进一步增强。文心一言在图像生成方面有独特优势,而GPT-4在复杂任务处理和多轮对话中表现更为出色。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载