20240522-天风证券-AI行业动态更新_OpenAI推出GPT-4o_谷歌I_O开发者大会发布多款AI产品_10页_1mb
报告摘要
总结
1. 推动AI交互体验变革的GPT-4o发布
2024年5月14日,OpenAI推出新一代旗舰AI模型GPT-4o,具备多模态能力,能够在文本、音频和图像的输入与输出之间进行端到端处理。该模型支持以下关键特性:
- 响应速度快:音频输入响应时间低至232毫秒,接近人类对话的实时性。
- 多语言支持与非英文文本处理:在非英文文本理解上有显著提升,语言和代码能力与GPT-4Turbo持平或更优。
- 视觉和情感识别:能够通过视频理解用户情绪,并进行情感回应,增强人机交互的真实感。
- 成本显著降低:API使用价格减半,提升了其商业化应用潜力。
GPT-4o在多个标准测试中表现优于现有模型,如MMLU(语言理解)、MMMU(多模态基准测试)等,成为当前具备最强综合能力的大模型之一。
2. 谷歌在2024年I/O开发者大会的核心发布
谷歌在同年5月15日的开发者大会上也推出了一系列重磅AI产品,提升了自身AI生态的竞争力:
- Gemini系列升级
- Gemini15Flash:轻量化模型,运行更快,体积更小,适合开发者部署,并支持多模态处理。
- Gemini15Pro:上下文窗口扩展至200万tokens,支持更丰富的数据处理(如两小时视频、20万行代码)。
- 多模态AI搜索和ProjectAstra
- 谷歌将Gemini技术深度整合至搜索产品,推出多模态搜索功能,可以处理声音、视频、图片等多模态信息。
- ProjectAstra:基于AI的智能代理,能通过智能手机摄像头理解环境并与用户实时互动,具备快速响应和记忆功能。
- 视频生成模型Veo与TPU-Trillium
- Veo:支持生成高质量视频,增强创意表达;TPU-Trillium是新一代AI处理器,提供更高算力、能效和带宽,用于训练和运行大型模型。
3. OpenAI与谷歌模型对比
- 模型性能:GPT-4o多模态处理能力更全面,语言与视觉表现更强;谷歌Gemini系列在推理和多模态理解上也有进步,但整体仍处于追赶阶段。
- 价格策略:Gemini15Flash具有明显价格优势,而GPT-4o仍保持统一标准,尽管有显著降价(输入0.05美元/百万tokens,输出0.15美元/百万tokens)。
4. 投资建议和行业应用场景
投资机构认为,OpenAI和谷歌新模型的迭代将推动AI在以下行业的应用落地:
- 教育:GPT-4o提供个性化辅导和深入学习支持。
- 智能助手:提升对话理解和执行复杂任务的能力,增强人机交互体验。
- 数据分析与AR/VR:通过多模态理解与生成,加速大规模数据处理和虚拟现实内容生成。
风险提示:AI发展不及预期、商业模式落地慢于预期、竞争加剧。
5. 投资方向与市场前景
随着模型架构、算力和交互方式的革新,AI终端设备和应用将迈向更个性化的时代,企业需尽快适应多模态交互趋势,并将AI能力深度嵌入产品服务中。投资者可重点关注具备大模型底层技术、长上下文处理能力和实时响应能力的企业。
报告回顾了近期AI界巨头的产品发布,强调了多模态能力和算力结构优化的重要性,并预测其将在教育、数据处理、人机交互等方向催生新的技术应用与增长机会。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载