计算机行业人工智能系列报告(六):交互型多模态大模型有望带来应用的爆发起点-240903_39页_3mb
报告摘要
交互型多模态大模型有望带来应用的爆发起点
核心内容
交互型多模态大模型是一种能够支持文本、音频、图像、视频等多模态输入输出的大模型,具备实时、类人化的理解和反馈能力,从而实现与人类的无缝交流。其最具代表性的是OpenAI的GPT-4o。这类模型不仅能够跨模态端到端训练,还具备快速响应、情感表达和记忆能力等关键特性。
主要观点
- 原生多模态能力:模型能够同时处理和生成多种模态的信息,如文本、图像、语音等,相较于以往需多个模型分别处理不同模态的方式,这种统一处理方式减少了信息损失,提升了交互的连贯性。
- 快速响应:GPT-4o的响应速度显著提升,达到232毫秒至320毫秒之间,接近人类对话反应速度,支持随时打断,极大增强了交互体验。
- 情感表达:模型能以丰富的情感回应用户,包括惊讶、高兴、愤怒等,提升了交互的沉浸感和用户粘性。
- 记忆能力:模型能够记住之前“看到”的信息,并在后续交互中加以利用,从而实现更自然的对话和情境理解。
关键信息
- 成本下降趋势:OpenAI推出的GPT-4o mini和新版本,成本显著下降,预计两年内每百万tokens的推理成本将降至美分级别。
- 应用爆发潜力:交互型多模态大模型的出现有望推动人机交互方式的变革,从PC互联网、移动互联网到AI时代,交互方式不断进化,未来可能向自然语言交互发展。
- 应用场景:
- 数字智能:包括教育、编程、医疗健康、办公、游戏和情感陪伴。
- 具身智能:包括人形机器人、智能座舱和智能家居等,依赖硬件实现三维空间内的交互。
商业模式展望
- 聊天助手APP:成为用户与AI交互的主要入口,如ChatGPT。
- 作为基础模型接入各类应用:为各种应用提供智能化支持。
- 与终端OS深度融合:成为AI时代的“超级入口”,提升用户体验和使用效率。
相关标的梳理
| 类别 | 标的 |
|---|---|
| 交互型多模态大模型 | 商汤-W、云从科技-UW |
| 数字智能应用 | 金山办公、科大讯飞、虹软科技、美图公司 |
| 具身智能应用 | 海康威视、大华股份 |
| 算力支持 | 寒武纪、软通动力、海光信息、浪潮信息、中科曙光、神州数码 |
风险提示
- AI技术突破不及预期
- 终端智能需求不及预期
- 宏观经济增长不及预期
- 国际环境变化
行业走势
| 时间 | 计算机 | 沪深300 |
|---|---|---|
| 1个月 | -5.39% | -3.28% |
| 3个月 | -13.20% | -8.79% |
| 12个月 | -35.38% | -13.66% |
分析师信息
- 分析师:郑宏达(S0800524020001)
- 联系人:卢可欣
- 邮箱:zhenghongda@research.xbmail.com.cn
- 电话:13918906471
相关研究
- 计算机:科技自主的道路是星辰大海(2024-08-30)
- 计算机:美股软件股目前的估值和股价表现(2024-08-25)
- 计算机:阿里腾讯加码AI决心坚定(2024-08-17)
交互型多模态大模型的发展
- 海外进展:OpenAI和谷歌分别推出GPT-4o和Project Astra,展示其在多模态交互和AI智能体方面的强大能力。
- 国内进展:商汤推出“日日新5o”,智谱推出清言APP视频通话功能,推动国内多模态交互能力提升。
人机交互的演变
- 穿孔纸带:早期计算机交互方式,操作复杂。
- 命令行界面:简化了操作,但用户仍需学习命令。
- 图形用户界面:直观操作,推动了个人电脑普及。
- 触屏交互:更自然,推动了移动互联网发展。
- 自然语言交互:未来趋势,提升用户体验和使用效率。
应用展望
- 教育:实现个性化教学,提升学习效率和互动性。
- 编程:辅助代码生成、调试和优化,提升开发效率。
- 医疗健康:提供智能导诊、健康顾问、情感支持等服务,提升医疗效率和可及性。
- 办公:作为会议助手,提升会议效率和信息处理能力。
- 游戏:增强NPC行为的多样性和情境适应性,提升玩家沉浸感和游戏体验。
图表目录
- 图1:GPT-4o能听出用户呼吸急促,并给出建议
- 图2:用户写字表白,GPT-4o能识别字迹并高兴地感谢
- 图3:过去ChatGPT实现语音互动的三个步骤
- 图4:谷歌Gemini具有原生多模态特性
- 图5:Gemini多模态能力使用案例
- 图6:Chameleon的模型结构与训练方法
- 图7:GPT-4o响应速度提升
- 图8:GPT-4o与人交流时会开一些合理的玩笑
- 图9:ProjectAstra记住了曾经“看”到过的眼镜和苹果
- 图10:OpenAI大模型的降本历程
- 图11:GPT-4o mini在基准测试中表现较好
- 图12:GPT-4o mini具有高性价比
- 图13:GPT-4o新版本价格相比3个月前下降超40%
- 图14:GPT-4o在多语言识别方面与Whisper-v3对比
- 图15:GPT-4o音频翻译基准测试表现
- 图16:GPT-4o发布后ChatGPT移动端APP的收入高增
- 图17:谷歌展示AI智能体项目ProjectAstra
- 图18:日日新5.5核心指标
- 图19:日日新5o识别小狗玩偶
- 图20:日日新5o分析建筑环境及天气
- 图21:日日新5o识别书籍并提供更多信息
- 图22:日日新5o识别绘制的简笔画表情并分析情绪
- 图23:用户可以用清言APP视频通话功能和AI玩“你画我猜”的游戏
- 图24:清言APP视频通话功能可以辅助用户读论文
- 图25:国内大模型聊天助手语音交互界面
- 图26:多模态更符合人类与外界交互的方式
- 图27:人机交互过程
- 图28:人机交互的变革
- 图29:人机交互将向最简单的形态发展
- 图30:现代教育的特征与AIGC技术吻合
- 图31:大模型拓展了AI技术在教育领域的应用场景
- 图32:Duolingo max功能
- 图33:GPT-4o在Khan Academy上完成数学题辅导
- 图34:GPT-4o通过视频完成数学问题辅导
- 图35:GPT-4o识别物体并输出西班牙语
- 图36:GPT-4o模拟面试
- 图37:AGI完全体与教育畅想
- 图38:GPT-4o代码能力演示
- 图39:远程协作平台Multi
- 图40:GPT-4o与BeMyEyes结合为盲人提供实时助手
- 图41:AIGC贯穿医疗全流程
- 图42:GPT-4o当会议助手
- 图43:GPT-4V可以基于游戏画面生成用户行为预测以及NPC行为建议
- 图44:GPT-4o唱生日快乐歌
- 图45:Figure01背后的大模型技术
- 图46:智能座舱多种交互方式
- 图47:智能座舱多维度信息的融合
- 图48:绝影FlexInterface生成个性化交互界面
- 图49:生成式AI赋能智能家居的价值
- 图50:萤石AI技术策略
- 图51:萤石蓝海大模型
- 图52:演示元萝卜光翼灯使用方言回答问题
- 图53:元萝卜光翼灯产品
- 图54:前OpenAI高管Andrej Karpathy对LLMOS的构想
- 图55:Copilot读取PC屏幕内容,辅助用户完成《我的世界》相关任务
- 图56:AI Agent帮用户规划旅行、购票、更新日历等
- 图57:“PC互联网时代-移动互联网时代-AI时代”入口演进
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载