> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容 本报告聚焦于多模态智能的发展历程,分析其从“外挂式/组合式”阶段到“原生多模态”阶段,再到“全模态Omni”阶段的技术演进路径。报告指出,多模态智能的本质是将文本、图像、音频、视频等不同模态映射至统一表示,并在此基础上完成理解、推理与交互。多模态的发展体现了AI2.0“架构、任务、模态三重收敛”的趋势,尤其是模态维度的统一。 ## 主要观点 - **多模态发展三阶段**: 1. **外挂式/组合式阶段(2021—2023)**:图像通过视觉编码器压缩为token,再接入语言模型,存在转换损耗,但工程效率高。 2. **原生多模态阶段(2023—2024)**:多模态能力从接口层前移到预训练阶段,模型从训练早期就联合处理多种模态,提升泛化能力。 3. **全模态Omni阶段(2024至今)**:模型实现文本、视觉、音频、视频的实时统一交互,补齐听、看、说的互动性,降低延迟,提升用户体验。 - **Omni阶段的核心突破**: - 语音直接理解,保留非文本信息(语气、节奏、情绪等); - 视觉实时参与,支持连续对话; - 低延迟交互,更接近人类交流方式; - 多模态共同推理,提升复杂任务处理能力。 - **未来发展方向**: - **理解与生成统一**:探索纯自回归、扩散及二者融合等范式,解决高层语义与空间结构之间的表征冲突; - **多模态深度推理**:从语言思维链向视觉工具增强、视觉—语言交错推理、多模态潜空间推理、闭环推理演进。 ## 关键信息 - **技术路线演进**: - 外挂式阶段:使用CLIP、Flamingo、BLIP-2、LLaVA等模型,通过连接模块实现多模态拼接; - 原生多模态阶段:Gemini等模型实现从预训练阶段开始的多模态联合建模; - Omni阶段:GPT-4o、Qwen2.5-Omni等模型实现文本、视觉、音频、视频的实时统一交互。 - **技术瓶颈与挑战**: - 理解与生成在表征上的冲突; - 离散与连续模态生成范式的统一; - 多模态推理仍以语言思维链为主,尚未形成统一的推理机制。 - **行业展望**: - 多模态技术逐步收敛于Transformer架构; - 深度推理能力成为下一阶段竞争焦点; - 物理AI方向在AI发展进程中更具增量潜力,智能驾驶作为代表场景值得关注。 ## 风险提示 - 技术迭代不及预期; - 大模型厂商ARR增速放缓; - 云服务商资本开支不及预期; - 智能驾驶及机器人商业化落地不及预期。 ## 技术演进趋势 - **统一表示**:多模态能力的统一核心在于将不同模态映射到同一语义空间,减少转换损耗; - **架构统一**:Transformer成为统一多模态的基石,其自注意力机制支持多模态token的联合处理; - **交互升级**:从“看图说话”向“听、看、说、实时交互”演进,提升交互自然度与实时性; - **推理深化**:多模态推理从语言思维链向视觉工具增强、潜空间推理、闭环推理等方向发展,提升模型在真实复杂场景中的表现。 ## 行业投资建议 - **投资评级**:增持(维持) - **投资逻辑**:多模态技术逐步统一,Omni路线成为新趋势,深度推理能力提升将是未来增长点; - **关注重点**:智能驾驶、物理AI、多模态原生推理等方向,尤其是具备全模态交互与深度推理能力的模型与应用。 ## 结论 多模态智能正从“拼接”走向“统一”,未来将更注重理解与生成的协同、多模态推理的深化。深度推理能力将成为区分模型性能的关键变量,而Omni路线则标志着多模态交互的全面升级。行业应重点关注具备全模态处理与推理能力的技术路径及应用场景。