> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容概述 本报告围绕 AI 技术的发展路径,探讨了数字 AI 与物理 AI 的演进与差异,重点分析了物理 AI 在智能驾驶等场景中的落地路径。数字 AI 已在语言、视觉与多模态任务中建立通用底座模型,而物理 AI 则正在构建“感知—行动—反馈—优化”的闭环系统,成为 AI 技术发展的重要新方向。 ## 主要观点 1. **数字 AI 与物理 AI 的关系** - 数字 AI 以 Transformer 为核心架构,已实现语言、视觉、生成与多模态任务的统一。 - 物理 AI 是数字 AI 能力的延伸,但其在物理世界的建模与闭环运行中面临独特挑战,如表征、数据与学习范式的差异。 2. **Transformer 的技术优势** - Transformer 通过“注意力+位置编码”机制,实现跨领域通用建模,推动 AI 从专用架构向统一底座演进。 - 其优势在于并行计算、可扩展性与对多模态任务的统一处理能力。 3. **物理 AI 的发展瓶颈与突破方向** - 物理 AI 缺乏天然 Token,需构建物理世界表征。 - 长尾与极端场景数据稀缺,需通过世界模型生成合成数据。 - 强化学习成为物理 AI 闭环的关键技术,相比模仿学习,其在复杂任务中的表现更具潜力。 4. **VLA(视觉—语言—动作)范式演进** - VLA 是物理 AI 的重要技术路径,代表智能驾驶从模块化走向统一策略。 - 代表模型包括 Waymo EMMA、理想 MindVLA、小鹏第二代 VLA 等,其架构与性能表现存在差异化。 5. **物理 AI 的部署与工程挑战** - 云端训练与车端部署存在时延差异,需构建高效压缩与推理工具。 - 物理 AI 的部署需在安全、实时与算力约束下实现稳定运行。 ## 关键信息 ### 数字 AI 的发展路径 - **AI 第一次爆发**:CNN、RNN 作为专用架构,分别攻克视觉与语言任务。 - **AI 第二次爆发**:Transformer 引领通用模型架构发展,通过“注意力+位置编码”实现跨领域统一。 - **Scaling 规律**:模型能力随数据、参数与算力的增加呈幂律提升,形成从预训练到推理的全链条扩展。 ### 物理 AI 的关键挑战 - **表征问题**:物理世界输入为连续信号,需构建统一的数值表示(如 BEV、Occupancy、VAE、3D 编码器)。 - **数据问题**:物理 AI 需制造长尾、极端与事故场景数据,而非依赖已有互联网数据。 - **学习范式问题**:强化学习成为物理 AI 闭环的核心,相较于模仿学习,其在复杂任务中更具突破性。 ### VLA 范式与智能驾驶 - **VLA 架构**:整合视觉、语言与动作模块,形成统一策略,如 Waymo EMMA、理想 MindVLA、小鹏第二代 VLA。 - **技术演进**:从预 VLA(被动解释器)→模块化 VLA(多阶段流水线)→统一端到端 VLA(直接映射控制信号)→推理增强 VLA(引入记忆与交互)。 - **厂商路径分化**:部分厂商采用语言推理层(如理想 MindVLA-o1),部分则弱化语言模块,实现原生多模态 Tokenizer(如小鹏)。 ### 世界模型的角色 - **数据工厂**:世界模型通过生成合成数据,解决物理 AI 长尾与极端场景数据稀缺问题。 - **自监督学习**:通过预测未来状态,实现无需人工标注的表征学习。 - **Corner Case 生成**:世界模型可生成罕见场景,但其在长时程一致性与可执行性方面仍面临挑战。 ## 未来展望 - **物理 AI 增长弹性**:随着世界模型与强化学习闭环的成熟,物理 AI 将由能力展示走向大规模落地,成为当前 AI 发展最具潜力的方向。 - **技术瓶颈突破**:数字 AI 的红利接近瓶颈,而物理 AI 的发展仍处于技术探索与工程落地的初期阶段。 - **云车协同**:云端训练与车端部署形成不同效率工具箱,推动物理 AI 的实际应用。 ## 风险提示 - 技术迭代不及预期。 - 大模型厂商 ARR 增速放缓。 - 云服务商资本开支不及预期。 - 智能驾驶及机器人商业化落地不及预期。 ## 结构总结 ### 数字 AI - **技术演进**:CNN → RNN → Transformer。 - **核心机制**:注意力机制、位置编码、Scaling 规律。 - **应用领域**:语言、视觉、生成、多模态。 - **发展瓶颈**:数据与算力限制,技术红利趋于饱和。 ### 物理 AI - **核心路径**:从数字 AI 能力外溢到物理闭环。 - **关键模块**:VLA、世界模型、强化学习。 - **表征演进**:像素 → BEV → Occupancy → 矢量化 → 多模态 Token → 潜在状态。 - **数据制造**:依赖世界模型生成 Corner Case,实现长尾场景覆盖。 ### VLA 与智能驾驶 - **范式升级**:从端到端 → VLA → 闭环系统。 - **技术演进**:预 VLA → 模块化 VLA → 统一端到端 VLA → 推理增强 VLA。 - **厂商差异**:部分保留语言推理层,部分弱化语言模块,形成技术路线分化。 ### 世界模型与数据生成 - **技术原理**:通过预测未来状态,实现自监督表征学习。 - **应用场景**:智能驾驶、机器人等。 - **挑战与边界**:Corner Case 生成可靠性、长时程一致性、可执行性约束。 ## 总结 本报告指出,数字 AI 已在多个任务中建立通用模型,而物理 AI 正在从数字 AI 中获取能力,但其发展路径存在显著差异。Transformer 作为通用计算底座,正在推动物理 AI 向统一模型演进,但物理 AI 需解决表征、数据与学习范式等系统性问题。智能驾驶作为物理 AI 的代表场景,正通过 VLA 范式与世界模型实现闭环落地,未来有望成为 AI 技术发展的主要增量方向。