> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容 本报告聚焦 AI 在数字与物理世界的演进路径,重点分析了数字 AI 与物理 AI 的发展差异与融合路径。数字 AI 以 Transformer 架构为核心,通过语言、视觉与多模态任务的统一建模,已形成通用基础模型。物理 AI 以智能驾驶为典型场景,强调在真实世界闭环中的“感知—行动—反馈—优化”过程,其发展路径与数字 AI 有所不同,但存在技术同源性。 ## 主要观点 - **数字 AI 通用底座模型**:Transformer 通过注意力机制和位置编码,实现了跨模态统一建模,成为语言、视觉与多模态任务的通用计算底座。 - **物理 AI 真实闭环构建**:物理 AI 需要构建“感知—行动—反馈—优化”闭环,与数字 AI 在表征、数据与学习范式上存在系统性差异。 - **技术同源性**:数字 AI 与物理 AI 共享 Transformer 架构,但物理 AI 更加关注真实世界中的连续、实时与安全约束。 - **世界模型与强化学习**:世界模型作为数据工厂,通过自监督学习生成 Corner Case;强化学习则成为物理 AI 的关键训练范式,推动闭环优化。 - **VLA 范式演进**:从端到端到视觉语言动作模型(VLA),VLA 架构逐步整合多模态信息,提升智能驾驶的决策与控制能力。 - **厂商路径分化**:头部厂商在 VLA 架构与表征方式上出现分化,部分采用语言推理,部分转向端到端视觉—动作模型。 ## 关键信息 ### 数字 AI 发展路径 - **第一次爆发**:CNN 和 RNN 分别攻克视觉与语言任务,但受限于归纳偏置与样本效率。 - **第二次爆发**:Transformer 以注意力机制和位置编码实现跨领域通用建模,推动语言、视觉、生成与多模态任务的统一。 - **Scaling 规律**:随着模型规模扩展,性能呈幂律提升,但数据质量与训练流程成为新的优化方向。 - **表征与数据**:数字 AI 表征以 Token 化为主,数据获取依赖互联网存量;物理 AI 表征需构建三维空间模型,数据获取需制造长尾与极端场景。 ### 物理 AI 落地路径 - **VLA 范式**:从端到端到动作生成,VLA 架构逐步整合多模态输入,提升决策与控制能力。 - **表征演进**:从像素→BEV→占用→矢量化→多模态 Token→潜在状态,逐步构建可预测的物理世界模型。 - **世界模型**:通过预测未来,为物理 AI 提供自监督训练信号,成为生成式数据工厂的核心。 - **强化学习**:作为物理 AI 的关键环节,强化学习在安全与闭环优化中发挥重要作用。 - **数据制造**:物理 AI 数据稀缺且成本高,需通过仿真与生成模型制造关键场景。 ### 技术对比 | 维度 | 数字 AI | 物理 AI | |------|---------|---------| | 表征 | 离散 Token,语义清晰 | 缺乏天然 Token,需构建三维空间模型 | | 数据 | 互联网存量,可抓取与压缩 | 长尾与极端场景,需制造与覆盖未观测状态 | | 学习范式 | 预训练模仿互联网知识,强化学习用于对齐与推理 | 模仿人类驾驶,强化学习为关键环节,需高保真闭环验证 | ## 结论 - **数字 AI 价值在确定性**:已形成统一模型架构,具备广泛迁移能力。 - **物理 AI 增量在闭环**:通过世界模型与强化学习构建闭环,形成独立而统一的发展路径。 - **未来增长点**:物理 AI 有望成为 AI 发展当前阶段最具成长弹性的方向,特别是在智能驾驶与机器人领域。 - **风险提示**:技术迭代不及预期、大模型厂商 ARR 增速放缓、云服务商资本开支不及预期、智能驾驶及机器人商业化落地不及预期。 ## 图表与模型演进 - **Transformer 技术演进**:从语言建模扩展至视觉、生成与多模态任务。 - **VLA 范式演进**:从端到端到统一策略,再到推理增强。 - **世界模型发展**:从强化学习辅助预测到生成式数据工厂。 - **数据获取差异**:数字 AI 依赖存量管理,物理 AI 需要增量制造。 ## 厂商实践 - **Waymo EMMA**:基于 Gemini 构建多模态模型,实现端到端规划。 - **理想 MindVLA**:采用 3D 高斯与 Diffusion 解码器,实现车端实时推理。 - **小鹏 第二代 VLA**:设计原生多模态 Tokenizer,实现视觉—动作直接映射。 - **元戎启行 40B VLA**:构建三角色模型,实现数据闭环优化。 - **千里 CoWorld-VLA**:通过四类专家 Token 构建隐空间表征,实现规划与控制。 ## 总结 数字 AI 以 Transformer 为核心,实现语言、视觉与多模态任务的通用建模;物理 AI 在此基础上,通过世界模型与强化学习构建真实世界闭环。物理 AI 与数字 AI 存在表征、数据与学习范式的系统性差异,但共享通用架构。智能驾驶作为物理 AI 典型场景,正逐步从端到端向 VLA 范式演进,未来有望实现大规模落地。