汽车行业深度报告-AI系列深度01期-从数字AI通用底座到物理AI真实世界闭环_38页_2mb
报告摘要
汽车行业深度报告总结
核心内容概览
本报告探讨了 AI 技术在数字与物理世界中的演进路径,重点分析了数字 AI 与物理 AI 的发展差异与融合。报告指出,数字 AI 已通过 Transformer 架构实现通用模型的构建,而物理 AI 则在智能驾驶等场景中逐步形成闭环系统。数字 AI 的发展路径与物理 AI 存在技术同源性,但物理 AI 面临独特的挑战,如表征构建、数据获取与学习范式差异。
主要观点
1. 数字 AI 的发展
- Transformer 架构的崛起:Transformer 通过“注意力+位置编码”机制,解决了传统 CNN 和 RNN 的局限,成为通用基础模型的核心技术底座。
- AI 的两次爆发:
- AI 1.0:CNN 和 RNN 分别攻克视觉与语言任务,依赖归纳偏置,但通用性与扩展性受限。
- AI 2.0:Transformer 实现跨模态通用建模,支持端到端训练与大规模扩展,成为语言、视觉、生成与多模态任务的统一架构。
- Scaling 规律:模型能力随数据、参数和计算量呈幂律增长,从训练 Loss 向下游任务能力演进,强化学习成为关键。
2. 物理 AI 的演进与挑战
- 物理 AI 的闭环路径:物理 AI 从数字 AI 中汲取能力,但需建立“感知—行动—反馈—优化”的闭环系统。
- 三大技术差异:
- 表征差异:物理世界缺乏天然 Token,需构建三维空间表征(如 BEV、占用网络、VAE、3D 编码器)。
- 数据差异:物理 AI 需制造长尾、极端与事故场景,而数字 AI 数据可直接抓取。
- 学习范式差异:物理 AI 需依赖强化学习,而数字 AI 以模仿学习为主,强化学习用于对齐与推理增强。
- VLA 范式的演进:从端到端到动作生成,VLA 模型逐步统一感知、语言与控制模块,成为物理 AI 的关键架构。
- 世界模型的作用:世界模型作为数据工厂与自监督学习工具,为物理 AI 提供生成与预测能力,但其在长尾与长时域场景中仍存在可靠性挑战。
3. 技术迁移与落地路径
- 数字 AI 向物理 AI 的迁移:从架构理念到模型迁移,从感知层到控制层逐步渗透。
- 物理 AI 的落地路径:
- 云端训练与车端部署分离:云端用于模型训练与优化,车端负责实时推理与执行。
- 时延优化:云端压缩与车端压缩形成不同效率工具箱,提升部署能力。
- 智能驾驶作为代表场景:智能驾驶成为物理 AI 跑通闭环的代表场景,逐步从能力展示走向大规模落地。
关键信息
- Transformer 的统一性:Transformer 作为通用架构,已统一语言、视觉、生成与多模态任务。
- 数字 AI 与物理 AI 的协同:数字 AI 提供能力底座,物理 AI 在真实世界中形成闭环,两者共同推动 AI 技术发展。
- 物理 AI 的核心挑战:表征构建、数据制造与强化学习是物理 AI 的关键瓶颈。
- VLA 与世界模型:VLA 代表动作生成范式,世界模型则承担自监督训练与数据生成任务。
- 厂商实践差异:Waymo、理想、小鹏等厂商在 VLA 架构与世界模型实现上呈现不同路径,反映出物理 AI 的工程边界与技术选择。
技术演进路径
数字 AI 技术演进
- 架构确立:自注意力机制替代递归,确立可并行的序列建模架构。
- 范式统一与规模化:预训练—微调成为主流,语言与生成任务统一为文本到文本。
- 对齐与推理:引入指令微调、RLHF、CoT、RAG 等技术,提升模型可用性与推理能力。
物理 AI 技术演进
- 表征演进:从像素→BEV→Occupancy→矢量化→多模态 Token→潜在状态。
- 数据制造:从抓取已有数据转向制造长尾、极端与事故场景。
- 学习范式:从模仿学习向强化学习过渡,强化学习成为闭环关键。
- VLA 模型演进:
- 预 VLA 阶段:多模态模型作为被动解释器,不参与决策。
- 模块化 VLA 阶段:LLM 作为主动路径规划媒介,语言作为中间表示。
- 统一端到端 VLA 阶段:多模态输入与语言指令直接映射为控制信号。
- 推理增强 VLA 阶段:整合长时域推理、记忆与交互,提升控制能力。
风险提示
- 技术迭代不及预期。
- 大模型厂商 ARR 增速放缓。
- 云服务商资本开支不及预期。
- 智能驾驶及机器人商业化落地不及预期。
结论
数字 AI 与物理 AI 共享技术底层,但物理 AI 面临更复杂的现实挑战。随着世界模型与强化学习的成熟,以及云车部署的逐步实现,物理 AI 将由能力展示走向大规模落地,成为当前 AI 发展最具成长弹性的方向。智能驾驶作为物理 AI 的代表场景,正从数字 AI 的能力外溢走向真正的闭环系统。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载