> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容概述 本报告聚焦于**人工智能在自动驾驶领域的发展路径**,重点分析了从**模仿学习到强化学习**的范式跃迁趋势,以及**世界模型**与**强化学习**在物理闭环任务中的协同作用。报告指出,随着自动驾驶技术向L4级别演进,强化学习正从辅助工具转变为关键环节,成为突破模仿学习局限、提升系统安全与性能的核心手段。 --- ## 主要观点 ### 1. 模仿学习与强化学习的角色分化 - **数字 AI**(如大语言模型)以互联网级语料为基础,模仿学习能覆盖多领域知识,形成高能力底座,强化学习则用于偏好对齐与推理增强。 - **物理 AI**(如自动驾驶)以人类驾驶轨迹为模仿对象,能力上限受限于数据质量和覆盖范围,难以自发超越人类安全水平。因此,强化学习成为突破模仿上限、筛选安全行为的关键。 ### 2. 强化学习在物理闭环任务中的关键地位 - 强化学习在自动驾驶中不仅用于事后增强,更成为突破能力上限的核心环节。 - 它通过设置奖励机制,引导模型学习安全、高效、舒适的行为,避免不良驾驶行为。 ### 3. 世界模型与强化学习的双向共生 - 世界模型提供高保真闭环试错环境,支持强化学习的训练、验证与优化。 - 真实数据反向校准世界模型,形成“强化学习 → 世界模型 → 真实数据”的闭环循环。 - 当前主流工程方向为**生成式与重建式世界模型的结合**,以兼顾泛化能力与物理约束。 --- ## 关键信息 ### 模仿学习的局限性 - **协变量漂移**:模仿学习在训练分布外表现不稳定,误差会随时间累积。 - **长尾场景缺失**:危险、异常场景难以通过真实道路采集,限制模型泛化能力。 - **人类驾驶不完美**:复杂低频场景样本稀缺,模仿学习难以覆盖。 ### 强化学习的突破作用 - 强化学习用于提升驾驶行为的**安全性与可靠性**,尤其在L4级别自动驾驶中,需远超人类表现。 - 强化学习在自动驾驶中的作用包括:**行为筛选、策略优化、闭环训练**。 ### 世界模型的作用 - 世界模型是强化学习训练的基础,提供可控、可重置、可注入危险事件的仿真环境。 - 世界模型分为**重建式**(基于真实数据)和**生成式**(泛化能力强),两者结合是当前主流趋势。 --- ## 产业实践分析 ### 技术路线分化 | 厂商 | 技术路线 | 强化学习角色 | 世界模型/仿真环境 | 落地状态 | |--------------|----------------------------------|--------------------------------------|------------------------------------|----------------------------| | 特斯拉 | 端到端神经网络 + FSD V12→V14 | V14 引入更激进 RL,优化安全关键结果 | 学习型世界模拟器,可合成多路画面、注入对抗事件 | FSD V14 已推送,Robotaxi 试点 | | 小鹏 | 云端训练大模型 → 蒸馏部署至车端 | 云端后训练含 RL,再蒸馏上车 | 重建+生成世界模型,用于大规模闭环 RL | XVLA 量产路线 | | 理想 | MindVLA/MindVLA-o1 | 重建+生成统一世界模型,MindSim | 重建+生成世界模型,用于大规模 RL训练 | MindVLA 规划量产 | | Momenta | 一段式端到端 → R6 飞轮 → R7 世界模型 | R6 量产端到端 + RL,R7 世界模型中做 RL | R7 三层世界模型 | R6 首搭别克至境 L7 | | 地平线 | HSD 一段式端到端 + 强化学习 | 交互式博弈强化学习,仿真平台训练 | 端到端世界模型 + 交互博弈 | HSD 首搭星途星纪元 E05 | | 千里科技 | 千里智驾 RLM + 千里浩瀚 G-ASD | 预训练+特训+RL三段 | 仿真世界模型;G-ASD 世界行为模型 | 千里浩瀚多车型 | | 华为乾崑 | WEWA 架构(世界引擎+世界行为模型) | 以仿真环境中 RL 探索为核心 | 云端世界引擎生成高密度难例 | ADS4 已推送 | | 卓驭 | 端到端 + 强化学习 | 把系统从 80 分提升至 95 分 | 公开披露有限 | 多车型量产合作 | | 元戎启行 | 车端 VLA | 公开侧重 VLA,RL 细节有限 | 探索车外具身场景 | VLA 方案推进量产 | | Waymo | L4 Robotaxi | 基础模型 + 大规模仿真 | EMMA 基于 Gemini,大规模仿真环境 | Robotaxi 已商业化 | | 小马智行 | L4 Robotaxi | PonyWorld 基于 RL 范式 | 生成场景、高保真仿真、行为评估 | 第七代量产、车队扩张 | | 文远知行 | L4 Robotaxi/通用 | 端到端 + 博弈论 + 飞轮效应 | 大规模云端仿真 | Robotaxi 多城运营 | ### 共性与分歧 - **共性**:多数厂商围绕“端到端+世界模型+强化学习”构建技术链路,强化学习普遍用于闭环训练。 - **分歧**: - 是否以**语言为中介**(如小鹏、理想、元戎、千里浩瀚 G-ASD 偏向 VLA,华为、地平线、Momenta 弱化语言中介); - 强化学习的**披露程度**(部分厂商对 RL 技术细节公开有限); - **落地形态**:量产辅助驾驶强调成本与部署,L4 Robotaxi 强调安全冗余与性能超越。 --- ## 结论 强化学习正从**可选增强**转变为**高物理闭环任务中的关键环节**,尤其在自动驾驶领域,其作用在于突破模仿学习的天花板,提升系统在复杂、危险场景中的表现。随着世界模型与强化学习的双向共生,行业正在向**高保真仿真环境**与**闭环训练机制**演进,未来技术路线将更趋收敛,但语言中介、数据规模与算力投入仍是关键变量。 --- ## 风险提示 1. **技术迭代不及预期**:数字 AI、物理 AI 技术进展低于预期,任务或应用场景拓宽速度低于预期。 2. **大模型厂商 ARR 增速放缓**:若客户增长、续费率或客单价不及预期,可能影响 ARR 增速。 3. **云服务商资本开支不及预期**:若 AI 算力需求及投资回报低于预期,云服务商可能下调资本开支。 4. **智能驾驶及机器人商业化落地不及预期**:产品可靠性、成本下降或用户需求低于预期,可能影响商业化进程。 --- ## 免责声明 本报告仅供东吴证券客户参考,不构成投资建议。报告内容基于公开信息整理,分析师力求准确但不保证其完整性。报告版权归东吴证券所有,未经书面许可,不得翻版、复制和发布。