> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结:智能驾驶 VLA 模型的架构范式与厂商路线 ## 核心内容概述 本报告聚焦智能驾驶领域中 VLA(Vision-Language-Action)模型的技术演进与厂商路线分化,探讨其在自动驾驶系统中的应用潜力与挑战。VLA 模型通过整合视觉感知、语言理解和动作决策,旨在提升自动驾驶系统的语义理解、决策解释性和场景泛化能力,是端到端范式向多模态、大模型方向演进的体现。 ## 主要观点 - **VLA4AD 范式升级**:从模块化流水线到端到端,再到 VLA4AD,自动驾驶技术正在向“视觉-语言-动作”统一策略模型演进,以弥合 VLM4AD 的动作生成缺口。 - **VLA4AD 架构**:包括视觉编码器、语言处理器和动作解码器三大核心模块,其中动作解码器有三种主要技术路线:自回归分词器、扩散头和分层控制器。 - **阶段演进**:VLA4AD 内部演进分为四个阶段,语言模型从“被动解释器”逐步演进为“推理中枢”,强化了语言在决策中的作用。 - **厂商路线分化**:头部厂商在是否保留显式语言推理层上已出现明显分歧,Waymo、理想、元戎启行、千里科技与小鹏分别采取不同策略。 - **小鹏第二代 VLA**:弱化语言中间层,强化视觉思维链,实现从视觉到动作的端到端输出,推理效率提升 32 倍,预测误差降低 33%,具备多模态输出能力。 - **挑战与展望**:VLA4AD 在鲁棒性、实时性能、数据标注、多模态对齐、多智能体协同和评测体系等方面仍面临诸多挑战,未来需依赖数据闭环、模型优化与硬件升级实现量产落地。 ## 关键信息 ### VLA4AD 技术架构 | 模块 | 功能说明 | 方法/技术 | |--------------|--------------------------------------------|----------------------------------| | 视觉编码器 | 将异构传感数据转化为语言对齐的隐层特征 | DINOv2、ConvNeXt-V2、CLIP 等 | | 语言处理器 | 引入大语言模型进行语义推理与决策支持 | LoRA、RAG、MoE、稀疏注意力等 | | 动作解码器 | 将多模态表征转化为控制信号或轨迹 | 自回归分词器、扩散头、分层控制器 | ### VLA4AD 四阶段演进 | 阶段 | 语言 LLM 角色 | 时间 | 代表模型 | 主要问题 | |--------------|-----------------------|--------------|-------------|------------------------------| | 预 VLA 阶段 | 被动解释器 | 约 2023 年 | DriveGPT-4 | 描述延迟、语义隔阂 | | 模块化 VLA | 规划协作者 | 2024—2025 | OpenDriveVLA | 多阶段流水线误差放大、响应慢 | | 统一端到端 VLA | 动作生成器 | 2025 年 | EMMA | 长时程推理弱、解释粒度不足 | | 推理增强 VLA | 推理中枢,引入 CoT 与记忆 | 最新阶段 | ORION | 长时域推理、记忆与交互整合 | ### 厂商 VLA 路线对比 | 厂商 | 模型名称 | 输入方式 | 语言处理方式 | 动作解码方式 | 公开指标/特点 | |----------------|------------------|------------------------------|--------------------------|------------------------|---------------------------------------------| | Waymo | EMMA | 环视相机,纯视觉 | Gemini 统一语言空间,CoT | 轨迹文本 token | nuScenes 规划 SOTA,CoT 提升 6.7% | | 理想 | MindVLA | 摄像头+LiDAR,3D 高斯表征 | MindGPT,MoE+稀疏注意力 | Diffusion 扩散轨迹 | 车端实时运行,支持快慢双模式 | | 元戎启行 | 40B VLA | 视觉输入为主 | Analyst 因果推理,三角色 | 实时驾驶动作 | 数据闭环周期压缩至约 12 小时,单月份额近 40% | | 千里科技 | CoWorld-VLA | 图像+导航+车辆状态 | Qwen3-VL,四类专家 Token | 扩散式 HMEF 规划器 | NAVSIM v1 PDMS 89.8,FVD 32.7 | | 小鹏 | 第二代 VLA | 原生多模态 Tokenizer | 弱化语言层,强化视觉思维链 | 端到端直接输出动作 | 推理效率提升 32 倍,预测误差降低 33% | ## 技术与产业趋势 - **VLA 趋势**:VLA4AD 正在成为自动驾驶发展的新方向,融合视觉、语言与动作,推动智能驾驶向更高级别演进。 - **厂商分化**:部分厂商(如小鹏)倾向于弱化语言层,强化视觉—动作直出;另一些厂商(如理想)则保留语言推理层,强调多模态统一。 - **量产挑战**:算力、数据闭环、实时性与可靠性是 VLA 模型量产落地的关键障碍。 - **未来方向**:物理 AI 成为下一阶段重点,智能驾驶作为最先跑通闭环的场景,具备更高的商业落地价值。 ## 风险提示 - 技术迭代不及预期 - 大模型厂商 ARR 增速放缓 - 云服务商资本开支不及预期 - 智能驾驶及机器人商业化落地不及预期 ## 总结 VLA4AD 是自动驾驶技术演进的重要一步,代表了视觉、语言与动作统一决策的新范式。当前厂商路线呈现分化趋势,部分强调语言作为决策核心,部分则偏向视觉—动作直出。小鹏第二代 VLA 作为典型案例,展示了弱化语言层、强化视觉思维链的路径,具有较高的推理效率与预测精度。尽管 VLA4AD 在技术上具备潜力,但其规模化落地仍面临数据、算力、实时性、多模态对齐与评测体系等多重挑战。未来,随着基础模型的优化、数据闭环的完善与硬件算力的提升,VLA4AD 可能成为智能驾驶发展的主流架构之一。