2025-07-07-华源证券-汽车行业深度报告_当自动驾驶与机器人共振_详解VLA与世界模型_46页_3mb
报告摘要
汽车行业深度报告总结
核心内容
本报告分析了2025年汽车行业的智能化趋势,重点探讨了自动驾驶技术从数据驱动向知识驱动的演进,以及VLA(视觉-语言-动作)模型在其中的作用。VLA模型被认为是具身智能的基础模型,具备处理多模态输入与输出的能力,能够实现更广泛的场景理解和任务泛化,为自动驾驶和机器人技术提供统一的智能化范式。
主要观点
- 自动驾驶的智能化方向:自动驾驶的最终目标是实现通用人工智能,而非简单的电子软件智能化。这要求汽车具备第一人称智能,即具备自我思考能力,以实现更复杂的交互性和极端场景适应性。
- VLA模型的优势:VLA模型结合了视觉、语言和动作能力,通过多模态大语言模型增强理解与推理能力,有助于解决自动驾驶中的长尾问题、规划决策问题及提供直观解释。
- 知识驱动范式:与数据驱动不同,知识驱动更关注模型的类人性、泛化性和推理能力,使汽车从单纯的驾驶工具演变为具有交互能力的物理智能体。
- 工程化挑战:尽管VLA模型具备潜力,但当前车端VLA模型仍面临工程部署的挑战,包括数据闭环构建、3D空间感知、长时序记忆等关键问题。
关键信息
1. 自动驾驶范式升级
- 从数据驱动到知识驱动:自动驾驶模型正在从依赖大量数据的模仿学习向具备推理和理解能力的知识驱动范式转变。
- 模块化与端到端模型:传统模块化算法因无法Scaling而存在缺陷,端到端模型则通过统一的输入输出流程提升整体性能。
- LLM的引入:多模态大语言模型(MLLMs)的引入为VLA模型提供了知识驱动能力,使其能够进行更复杂的推理与决策。
2. VLA模型的构建与部署
- VLA模型架构:包括多模态编码器、大语言模型和解码器,部分模型仅使用LLM主干输出动作指令。
- 3D GS技术:3D GS是一种基于高斯分布的场景重建方法,具有较高的计算效率和良好的动态适应性,适用于自动驾驶的场景重建与实时渲染。
- 长时序记忆机制:为解决模型对长时序信息处理能力不足的问题,VLA模型引入了稀疏注意力机制与动态记忆模块,提高模型的推理能力与轨迹规划性能。
- 模型优化与部署:包括模型量化、MOE架构、推理机制优化等,以提高端侧计算效率,实现VLA模型的工程化部署。
3. 世界模型与仿真环境构建
- 世界模型的作用:世界模型通过预测环境演化和智能体行为,为VLA模型提供闭环测试和强化学习的基础。
- 仿真环境的重要性:构建高保真的仿真环境是实现VLA模型闭环测试与强化学习的关键,同时支持模型的泛化能力与交互性。
- 生成式世界模型:如DriveDreamer4D和Recon Dreamer,通过结合重建模型与生成模型,实现动态场景编辑与高保真渲染。
4. 典型VLA架构与案例
- Waymo EMMA:基于Gemini大语言模型,将输入和输出表示为自然语言文本,增强了模型的推理能力和可解释性。
- OpenDrive VLA:引入条件车辆运动预测任务,提升了模型的环境感知与交互能力。
- 小米ORION:通过QT-Former模块实现长时序记忆,提升了模型的推理与规划能力。
- 理想MindVLA:融合空间、语言及行为智能,采用自研模型和云端世界模型强化学习,实现了优秀的模型表现与泛化能力。
投资建议
- 受益公司:理想汽车和小鹏汽车在VLA范式落地方面进展较快,建议关注其技术发展和市场表现。
风险提示
- 新技术迭代风险:自动驾驶技术仍处于快速演进阶段,技术更新可能导致投资风险。
- 市场竞争加剧风险:随着技术发展,市场竞争可能加剧,影响企业盈利空间。
- 宏观经济环境波动风险:宏观经济环境的变化可能对汽车行业的投资回报产生影响。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载