大模型及机器人算法-+VLA技术分解_51页_4mb
报告摘要
VLA技术分解与理想汽车MindVLA总结
核心内容
VLA(Vision-Language-Action)技术是一种将视觉、语言和行动整合为统一架构的端到端模型,旨在实现机器人和自动驾驶系统的智能行为决策。其核心在于“全程可求导”,即从视觉输入到轨迹输出,整个过程都可以进行端到端优化。
主要观点
- VLA技术突破了传统E2E+VLM的“非全程可求导”限制,通过统一的“V -> L -> A”流程,实现了从感知到行动的端到端推理。
- VLA的三个核心组件是:视觉编码器(V)、语言编码器(L)和动作解码器(A)。
- 理想汽车的MindVLA和小米的ORION分别采用了不同的技术路线,MindVLA强调从零开始构建的3D场景理解能力,而ORION则强调对齐与模块化设计。
关键信息
视觉编码器(V):VLA的“眼睛”
- 主流方案:
- CLIP/SigLIP:擅长内容识别(What),通过对比学习训练。
- DINOv2:擅长空间理解(Where/How),通过自监督学习训练。
- 顶尖方案:SigLIP + DINOv2双编码器方案,通过MLP投影器将两种特征融合,实现更全面的视觉表示。
- 理想MindVLA的V模块:
- 使用3D高斯建模(3DGS),构建高保真的3D场景表示。
- 通过自监督3D编码器预训练,直接从传感器数据生成场景表示。
- 使用3D Tokenizer/Projector,将3DGS转换为LLM可理解的输入。
语言编码器(L):VLA的“大脑”
- 主流选择:
- LLaMA家族:如LLaMA-2和Vicuna,是当前VLA的主流语言模块。
- Qwen系列:如Qwen-2.5,也在VLA领域扮演重要角色。
- 其他模型:GPT系列、Gemma等也参与其中,体现了VLA架构的多样性。
- 理想MindVLA的L模块:
- 使用MindGPT,一个专门为3D驾驶场景设计的自研LLM。
- 采用MoE + 稀疏注意力架构,优化车端推理效率。
- 使用并行解码,实现30Hz实时动作输出。
- 预训练任务包括“未来帧预测”和“条件输出(CoT)”,增强对3D空间和时序的推理能力。
动作解码器(A):VLA的“手脚”
- 主流方案:
- 基于扩散的Transformer:擅长生成连续、平滑的轨迹,如Octo、MindVLA和ORION。
- 自回归Transformer头:如Gato,适用于实时响应。
- MLP预测器头:如OpenVLA,用于低级控制。
- 嵌入式MPC/规划头:如VoxPoser,用于动态决策。
- 理想MindVLA的A模块:
- 采用扩散模型,生成“拟人化”的轨迹。
- 引入ODE Sampler,将去噪步骤压缩至2-3步,实现30Hz实时控制。
- 实现“行为的集体建模”,预测自车与他车的轨迹。
VLA的“积木”小结
- V模块:负责3D场景理解,提供高保真的视觉表示。
- L模块:负责语言推理,输出“规划Token”或“动作Token”。
- A模块:负责轨迹生成,将抽象的“规划Token”转化为具体的控制信号。
VLA的四个进化阶段
- 阶段一:语言模型作为“解释器”:使用冻结的视觉模型与LLM解码器。
- 阶段二:模块化VLA模型:VLM生成中间表示,再送入独立的动作头。
- 阶段三:统一的端到端VLA模型:将VLM和动作头合并为一个大模型。
- 阶段四:推理增强的VLA模型:引入“规划Token”和“工具使用代理”,实现更复杂的决策。
理想MindVLA与ORION对比
| 模块 | MindVLA | ORION |
|---|---|---|
| V模块 | 3DGS,直接进行3D场景重建 | SigLIP + DINOv2,融合内容和空间信息 |
| L模块 | MindGPT,从零训练,专为3D驾驶设计 | Vicuna v1.5,通过QT-Former处理时序 |
| A模块 | 扩散模型,生成拟人化轨迹 | 生成模型(如VAE),根据“规划Token”生成轨迹 |
| 训练方式 | 从零预训练,结合3D Tokenizer | 使用开源LLM + LoRA微调 |
| 实时性 | 通过MoE + 稀疏注意力 + 并行解码实现 | 通过QT-Former + 生成模型实现 |
世界模型与RLHF
- 世界模型:基于3DGS的高保真场景表示,用于模拟和预测未来状态。
- RLHF(人类反馈强化学习):通过人类偏好校准VLA行为,提升安全性和舒适度。
- 三模态对齐数据:包括视觉、语言和行动数据,尤其是长尾场景数据,是VLA训练的关键。
- 训练加速:MindVLA采用ODE Sampler,将训练速度提升7倍。
VLA大规模落地的挑战
- 算力瓶颈:大模型需要在车端实现30Hz实时推理,目前通过MoE和并行解码优化。
- 数据稀缺:高质量三模态对齐数据稀缺且昂贵,需依赖自动化标注和生成。
- 安全问题:LLM存在幻觉和误解风险,需引入安全验证机制。
- 用户感知:VLA在当前L2+级别提升有限,需在L3/L4实现其真正价值。
总结
VLA技术是具身智能的重要基石,其核心技术栈包括强大的视觉编码器、高效的LLM和先进的动作解码器。理想汽车MindVLA通过3DGS、从零预训练和ODE Sampler等技术,构建了一个统一的、高效的、具备强大推理能力的“统一大脑”。与此同时,ORION则通过解耦与对齐策略,实现语言与动作的无缝连接。未来,VLA将在自动驾驶和机器人领域发挥更大作用,但其大规模落地仍需克服算力、数据、安全和用户感知等多重挑战。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载