> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结:从LLM到VLA的技术演进与产业影响 ## 核心内容概述 本报告聚焦于人工智能技术在汽车行业的演进路径,从语言模型(LLM)到视觉语言模型(VLM),再到视觉-语言-动作模型(VLA),分析了技术发展脉络、核心机制、应用场景及代表性模型。报告指出,LLM、VLM、VLA代表了AI能力从数字世界向物理世界延伸的三个阶段,技术难度逐级提升,应用场景也由虚拟扩展到现实操作。随着技术演进,VLA成为最具潜力的增量方向,尤其在智能驾驶和机器人领域。 ## 主要观点 - **LLM** 是以文本为核心的语言基础模型,具备语言理解、生成和推理能力,广泛应用于对话助手、编程、搜索等领域。 - **VLM** 在LLM基础上加入视觉模态,实现图文对齐与多模态交互,应用场景扩展至图像理解、视觉推理、GUI操作等。 - **VLA** 是当前AI技术发展的前沿方向,将动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中执行任务。其核心机制包括动作离散化、连续生成及双系统分工。 - **技术演进路径**:LLM → VLM → VLA,代表了AI能力从语言处理到视觉理解再到物理控制的递进。 - **产业布局**:海外厂商如OpenAI、Google、Meta主导LLM/VLM,Google、NVIDIA、Physical Intelligence等布局VLA;国内厂商如DeepSeek、阿里、字节、百度、腾讯等聚焦LLM/VLM,智元、银河通用等则专注于VLA与机器人本体。 - **未来趋势**:物理AI将成为AI发展的新增长点,智能驾驶作为最先实现闭环的场景,值得重点关注。 ## 关键信息 ### 技术演进与能力边界 | 层次 | 输入 | 输出 | 核心能力 | 应用场景 | |------|------|------|----------|----------| | **LLM** | 文本 | 文本 | 语言理解、生成、推理 | 对话助手、编程辅助、搜索、智能体 | | **VLM** | 图像 + 文本 | 文本 | 图像理解、视觉推理、图文问答 | 多模态助手、文档解析、GUI操作 | | **VLA** | 图像 + 语言指令 + 本体状态 | 机器人动作 | 泛化操作、具身智能、物理闭环 | 自动驾驶、人形机器人、工业机械臂 | ### 技术机制对比 | 模型类型 | 核心机制 | 输出方式 | 代表模型 | |----------|----------|----------|----------| | **LLM** | 自回归预训练、Transformer | 文本生成 | GPT-3、DeepSeek-R1、通义千问 | | **VLM** | 视觉编码 + 模态对齐 + 语言推理 | 文本生成 | CLIP、GPT-4V、Qwen-VL | | **VLA** | 动作token化、流匹配、双系统分工 | 离散/连续动作 | RT-2、π0、GR00T N1 | ### 产业布局与竞争格局 - **LLM/VLM**:由OpenAI、Google、Meta、DeepSeek、阿里、字节、百度、腾讯、智谱等主导。 - **VLA**:Google DeepMind、NVIDIA、Physical Intelligence、智元、银河通用等布局。 - **国内厂商**:智元、银河通用等聚焦VLA与机器人;字节、阿里、腾讯等通过基座能力向下延伸或通过投资布局。 ### 技术路线分化 - **动作token化**:适用于离散动作预测,如RT-2。 - **连续动作生成**:通过扩散策略或流匹配生成连续轨迹,如π0。 - **双系统分工**:高层VLM负责意图理解,低层动作模型负责执行,如NVIDIA GR00T N1。 ## 风险提示 - **技术迭代不及预期**:数字AI与物理AI进展可能低于预期。 - **ARR增速放缓**:大模型厂商收入增长可能受限。 - **云服务商资本开支不及预期**:算力需求或投资回报不及预期。 - **商业化落地不及预期**:智能驾驶与机器人产品可能因可靠性、成本或需求不足而延迟。 ## 未来展望 随着技术从数字世界向物理世界扩展,VLA将成为AI发展的重要方向。其在智能驾驶和机器人领域的应用前景广阔,但面临数据采集、系统接口设计、实时控制等挑战。未来竞争将不仅限于模型能力,还涉及数据、硬件、动作控制与场景闭环等多方面。