> **来源:[研报客](https://pc.yanbaoke.cn)** # 汽车行业深度报告总结 ## 核心内容 本报告聚焦于**云端基座模型如何在车端实现毫秒级推理**,分析了当前AI技术在智能驾驶场景中的应用挑战与优化路径。核心观点在于:**云端模型追求能力上限,而车端模型则以实时性、稳定性与安全性为核心目标**,两者存在显著差异,且需要不同的优化策略。 --- ## 主要观点 - **缩放定律与车端约束不一致**:云端缩放定律以训练算力最小化损失为目标,未考虑推理成本与部署时延。加入推理成本后,部署最优模型倾向于更小参数、更多训练数据,以满足车端低时延需求。 - **车端实时性是大模型上车的核心瓶颈**:自动驾驶模型需在固定车规算力下满足≥30Hz的推理帧率要求,而当前主流车型的推理帧率仍低于这一标准,如理想VLA为10Hz,NVIDIA Alpamayo-R1为10Hz。 - **云端效率优化路径**: - **模型稀疏化**:如MoE、MLA、MTP等,通过激活部分专家、低秩注意力压缩等方式降低计算复杂度。 - **视觉Token剪枝**:如LightVLA、FastDriveVLA等,通过动态评估和重建式剪枝减少视觉输入冗余。 - **思维链压缩**:如FutureX、DynVLA等,采用隐式或动态Token替代冗长思维链,提升推理效率。 - **世界模型优化**:如X-Cache,通过跨分块特征复用加速仿真推理。 - **车端部署优化路径**: - **教师-学生蒸馏**:如Waymo、理想、小鹏等,将云端大模型压缩为适合车端运行的小模型。 - **快慢双系统架构**:将快速反应与复杂推理分层处理,提升系统整体响应速度与稳定性。 - **推理工程手段**:包括量化、并行解码、采样步数压缩、编译优化等,以实现端到端低时延运行。 - **未来云车分工趋势**:云端负责能力扩展与世界模型训练,车端负责实时推理与稳定部署,形成“云端探上限,车端保实时”的协同分工。 --- ## 关键信息 ### 云端与车端算力对比 | 车端芯片 | 峰值算力 (TOPS) | |----------|----------------| | NVIDIA Orin-X | 约254 | | NVIDIA Thor-U | 约700 | | 理想L8 | 约2.8× Orin-X | | 领克900 | 约2.8× Orin-X | | 小米YU7 | 约2.8× Orin-X | | 极氪9X | 约2.8× Orin-X | ### 云端基座模型与车端部署规模对比 | 厂商 | 云端基座参数量 | 蒸馏后车端参数量 | 部署芯片 | |------|----------------|------------------|----------| | 理想 | 约32B | 约4B | Thor | | 小鹏 | 约720亿 | 蒸馏版第二代VLA | 自研图灵芯片 | | Waymo | Waymo Foundation Model(超大规模) | 学生模型(更小) | 自研芯片 | | 华为/引望 | DynVLA(8B骨干) | 面向量产落地 | EMU3芯片 | ### 云端效率优化技术 | 方法 | 核心机制 | 收益 | |------|----------|------| | MoE | 稀疏激活,仅部分专家参与 | 模型容量与单次推理算力解耦 | | MLA | KV缓存低秩联合压缩 | KV缓存降至约70KB/Token | | MTP | 投机解码 | 提升推理效率 | | FP8 | 低精度训练与推理 | 降低计算开销 | | 线性注意力 | 将序列复杂度由二次降为线性 | 降低FLOPs需求 | | X-Cache | 跨分块特征复用 | 块跳过率71%,推理加速2.6–2.7倍 | | LightVLA | 动态查询+Gumbel-Softmax | FLOPs-59.1%,时延-38.2% | | FastDriveVLA | 重建式前景Token剪枝 | Token减少7.5倍,FLOPs下降 | | FutureX | 隐式CoT世界模型 | PDMS提升6.2 | | DriveMoE | 场景特化视觉MoE + 技能特化动作MoE | 压低视觉冗余,避免模式平均 | --- ## 风险提示 1. **技术迭代不及预期**:数字AI与物理AI技术进展可能低于预期。 2. **大模型厂商ARR增速放缓**:客户增长、续费率或客单价不及预期可能影响收入增长。 3. **云服务商资本开支不及预期**:AI算力需求或投资回报低于预期可能影响云服务商投入。 4. **智能驾驶及机器人商业化落地不及预期**:产品可靠性、成本控制或用户需求可能低于预期。 --- ## 结论 未来AI在智能驾驶场景中的部署将呈现“**云端探上限、车端保实时**”的分工趋势。云端模型持续扩展参数与能力边界,而车端则通过蒸馏、快慢双系统与推理工程实现低时延、高稳定性的部署。此路径需依赖云端效率优化成果与车端系统工程能力,同时受到技术、芯片供给、功能安全验证等多重因素影响。 --- ## 附录:相关研究 - 《AI 系列深度 17 期:视觉智能为何引入 Transformer?》 - 《AI 系列深度 16 期:语言智能为何从 RNN 转向 Transformer?》