机器人大模型深度报告-我们距离真正的具身智能大模型还有多远_56页_5mb
报告摘要
投资要点总结
-
人形机器人为何需要高智能的大模型?
人形机器人产业化落地的核心在于智能化的提升,传统工业机器人依赖预设指令,缺乏对不确定性的适应能力。高智能大模型(如多模态VLM、VLA)为人形机器人提供了“大脑”,实现感知-任务理解-动作输出的闭环,数据飞轮机制可驱动模型与产品迭代。目前智能水平普遍为L2,距离L5泛化智能仍有差距。 -
当前机器人大模型的进展
- 架构端:从SayCan(任务规划+可行性评估)到RT-1(端到端Transformer)、RT-2(VLA+动作专家)、π0/Fast(50Hz输出)、Helix(快慢脑架构,200Hz输出)演化,动作输出频率及泛化能力提升显著。
- 数据端:互联网数据低成本预训练,仿真数据(如iToF、三维重建)提升动作能力,真机数据采集依赖高精度动捕设备,动捕领域光学与惯性系统各有侧重。主流采用“仿真:真实数据=9:1”混合训练模式。
- 未来大模型发展方向
- 模态扩展:引入触觉、温度等模态,构建VTLA(触觉+VLA)模型。
- 架构演进:融入世界模型(如Cosmos),通过状态预测实现环境建模与决策。
- 数据融合:仿真与真实数据协同,构建多场景、高多样性的训练场,支撑Scaling Law下的模型能力跃迁。
- 相关标的与投资建议
- 模型端:银河通用(全仿真训练)、星动纪元(双系统架构+世界模型)、智元机器人(ViLLA架构融合VLM+MoE)。
- 数据采集:青瞳视觉(光学动捕)、凌云光(FZMotion)、奥比中光(3D视觉感知)。
- 数据训练场:天奇股份(优必选合作)。
- 风险提示
- 技术瓶颈:模型泛化、动作频率不足及Sim2Real Gap问题。
- 数据依赖:高质量真机采集成本高、效率低,限制模型发展。
- 需求不及预期:人形机器人商业化路径尚未成熟,终端需求存在不确定性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载