深度报告-20250809-东吴证券-机器人大模型深度报告_我们距离真正的具身智能大模型还有多远_56页_5mb
报告摘要
机器人大模型深度报告:通往具身智能的路径与投资机会
1. 关键发现与洞察
1.1 行业背景
人形机器人的研发正处于从“形态仿真”向“智能体”的关键跃迁。传统工业机器人受限于“控制刚、泛化弱”的特性,而新一代人形机器人依赖 大模型作为“初级大脑” ,以实现多模态感知与复杂环境互动。当前模型尚处于L2初级阶段,智能化升级仍面临建模方法、数据规模与训练范式三大挑战。
1.2 技术进展
架构演进
机器人模型架构从早期SayCan/RT-1的基础任务规划,迭代至融合多模态感知与动作执行的大规模具身模型(如PaLM-E、RT2、π0),动作输出频率从1Hz提升至200Hz,推理链路逐步打通。代表性架构演进如下:
- SayCan/RT-1:任务-动作离散耦合;
- PaLM-E:首代具身多模态语言模型;
- RT2/Helix:端到端VLA架构与快慢脑并行设计,支持高频动作输出;
- π0/π0-Fast:动作专家+扩散模型,实现50Hz动作输出。
数据策略
数据端遵循“仿真+真机”融合原则,三类数据协同支撑模型训练:
- 互联网数据:低成本预训练,占比较大;
- 仿真数据:生成效率高,用于冷启动;
- 真机数据:采集成本高,关键用于后训练,占比约10%。
新范式突破
- 引入 世界模型(如Cosmos),实现物理规律模拟与任务泛化;
- 扩展至触觉(VTLA)、动作扩散模型等下一代技术,提升交互精度。
1.3 投资建议
模型端
优先关注具备多模态能力、全仿真训练路线或端到端架构的头部企业:
- 银河通用:全球最大数据体量(十亿帧),全仿真驱动模型;
- 星动纪元:双系统架构+Fusion世界模型,商业化闭环;
- 智元机器人:ViLLA架构融合VLM+动作专家+世界模型,技术栈领先。
数据链
重点关注动捕设备、数据采集与训练场基础设施布局企业:
- 青瞳视觉:光学动捕系统,与头部机器人厂商深度合作;
- 凌云光:FZMotion动捕产品,动捕市场规模第一;
- 奥比中光:3D视觉与芯片技术,赋能机器人传感;
- 天奇股份:机器人实训场建设,将汽车产线作为数据来源。
1.4 风险提示
- 技术迭代风险:模型泛化能力尚未成熟,商业落地不及预期;
- 数据瓶颈:高质量真机数据获取成本高、效率低;
- Sim2RealGap:仿真与真实环境对齐难度大,影响模型表现。
2. 技术架构脉络图
graph LR
A[SayCan-R1] -->|任务规划| B[RT2]
B --> C[PaLM-E]
C --> D[π0]
D --> E[Helix]
F[互联网数据] --> G[预训练]
G --> H[仿真数据]
H --> I[真机数据]
I --> D
E -->|动作扩散模型| J[冯元]
3. 投资逻辑矩阵
| 公司 | 技术路线 | 进展阶段 | 应用场景 | 竞争壁垒 |
|---|---|---|---|---|
| 银河通用 | 全仿真预训练 | 全球首个十亿级帧数据模型 | 商业/工业/医疗 | 仿真数据生成能力 |
| 星动纪元 | 端到端双系统 | 支持100+灵巧操作 | 数字人/AIGC | 硬件+软件协同 |
| 智元机器人 | Vision-Language-Action架构 | 端到端世界模型 | 科研/仿真训练 | 动作专家系统 |
| 青瞳视觉 | 光学动捕 | 高端30万+/工位 | 数字孪生工厂 | 算法速度IMU精度 |
| 天奇股份 | 汽车场景 | 700+产线数据 | 钳工自动化 | 行业KnowHow积累 |
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载