计算机专题研究:RT-2:谷歌具身智能新突破_11页_1mb
报告摘要
谷歌具身智能RT-2技术突破分析
谷歌于2023年7月推出具身智能模型RT-2,作为RT系列的第二代产品,定位为视觉语言动作(VLA)模型,实现视觉语言模型与机器人动作的结合。
具身智能概述
具身智能是AI下一个浪潮,指能够理解、推理物理世界并与之互动的智能系统。谷歌依托GoogleBrain和DeepMind两大机构,延续性研究具身智能技术路线,包括视觉语言模型PaLM-E、机器人模型RoboCat等。
RT-1与RT-2技术发展
- RT-1:吸收机器人轨迹数据的Transformer架构模型,主体包含EfficientNet卷积神经网络、Token学习器和Transformer,收集13万台机器人13万条数据,覆盖700+任务,具备良好泛化能力。
- RT-2:
- 结合VLM的语义推理和机器人动作数据
- 将机器人动作拆解为文本token,与视觉语言数据联合微调
- 部署于多TPU云服务,支持1-5Hz运行频率
- 基于PaLM-E与PaLI-X的实验证明,RT-2具有更强泛化和涌现能力
技术架构与创新点
- 架构组成:
- 卷积神经网络(EfficientNet)处理图像
- Token学习器提取语义特征
- Transformer预测机器人动作序列(包括臂移动、基部移动、模式切换等)
- 训练方法创新:
- 将机器人动作量化为8位整数字符串
- 视觉语言数据与机器人动作数据混合微调
- 推理部署:
- 专用协议通过TPU云服务实现实时推理
- RT-2-PaLI-X-55B支持高达5Hz运行频率
数据来源与动作映射
- 数据获取模式:
- 真实数据(Google耗时17月收集13万条)
- 真实+合成数据
- 完全合成数据(如NVIDIA Optimus)
- 语义推理替代感知(斯坦福VoxPoser)
- 动作映射方式:
- 高层级预测(PaLM-E等)需借助底层策略
- 低层级预测(RT-2等)可直接映射机器动作
泛化与涌现能力
实验表明RT-2优于基线模型:
- 泛化能力:对新物体、新场景表现出色
- 涌现能力:可完成训练数据中未出现的符号推理任务
- 支持思维链(CoT)推理,提升复杂任务处理能力
投资机会
机器人作为大模型重要入口,推荐相关标的:
- 柏楚电子(688188)
- 中科创达(300496)
- 萤石网络
风险提示
- 宏观经济波动
- 技术研发不及预期
- 行业变革节奏变化
- 投资建议不构成法律效力
免责声明与分析师声明为报告重要组成部分,请务必一同阅读。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载