计算机:RT-2,从VLM到VLA,机器人软件体系再次进步_13页_1mb
报告摘要
报告分析了Google DeepMind发布的RT-2模型,这是一个视觉-语言-动作(VLA)模型,继承自RT-1,并展示了显著的泛化性能提升,从RT-1的32%提高到62%。RT-2基于视觉语言模型(VLM)如PaLI-X和PaLM-E,直接将机器人动作表示为token输出,省略了指令翻译步骤,采用了思维链推理结合长期规划。模型验证了"ViT + 类GPT + 机械"架构,强调视觉Transformer(ViT)在机器人应用中的统一性。多模态GPT的发展提升了机器人的交互、规划、泛化和感知能力,预测在未来5年内通用和行业机器人将进入日常生活,10年内实现复杂交互。投资建议关注算法和机器人公司如大华股份、海康威视等,以及硬件供应商如三花智控、绿的谐波等,同时提示技术迭代、经济下行和竞争加剧的风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载