电力设备行业专题报告:海外科技研究-从谷歌看机器人大模型进展-20231119-华鑫证券-26页_1mb
报告摘要
谷歌机器人大模型进展研究总结
1. 核心观点:人形机器人的发展需要大模型的支持
人形机器人的本质在于泛化能力和通用性,大模型的通识理解能力为机器人实现了从单一任务向多任务场景的跨越。谷歌模型从SayCan到RT-X的演进,体现了这一核心目标。
2. 谷歌机器人大模型发展路径
2.1 从SayCan到RT-X,模型迭代逻辑
- 2022年4月 SayCan:
首次将大模型用于任务拆解,结合LLM和价值函数,仍存在底层泛化能力弱的问题。 - 2023年 RT-1:
基于Transformer控制视觉任务,支持700个文字指令,但依赖预设数据。 - 2023年 PaLM-E:
多模态大模型结合PaLM与视觉组件,输入多样,但未深入动作控制。 - 2023年 RT-2:
引入思维链功能,提升推理与泛化能力,但仍局限于桌面场景。 - 2023年 RT-X + OpenX数据集:
开源全球最大机器人数据集,显著提升任务完成率。
2.2 技术演进特点:
- 从任务级指令到动作级控制逐步推进。
- 逐步引入“思维链”,提升任务规划与语义理解。
- 使用数据集OpenX微调模型,提升泛化能力与涌现能力。
3. 机器人大模型产业链现状与挑战
3.1 当前局限:
- 任务主要集中于单机械臂抓取:缺乏泛化能力,距离人形机器人实际应用相距较远。
- 专用模型路线尚不统一:如价值函数、tokenization、语义映射等工作尚未收敛。
- 控制精度与语义理解之间存在断层:大模型尚未在底层操作与实体运行中发挥重要作用。
3.2 数据与算力瓶颈:
- 数据:机器人需要主动执行任务产生的高质量场景数据,无法从互联网大规模获取。
- 算力:大模型所需算力远超视觉模型,未来机器人大模型将形成部署梗阻。
4. 产业启示与投资机会
4.1 机器人发展路径(未来):
大模型在机器人中的应用分为短期和中长期路径:
- 短期(2024–2027):通识大模型+任务理解+基元动作控制微调,由第三方模型开放基础通用能力;
- 中长期(2028–以后):RT-2式全端大模型,实现从规划到执行的整体闭环。
4.2 投资机会:
- 算力升级:满足机器人高频交互与大模型算力需求。
- 数据服务与场景落地:开源数据集如OpenX、具体场景适配模型服务商。
- 机器人本体与软件系统融合公司:如具备本体制造与模型部署能力的企业。
5. 风险提示
- 机器人终端应用发展滞后或不及预期。
- 相关行业竞争加剧,产品噱头与实际稳定差距大。
- 技术迭代路线尚未定型,存在路线失效风险。
数据来源:华鑫证券研究所整理。
以上内容是对海外科技研究中谷歌机器人大模型进展的总结,可用于判断未来产业化方向和投资机会。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载