机械设备行业点评:从英伟达的布局看机器人的大模型和训练-240806-国盛证券-14页_1mb
报告摘要
好的,这是报告内容的总结:
报告总结:英伟达从布局看机器人模型与训练挑战
本报告分析了英伟达在机器人领域,特别是人形机器人的代表性项目GR00T,并对比了机器人训练的现有痛点及潜在解决方案。
核心内容
-
人形机器人模型发展:
- 早期:运动主要依赖预编码的预设路径。
- 初步自主:大型语言模型(LLM)的应用,使机器人能脱离预设路径进行自主决策,但仍为分层结构,缺乏涌现能力和实时反馈。
- 当前主流:分层端到端模型已成为首选。
- 优点:精确度高、系统响应效率更高、灵活性(能处理图像、声音、动作等多种输入)、可通过仿真模拟收集训练数据。
- 痛点随技术发展而变化:从训练数据收集困难、成本高昂,到模型计算资源消耗大、吞吐能力低。
-
英伟达GR00T项目:
- 目标:开发人形机器人的通用基础模型。
- 定位:一个为波士顿动力、Figure AI、小鹏等公司等众多人形机器人提供AI平台。
- 核心:接收多模式指令和过往交互,输出机器人动作,具有模块化设计和快速响应特性。
- 技术栈:基于NVIDIA AI、DGX、Isaac Lab和Jetson Thor等平台的强大计算能力。
- 最新进展:通过仿真大幅提升训练数据效率。
- 方法:结合真实数据(使用Apple Vision Pro收集人手轨迹)与仿真数据扩展(如下厨房场景物理属性变化、RTX Video Codec加速反馈回路、MimicGen生成并过滤动作数据,扩展至原数据数千倍)。该方法大幅降低了昂贵的人类示范数据成本,并提高了机器人从仿真到真实场景的泛化能力。
-
机器人训练数据挑战及向量解决方案:
- 痛点:数据严重不足(相比大语言模型最著名的一个数据集达到15T tokens,机器人数据集仅24M),获取成本高昂(现为机器人领域最痛苦的难点),且训练场地模型熟练度未必能外推至其他场景。
- 解决方向:通过扩展学习,利用GPU加速仿真。
行业洞见
- 优缺点对应:端到端模型虽能力强,但新问题随之而来(成本、数据、响应)。
- 不同公司的投入与成果体现:Tesla Optimus局部泛化性能优异;Galbot G1在家庭场景表现良好;银河通用提出“三维视觉小模型+基础大模型”的三层级架构以提升性能。
- 关键指出:真正的泛化能力尚未普及,技术应用存在未知风险。
风险提示
- 制造业扩产不及预期。
- 行业竞争格局恶化风险。
- 机器人应用模型开发不及预期风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载