人形机器人系列之八:人形机器人究竟需要怎样的AI模型?_33页_2mb
报告摘要
人形机器人系列之八:人形机器人究竟需要怎样的AI模型?
核心内容
人形机器人产业面临高需求与低渗透率之间的矛盾,其核心瓶颈在于通用化水平不足。实现任务级交互是提升人形机器人通用化和商业化落地的关键。大模型和基础模型各有优劣,需结合使用以实现人形机器人在不同场景下的应用。
主要观点
- 任务级交互是通用化关键:人形机器人需要在高层级规划上实现自主决策,以完成用户给出的抽象任务目标,从而提升其通用性。
- 多模态大模型带来新机遇:大语言模型在任务拆解、逻辑推理、自然语言交流等方面表现优异,多模态技术(如视觉、语言、触觉等)使得机器人更接近“具身智能”。
- 大模型赋能感知模块:Meta发布的SAM模型在图像分割任务中表现突出,大幅降低标注成本,提高机器人感知和理解环境的能力。
- 大模型与基础模型互补:大模型在高层级任务处理上表现优异,但存在实时性差的缺陷;基础模型在底层运动控制上更具优势,两者结合是当前商业化落地的可行方案。
- 长期依赖高效大模型:随着算力提升和模型结构优化,新一代高效大模型有望实现人形机器人的全面通用化。
关键信息
- 行业现状:人形机器人在工业和商用领域应用有限,商业化落地困难,主要受限于软件层面的通用性不足。
- 技术挑战:大模型在底层运动控制方面存在实时性不足的问题,难以满足10~100Hz的控制需求。
- 模型分类:
- 大模型(VLM/VLA):用于任务拆解、逻辑推理、自然语言交互,但需要较多算力和时间。
- 基础模型:适用于底层运动控制,具备更高的实时性和效率。
- SAM模型:Meta推出的图像分割模型,通过AI自动标注大幅降低训练成本,提高机器人对环境的感知能力。
- 多模态模型进展:
- SayCan:结合语言模型和Affordance函数,实现更符合现实的决策。
- PaLM-E:融合语言和视觉信息,实现多模态任务处理。
- ImageBind:支持6种模态的融合,提升模型的泛化能力。
- VLA模型:如RT-2和RoboCat,尝试实现感知-决策-控制一体化,提高机器人自主性和泛化能力。
- 商业化路径:短期内依赖基础模型+大模型的组合,实现小规模应用场景落地;长期则期待高效大模型推动通用化。
技术路线
- VLM+传统控制算法:通过大模型实现任务级决策,再借助传统控制算法完成运动控制。
- VLA一体化模型:直接将感知信号映射到运动控制指令,实现端到端控制,但目前仍存在实时性问题。
风险提示
- 技术迭代不及预期:大模型训练成本高,若缺乏结构优化,可能影响产品成熟度提升。
- 安全与隐私法规:随着人形机器人应用的扩展,相关监管政策可能对行业发展造成影响。
- 道德风险:人形机器人越来越接近人类,可能引发恐怖谷效应和对劳动力市场的冲击。
相关研究
| 标题 | 日期 |
|---|---|
| 人形机器人系列之三:核心零部件的野望,隐形冠军的摇篮 | 2023-06-18 |
| AI+制造系列报告之三:AI与机器视觉协同赋能,产业化应用方兴未艾 | 2023-04-24 |
| AI+制造系列报告之二:AI赋能,人形机器人春天来了吗? | 2023-04-16 |
重点公司估值和财务分析(示例)
| 股票简称 | 股票代码 | 货币 | 最新收盘价 | 最近报告日期 | 评级 | 合理价值(元/股) | EPS(元) | PE(x) | EV/EBITDA(x) | ROE(%) |
|---|---|---|---|---|---|---|---|---|---|---|
| 汇川技术 | 300124.SZ | CNY | 68.13 | 2023/08/24 | 买入 | 74.59 | 1.86 | 36.63 | 34.79 | 20.70 |
图表索引
- 图1:从大模型看人形机器人提升通用化水平的路径
- 图2:近5年中国15-59岁劳动人口数量与比重变化
- 图3:2020-2024年中国服务机器人销售额及增长率
- 图4:机器人产业发展的正向循环
- 图5:人形机器人三大技术模块
- 图6:机器人的控制框架
- 图7:大模型的能力与机器人任务级需求的映射关系
- 图8:不同样本数量级下多模态模型的预测精确度和MSE损失
- 图9:多模态大模型的两条技术路线
- 图10:SayCan模型的架构和技术原理
- 图11:SayCan模型结合实际情况做出最合理决策
- 图12:SayCan模型决策准确率不断提高
- 图13:PaLM-E模型的架构
- 图14:多任务混合训练提高准确率
- 图15:ImageBind跨模态理解与生成
- 图16:ImageBind的交互方式
- 图17:ImageBind在零样本/小样本下的准确率
- 图18:不同大模型的决策结果与运动控制指令之间的映射方式
- 图19:RT-2的架构
- 图20:RT-2与基线模型执行成功率对比
- 图21:引入CoT提高任务完成能力
- 图22:RoboCat在模拟和现实场景中学习任务
- 图23:RoboCat的训练周期
- 图24:RoboCat执行成功率远超基线模型
- 图25:SAM精准分割图像中的任何物体
- 图26:SAM在复杂场景下依然表现良好
- 图27:SAM的三种交互方式
- 图28:SAM的基本架构
- 图29:SAM轻量级解码器运行原理
- 图30:SA-1B数据集的掩码量远超OpenImages
- 图31:SAM学习成果增加至SA-1B
- 图32:大模型与基础模型优缺点对比
- 图33:RT-2控制周期较慢
- 图34:RT-2在移动马克笔任务中失败
- 图35:MPC算法助力Atlas实时预测与调整
- 图36:大模型效率提升将推动人形机器人通用化
分析师信息
- 代川:首席分析师,SAC执证号:S0260517080007,SFC CE No. BOS186,联系方式:021-38003678,daichuan@gf.com.cn
- 孙柏阳:联席首席分析师,SAC执证号:S0260520080002,联系方式:021-38003680,sunboyang@gf.com.cn
- 联系人:姚佳,联系方式:021-38003794,yaojia@gf.com.cn
总结
大模型为提升人形机器人的通用化和任务级交互提供了重要支持,但其在实时性方面仍存在不足。基础模型在底层运动控制方面更具优势,两者结合是当前人形机器人商业化落地的有效路径。随着模型结构的优化和算力的提升,大模型有望在未来实现人形机器人的全面通用化。同时,需关注技术迭代、安全隐私法规及道德风险等潜在挑战。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载