机械一周解一惑系列:机器人x具身智能的再思考_24页_1mb
报告摘要
具身智能+AI融合发展:机器人视觉与感知升级分析
核心技术:Transformer架构与VLA模型
人工智能与机器人领域的深度融合正在推动具身智能的快速发展,其中Transformer架构起到关键作用。通过多模态融合能力,Transformer架构为视觉、语言和行动指令的融合提供了基础。英伟达Cosmos平台借助扩散模型和自回归模型,提升了虚拟世界的模拟能力,极大推进了机器人训练;李飞飞团队的WALT、ReKep与世界模型则进一步加强了机器人在复杂环境中的理解与生成能力。
基于Transformer的VLA(视觉-语言-行动)模型是具身智能的重要方向。相比谷歌的RT2模型,π0模型通过动作专家模块和条件流匹配技术,提升了多任务泛化能力和操作精准度,展现了更强的零样本适应性和高精度动作控制能力。
触觉与动态手算法
触觉感知是提升人形机器人操作能力的关键。上海交通大学提出的新硬件与算法协同系统VITaM,通过视觉-触觉联合感知,实现了高精度动态交互重建,包括橡皮泥形变追踪和剪刀刃口遮挡恢复等复杂场景的应用,对机器人操控柔性物体有重要意义。
感知技术:激光雷达与3D视觉
激光雷达作为机器人环境感知的核心传感器,发展出全固态、半固态等多类型,测量精度与成本差异明显。ToF法较成熟,但结构光法和立体视觉法在中长距离与高精场景更具优势。
视觉技术方面,2D相机因纹理识别和成本低,适用于简单任务;3D视觉则适用于避障、抓取等复杂任务,是机器人实现术动化的核心基础。未来更多将结合深度学习提升2D识别能力,但3D数据仍为主因依。
投资建议
在AI赋能机器人的趋势下,建议关注以下方向:
- 灵巧手环节:兆威机电、福莱新材、日盈电子(触觉传感器)
- 视觉领域:奥比中光(深度传感)、峰岹科技(新型传感器)
- 系统集成商:中大力德(齿轮类)、中坚科技(代工厂)
风险提示
- 具身智能模型进化慢于预期:涉及算法复杂度、训练成本、硬件资源
- 技术迭代路线变化:机器人操作系统路线若改变,将影响整体行业布局
总结
通过Transformer架构强化,具身智能系统在泛化性、多模态融合和任务执行精度方面取得突破。随着力学触觉与强感知手段(如激光雷达)的结合,机器人有望实现更高级别的自主操作与人机协同。当前投资重点应聚焦在组件、感知硬件与核心算法公司,以抓住具身智能爆发的核心机会。
试读结束,高清完整版pdf/doc/ppt,请点下载