机器人操作技术的发展长期受限于机器人演示数据稀缺的行业瓶颈,无法像视觉、语言模型一样依托海量互联网数据实现能力迭代。为解决这一问题,斯坦福大学与Meta团队提出Ego-Pi跨实体学习框架,依托Manus数据手套采集高精度人类演示数据,结合视觉-语言-动作(VLA)模型微调,成功实现人类任务语义向仿人机器人的高效迁移,大幅突破了传统夹爪机器人操作的能力局限。

ScreenShot_2026-09-09_170853_373.png

该研究的核心创新在于利用人类第一视角演示数据,让机器人习得自身训练数据中不存在的高层任务逻辑,包括分拣规则、技能组合、顺序包装等智能行为,而Manus手套的高精度手部捕捉能力是实现这一突破的核心硬件支撑。传统机器人遥操作设备难以复刻人手精细动作,导致采集的演示数据维度低、精度差,无法支撑五指灵巧手的高维控制学习。而Manus手套可精准捕捉人手20组关键关节角度与细微运动轨迹,以100Hz的高采样率还原人类手部操作细节,为机器人跨实体学习提供了高质量、高维度的原始数据。

ScreenShot_2026-09-09_170907_259.png

依托Manus手套采集的标准化人手数据,研究团队搭建了精准的人机动作映射体系。针对高自由度机械手易出现姿态畸变、自碰撞的痛点,团队基于Manus手套捕捉的人手关键点数据,构建了专属机器人关节映射算法,通过偏移量与缩放系数精准适配机器人手部结构,解决了传统逆运动学映射不精准、姿态不自然的难题。这一适配方案让人类精细化操作逻辑可以无损迁移至Tesollo、Inspire两类主流灵巧机械手,适配性与通用性极强。

在实际训练与实验中,Manus手套的优势进一步凸显。区别于机器人依赖腕部相机的观测模式,Manus手套可独立完成手部姿态精准采集,无需配套人类腕部拍摄设备,大幅降低了大规模数据采集的成本与门槛。同时,其采集的高保真手部运动数据,搭配Ego-Pi框架的动作交错策略、子任务辅助损失优化,让机器人在番茄色彩分拣、结构化装箱、规则化包装三大任务中,成功率均突破90%。尤其在需要双手协同、时序逻辑的装箱任务中,依托Manus高精度数据训练的模型,完美实现了“开箱-取物-放置”的技能串联,解决了传统模型动作错乱、时序颠倒的问题。

ScreenShot_2026-09-09_171030_884.png

实验对比证实,搭载Manus手套的人机数据采集方案,能最大化缩小人机实体差异,充分释放人类演示数据的价值。相较于传统遥操作设备,Manus手套可精准复刻人类操作逻辑与精细动作细节,助力机器人突破底层操作局限与高层语义学习瓶颈。该研究充分证明,Manus高精度手部捕捉设备是打通“人类操作经验—机器人智能行为”的核心载体,为规模化训练灵巧操作机器人提供了高效、可行的全新路径。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐