视觉+位置+Manus手套,机器人遥操最合理的解决方案
本案例基于论文《T-Rex:触觉响应式灵巧操作》。全部实验结果与性能指标均由该论文作者给出。
机器人灵巧操作:从视觉感知走向触觉感知
机器人学习近期取得的诸多进展,都依托视觉技术实现。但当任务涉及物理接触时 —— 例如插卡、拧钥匙、操作形变物体,摄像头便会暴露出短板。现有的视觉-语言-动作(VLA)模型很难对接触点发生的物理变化做出推理。人类可以依靠触觉反馈持续调整抓握力度,而主要依赖视觉的机器人大多做不到这一点。

由加州大学伯克利分校、英伟达以及斯坦福大学的研究人员共同研发的 T-Rex 框架,将视觉、语言与触觉感知融合至统一学习框架,以此解决上述难题。该框架结合大规模人类预训练与基于触觉的中期训练,让机器人能够对物理接触做出响应,而不是单纯依靠视觉观测。研究在 12 项高接触交互操作任务中开展测试,T-Rex 取得所有参评方法里最高的平均成功率,相比最优基线模型性能提升超 30%。
为高接触交互任务构建高质量示教数据集
T-Rex 的核心是一套时长 100 小时、触觉信号同步的遥操作数据集。数据集涵盖 200 余种日常物体、22 种基础运动单元,用于在 12 项真实世界操作任务上训练和评估机器人策略。构建该规模数据集,需要一套遥操作平台,能够在每一次示教过程中同步手部运动、触觉传感、机器人控制与视觉观测。

T-Rex 数据采集平台搭载双臂 Dexmate Vega-1 机器人、Sharpa Wave 灵巧机械手、多视角 RGB 摄像头以及指尖触觉传感器。人类操作员佩戴MANUS 数据手套采集高精度手指运动数据,同时使用 VIVE 追踪器获取手腕姿态。采集到的人体运动经过重映射后传递给机器人,实现自然的双手遥操作;同时将视觉画面、触觉测量数据、机器人状态、机器人动作以及自然语言指令整合为统一的多模态训练数据集。
面向高接触交互的机器人学习,离不开可以真实还原人类操作物体过程的示教样本。在 T-Rex 的数据采集流程中,MANUS 数据手套完成手指级别的运动捕捉,把人手动作迁移到机器人端,为后续机器人学习提供高质量示教数据。
推动多模态机器人学习发展
T-Rex 研究证明,将大规模人类预训练和基于触觉的机器人中期训练相结合,既能提升数据利用效率,也能增强模型泛化能力。这一能力建立在多模态示教样本之上,样本精准记录了人体运动、触觉交互与机器人执行动作三者之间的关联。

T-Rex 展示了基础大模型可以突破纯视觉的局限,把触觉信息纳入机器人学习体系。在 T-Rex 项目中,MANUS 数据手套承担遥操作阶段手部运动捕捉工作,为顶尖机器人科研机构的整套研究流程提供支撑,助力触觉响应式灵巧操作技术向前发展。
术语注解:
teleoperation:遥操作,人远程操控机器人执行动作
tactile-reactive:触觉响应式,机器人根据接触触觉信号实时调整动作
motor primitives:运动基元 / 运动单元,手部完成操作的基础动作单元
retargeted:运动重映射,将人手动作换算适配为机器人机械手的动作
VLA:Vision-LanguageAction,视觉语言动作模型
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)