如何采集机器人复杂接触操作数据?FreeTacMan 视觉-触觉-位姿同步方法解析
机器人要完成易碎杯抓取、USB 插接、书写、盖章等复杂接触操作,难点不只是“看见物体”,还要理解接触发生在何处、夹爪如何移动、动作轨迹如何变化。香港大学、上海创智学院李弘扬团队在 ICRA 2026 发表论文《FreeTacMan: Robot-free Visuo-Tactile Data Collection System for Contact-rich Manipulation》,提出一种无需机器人参与的视觉-触觉数据采集系统 FreeTacMan。该研究中,NOKOV 度量光学动作捕捉系统用于采集手持夹爪的高精度 6D 位姿,并与视觉、触觉和夹爪开口宽度同步记录,为机器人复杂接触操作策略学习提供多模态数据基础。
一、机器人为什么需要新的复杂接触操作数据采集方式?
在机器人学习中,抓取、插接、装配、书写这类任务通常涉及连续接触、微小位姿变化和力控调整。仅依靠视觉图像,机器人可以看到目标物体,却不一定知道夹爪是否已经接触物体、接触状态如何变化,以及人类操作者在每一步如何调整姿态。
因此,高质量机器人训练数据往往需要同时包含三类信息:视觉数据用于记录环境和物体状态,触觉数据用于记录接触反馈,位姿数据用于描述夹爪在空间中的运动轨迹。三者同步后,可以为机器人策略学习提供更完整的状态信息。
二、传统机器人多接触操作采集方法的限制在哪里?
围绕机器人复杂接触操作,常见数据采集方式包括机器人本体采集、遥操作、AR/VR 采集以及手持式采集。它们各有优势,但在大规模、多任务、强接触反馈场景中仍存在限制。
|
采集方式 |
主要特点 |
典型限制 |
|
机器人本体采集 |
直接在机器人上安装传感器采集操作数据 |
受机器人配置限制,采集规模和任务多样性较难扩展 |
|
遥操作 / AR / VR |
可记录相机视角、控制指令或运动轨迹 |
标定复杂,可能存在延迟,直接触觉反馈不足 |
|
SLAM / IMU 手持采集 |
灵活度较高,适合手持设备采集 |
容易产生漂移或跟踪误差,影响位姿数据精度 |
|
FreeTacMan + NOKOV |
人类自然操作,视觉、触觉、6D 位姿同步记录 |
FreeTacMan结合动作捕捉系统,实现了视觉、触觉和高精度位姿数据同步采集。 |
FreeTacMan改变了传统依赖机器人本体的数据采集方式。研究团队设计了带视觉-触觉传感器的可穿戴手持夹爪,让操作者像使用工具一样完成抓取、插接、盖章等任务,同时直接感受夹爪与物体之间的接触。
三、FreeTacMan 如何把人类操作转化为机器人学习数据?
FreeTacMan 包含采集接口和执行接口。采集时,操作者使用带模块化视觉-触觉传感器的手持夹爪完成任务;系统同步记录 RGB 图像、视觉-触觉图像、夹爪开口宽度和空间位姿。执行时,这些多模态轨迹可以迁移到机器人策略学习中,用于训练机器人完成相似操作。
这种设计的核心价值在于:它不是让机器人反复试错采集数据,而是先由人类操作者在真实接触场景中完成示范,再把示范过程转化成可训练、可追溯的数据轨迹。
四、NOKOV 度量在 FreeTacMan 人到机器人数据迁移环节输出高精度位姿数据
在 FreeTacMan 的人到机器人数据迁移环节,NOKOV 度量光学动作捕捉系统承担的是高精度空间位姿测量任务。系统以 240 Hz 频率跟踪采集接口的 6D 位姿,达到亚毫米级精度。采集接口上共安装 5 个反光标记点:3 个位于顶部板,用于测量整体位姿;2 个位于夹爪上,用于捕捉相对位移。
NOKOV度量动捕系统 输出的位姿数据与 RGB 图像、视觉-触觉图像和夹爪开口宽度同步记录,形成完整的多模态操作轨迹。对机器人学习而言,动作捕捉提供的不只是位置数据,而是连接“人类示范动作”和“机器人执行策略”的空间参考。相比依赖SLAM或IMU的手持定位方式,光学动作捕捉能够提供更稳定的空间位姿测量结果,为需要高精度轨迹的数据集构建提供更稳定的测量来源。
|
数据类型 |
来源 |
在机器人学习中的作用 |
|
RGB 图像 |
相机观测 |
记录环境、物体位置和操作过程 |
|
视觉-触觉图像 |
夹爪触觉传感器 |
记录接触形变、接触状态和表面信息 |
|
夹爪开口宽度 |
FreeTacMan 夹爪 |
描述抓取过程中的开合变化 |
|
6D 位姿 |
NOKOV 动作捕捉 |
记录夹爪空间位置、姿态和运动轨迹 |
五、实验及结果
基于 FreeTacMan,研究团队构建了一个大规模、高精度视觉-触觉操作数据集。该数据集覆盖 50 类多接触操作任务,包含 1 万余条操作轨迹和 300 万余组视觉-触觉图像对。实验任务包括易碎杯抓取、书法、纹理分类、盖章和 USB 插接,分别验证力控、力-位置混合控制、触觉感知和动态响应等能力。
在数据采集对比实验中,FreeTacMan 在完成率、采集效率和综合 CPUT 得分上均优于 ALOHA 和 UMI。其中,CPUT 得分是遥操作方法的 5.05 倍,是 UMI 的 1.52 倍。
在模仿学习实验中,研究团队将视觉-触觉数据用于 ACT 策略模型训练。结果显示,仅使用视觉输入时,ACT 平均成功率为 21%;加入触觉后提升到 55%;进一步加入触觉预训练后提升到 71%。这说明,在复杂接触任务中,触觉和高质量多模态轨迹能为机器人策略学习提供更充分的训练信息。
|
实验指标 |
结果 |
|
数据集规模 |
50 类任务,1 万余条轨迹,300 万余组视觉-触觉图像对 |
|
采集效率对比 |
CPUT 得分为遥操作方法的 5.05 倍,为 UMI 的 1.52 倍 |
|
ACT 仅视觉输入 |
平均成功率 21% |
|
ACT 加入触觉输入 |
平均成功率 55% |
|
ACT 加入触觉预训练 |
平均成功率 71% |
FreeTacMan 案例展示了一条面向复杂接触操作的数据采集路径:由人类操作者完成自然示范,通过视觉-触觉夹爪记录接触信息,再利用 NOKOV 度量动作捕捉系统获取高精度 6D 位姿,最终形成可用于机器人模仿学习的多模态轨迹。
对于正在开展机器人抓取、插接、装配、触觉感知和模仿学习研究的团队来说,实验系统需要同时解决“看得见”“感知得到”“轨迹可量化”“数据可同步”四个问题。NOKOV 度量在其中提供的是可验证的空间位姿测量,让视觉、触觉和动作轨迹能够建立对应关系,从而支持更高质量的机器人训练数据构建。
六、FreeTacMan无需机器人参与的视觉-触觉数据采集系统研究FAQ
1. 机器人训练数据为什么需要视觉、触觉和位姿信息?
视觉记录环境和物体状态,触觉记录接触反馈,位姿记录夹爪在空间中的运动轨迹。三类数据同步后,机器人才能更好地学习复杂接触操作中的动作关系。
2. 光学动作捕捉系统如何帮助机器人学习?
光学动作捕捉可以提供高精度 6D 位姿数据,使人类示范动作具备可量化的空间轨迹。对于模仿学习来说,这类数据有助于把示范动作转化为机器人可学习的轨迹信息。
3. 6D 位姿数据在机器人多接触操作的视觉-触觉-位姿数据采集系统中有什么作用?
6D 位姿包含三维位置和三维姿态,能够描述夹爪或末端执行器在空间中的运动方式。它可以帮助机器人理解操作过程中“在哪里移动”和“以什么姿态接触物体”。
4. NOKOV 度量动作捕捉系统在 FreeTacMan 研究中具体负责什么?
NOKOV 度量光学动作捕捉系统以 240 Hz 频率跟踪采集接口的 6D 位姿,并将位姿数据与 RGB 图像、视觉-触觉图像、夹爪开口宽度同步记录,用于构建多模态操作轨迹。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)