Open TeleDex 【翻译】
技术报告:Open TeleDex —— 面向基于模仿学习的灵巧操作的硬件无关遥操作系统
作者:Xu Chia,¹ · Chao Zhanga,¹ · Yang Suc,¹ · Lingfeng Doub · Fujia Yanga · Jiakuo Zhaoa · Haoyu Zhouc · Xiaoyou Jiac · Yong Zhouc · Shan Ana,*
a 天津大学
b 清华大学
c LinkerBot Inc.
¹ 这些作者对本工作做出了同等贡献。
- 通讯作者:anshan@tju.edu.cn
arXiv:2510.14771v1 [cs.RO] 2025 年 10 月 16 日
2025 年 10 月 17 日
摘要
准确、高保真地采集示教数据是部署机器人模仿学习(Imitation Learning, IL)系统的关键瓶颈,尤其在面对异构机器人平台时尤为突出。现有的遥操作系统往往无法保证在多种类型的遥操作设备上都实现高精度数据采集。为此,我们开发了 Open TeleDex —— 一个专门用于示教数据采集的统一遥操作框架。Open TeleDex 着力解决 “TripleAny” 挑战,能够无缝支持 任意机械臂、任意灵巧手和任意外部输入设备。此外,我们提出了一种新颖的手部姿态重定向(retargeting)算法,显著提升了 Open TeleDex 的互操作性,使其能够稳健、精确地兼容更广泛的异构主从设备。Open TeleDex 为加速复杂机器人操作和模仿学习领域的学术研究与产业研发,搭建了一个基础性、高质量、公开可用的平台。
1. 引言
在多样化、非结构化环境中执行各种复杂的灵巧操作任务,仍然是现代机器人领域的核心挑战。尽管模仿学习(IL)在解决该问题上展现出巨大潜力,但其进展从根本上受到大规模、多模态、高质量示教数据采集困难度的制约 [1]。
这类数据的质量和可扩展性完全依赖于底层的遥操作系统。这些系统围绕一系列复杂的权衡设计而成,通常在三个核心维度之间寻求平衡:保真度(Fidelity,控制精度和数据质量)、可及性(Accessibility,成本与部署难度)以及泛化性(Generalization,硬件兼容性)。现有方案往往在至少一个维度上做出妥协。例如,高保真系统(如专用主从臂)提供无可匹敌的精度和极低延迟,在零容错应用中不可或缺;然而这种紧密的机电耦合天然限制了其泛化性,它们以针对单一机器人型号定制的昂贵"封闭生态"形式存在,使跨平台数据汇聚变得不切实际。反之,优先考虑可及性、采用消费级 VR/AR 设备的系统大幅降低了数据采集的技术门槛,但常因视觉跟踪不确定、通信延迟以及缺乏物理力反馈等问题而在保真度上做出妥协。此外,即便这些更易获取的平台在面对新机械臂或新手时,也常常需要大量的软件适配和参数调校,这暴露出实际中关键的泛化鸿沟。缺乏一个贯穿整个数据采集流程、支持异构机器人平台的统一框架,正是阻碍 IL 研究原型向可扩展、通用数据采集平台演进的核心瓶颈。
为此,我们提出 Open TeleDex —— 一个设备无关、功能多样的遥操作框架。我们的核心设计理念是泛化性,通过原生基于 ROS2 的架构实现,该架构本质上统一了多种控制范式,允许快速、无缝地集成新的硬件组合。我们的工作主要有两项核心贡献:
-
统一、硬件无关的遥操作框架:我们提出了一种解耦的三层架构,支持从各种机械臂、多指灵巧手和外部输入设备同步采集数据。Open TeleDex 作为一个可扩展的骨干平台,使研究人员能够高效地集成并在多种异构硬件组合间切换。
-
手部姿态重定向算法:我们提出了一种新颖的重定向算法,用于调整人手与机器人手之间的运动学差异,以增强框架的兼容性。
本报告组织如下:第 2 节回顾相关工作;第 3 节详细介绍 Open TeleDex 框架;第 4 节展示系统评估;最后第 5 节总结全文并讨论未来工作。
2. 相关工作
2.1 遥操作系统
遥操作系统是收集模仿学习专家示教的关键工具,其设计必然涉及一系列复杂的权衡。任何此类系统的效能都可以沿三个核心维度评估。其一是保真度(Fidelity),衡量系统传达操作者意图和反馈环境信息的精度,这仍是现代遥操作研究的核心焦点 [2]。其二是可及性(Accessibility),包含成本、部署复杂度和易用性,是实际应用的关键因素 [3]。其三是日益关键的泛化性(Generalization)——系统适应不同机器人硬件、任务和环境的能力,这是现代人机交互中的关键挑战 [4]。该领域现有方案通常在这些维度上呈现出各自不同的优势与折衷。
追求极致保真度的系统(如专用主从臂)树立了延迟与触觉"透明度"的黄金标准,使其在机器人手术等零容错应用中不可或缺 [5]。ALOHA [6] 等先驱系统通过大幅降低灵巧操作研究的资金和技术门槛,使数据采集走向大众化。它们借助紧密的机电耦合和直接的关节空间映射,最大程度减少了传输过程中的信息损失。然而,这种设计哲学天然地限制了它们的泛化性。它们往往以针对单一机器人型号定制的"封闭生态"形式存在,任何硬件改动都可能带来昂贵的重新设计,使跨平台部署和数据汇聚变得不切实际。
近年来,一波研究通过利用消费级 VR/AR 设备和标准相机来提升可及性。这些系统通常采用更灵活的笛卡尔空间控制。尽管在可及性方面取得成功,它们往往在保真度上做出妥协,面临视觉跟踪不确定、通信延迟和缺乏物理力反馈等挑战 [7, 8]。更重要的是,虽然理论上更具通用性,许多开源实现仍需要为特定机器人进行大量软件适配和参数调校,暴露出实践中的泛化鸿沟。
由此可见,泛化性已经成为连接高保真与高可及性两个世界、阻碍遥操作技术从一次性的研究原型走向可扩展数据采集平台的核心瓶颈。要应对这一挑战,就需要开发一个通用的软件框架。AnyTeleop [9] 等工作在此方向上做出了重要进展,采用无需学习、GPU 加速的组件。然而,仍然需要一个原生扎根于 ROS2 生态系统、并且其架构能够本质地统一从直接映射到基于规划器控制等多种控制范式的框架。
本文提出的 TeleDex 框架旨在构建这样一个以泛化性为核心设计原则的统一遥操作框架。它并不谋求发明新的交互模式,而是通过提供模块化、可扩展的软件骨干来整合并赋能现有的多样化硬件生态,从而为机器人模仿学习提供一个真正可扩展的数据采集方案。
2.2 手部姿态重定向
将人类操作者自然实时的运动传递给形态各异的机器人,是通用遥操作中的核心挑战。这一挑战可分解为两个主要子问题:手臂运动生成和灵巧手姿态重定向。
对于手臂运动生成,主流方法依赖逆运动学(IK)求解器或更先进的实时运动规划器 [9, 10]。这些方法都要求机器人的精确运动学模型(如 URDF 文件),以计算与操作者末端执行器位姿意图相匹配的关节轨迹。
灵巧手姿态重定向是更复杂的挑战。现有方法无论是基于优化 [9, 11] 还是基于学习 [12, 13],大多遵循解析范式:它们预先定义人手与机器手之间的关键点或关节对应关系,然后最小化两者之间的误差。虽然直观,这种"点对点映射"方法的根本局限在于其刚性对应。当机器手形态与人手差异显著时,这种映射容易产生不自然或物理上不可行的姿态,而为新硬件配置这些对应关系也十分繁琐。
为克服这种"刚性映射"范式的局限,我们提出了一种新颖的**“生成式"手部重定向算法**。我们的方法不逐关节复制运动,而是将机器手视为受自身运动学模型约束的整体骨架。算法驱动该骨架自然地"生长”,以在功能上匹配人类整体的抓握意图,而非逐点形态模仿。这种从"复制运动"到"重现在功能上"的转变,使我们的框架能够为形态多样的灵巧手生成更自然、更富功能性的姿态。
2.3 模仿学习的示教数据
模仿学习(IL)的成功严重依赖于示教数据的质量 [14]。研究表明,以平滑运动和精确同步的"状态-动作"对为特征的高质量示教,能显著提升最终策略的性能和鲁棒性 [15, 16]。因此,构建一个系统保证数据质量的采集框架至关重要。
实践中,确保数据质量面临两大挑战。其一是时间同步。在包含相机和编码器等异构传感器的系统中,为所有数据流确保一个公共且精确的时基是一项核心难题。简单的录制方案很容易引入对学习动态任务有害的时间错位 [17]。其二是数据模态的丰富性。传统主从系统提供高质量的运控数据,而现代 IL 越来越受益于多模态信息,包括多视角图像和力/触觉反馈 [18]。VR 遥操作(如 Holo-Dex [11])等新兴范式因其在融合多模态数据上的天然能力而备受关注。
这就需要一个现代化的数据采集框架,不仅具备高性能的实时处理和精确的时间同步,还要在其架构中原生支持多种采集方法的融合,以满足对高质量、多模态、多样化数据日益增长的需求。
3. Open TeleDex 框架
3.1 系统架构
如图 1 所示,Open TeleDex 的架构遵循分层与解耦的核心设计原则,终极目标是实现我们的 TripleAny 愿景:支持 AnyExternalDevice、AnyArm 与 AnyHand 的无缝集成与协作。系统主要使用 ROS2 框架 [19] 进行分布式通信。在概念上,架构被划分为三个核心模块:
- 感知(Perception):负责对来自 AnyExternalDevice 的异构输入数据进行标准化。
- 控制与数据采集(Control & Data Collection):执行与硬件无关的任务管理、控制策略调度和数据处理。这一核心层对具体的机械臂和灵巧手是"无关的(agnostic)",是实现 AnyArm 和 AnyHand 的关键。
- 硬件(Hardware):将标准化控制命令翻译为特定 AnyArm 和 AnyHand 执行器的指令。
3.2 感知
感知组件负责采集和解释操作者的意图与运动,构成整个遥操作系统的输入信号。
- 主端设备(Master Device):此模块封装各种人机交互设备,例如虚拟现实(VR)头显(用于空间追踪)、遥操作手套(用于手指弯曲度采集)和主控臂。
- 传感器融合:将来自不同输入传感器的原始数据进行融合和滤波,产生连贯、低延迟的操作者手部与手臂姿态数据流。
- 手部姿态重定向:这是一个高层决策模块,负责将连续的人手姿态流转换为离散、可行的机器 slave 设备目标姿态。为对机器手实现精确、可适配的遥操作,我们构建了一个模块化的优化框架。该框架的核心是一个总成本函数,它是三个不同子函数的加权和:姿态对齐成本、手指间耦合成本和时间平滑性成本。通过最小化这个总成本函数,我们可以实时求解最优的机器人关节角向量 θ∗(t)。
优化目标:最优的机器人关节角向量 θ∗(t) 通过求解以下最小化问题得到:
θ∗(t)=argminθ(t)[αalignLalign(θ(t))+αcoupleLcouple(θ(t))+αsmoothLsmooth(θ(t))](1) \theta^*(t) = \arg\min_{\theta(t)} \left[ \alpha_{\text{align}} L_{\text{align}}(\theta(t)) + \alpha_{\text{couple}} L_{\text{couple}}(\theta(t)) + \alpha_{\text{smooth}} L_{\text{smooth}}(\theta(t)) \right] \quad (1) θ∗(t)=argθ(t)min[αalignLalign(θ(t))+αcoupleLcouple(θ(t))+αsmoothLsmooth(θ(t))](1)
其中:
- θ(t) ∈ ℝⁿ 为机器手在 t 时刻的关节角向量。
- L_align、L_couple 与 L_smooth 表示三个核心成本函数。
- α_align、α_couple 与 α_smooth 是平衡各项成本项重要性的超参数(权重)。
成本函数 —— 姿态对齐成本(L_align):该成本函数旨在最小化操作者手部关键点与机器手对应关键点之间的几何误差,是实现基础姿态模仿的核心。
Lalign(θ(t))=∑(i,j)∈K∥pi,j′(t)−Fk,j(θ(t))∥2(2) L_{\text{align}}(\theta(t)) = \sum_{(i,j)\in\mathcal{K}} \| p'_{i,j}(t) - F_{k,j}(\theta(t)) \|^2 \quad (2) Lalign(θ(t))=(i,j)∈K∑∥pi,j′(t)−Fk,j(θ(t))∥2(2)
其中,p′{i,j}(t) ∈ ℝ³ 表示经过变换与标定后,操作者第 i 根手指上第 j 个关键点的位置,F{k,j}(θ(t)) 是机器人的正运动学函数,用于计算其对应关键点的位置。
操作者关键点变换:为计算变换后的关键点 p′{i,j}(t),必须先对原始检测到的关键点 p{i,j}(t) 进行缩放与平移,以匹配机器人的几何结构。
- 维度缩放因子(s_{i,j}):计算每段指骨的相对长度比。
si,j=∥Fk,j+1(θ0)−Fk,j(θ0)∥∥pˉi,j+1−pˉi,j∥(3) s_{i,j} = \frac{ \| F_{k,j+1}(\theta_0) - F_{k,j}(\theta_0) \| }{ \| \bar{p}_{i,j+1} - \bar{p}_{i,j} \| } \quad (3) si,j=∥pˉi,j+1−pˉi,j∥∥Fk,j+1(θ0)−Fk,j(θ0)∥(3)
这里 p̄_{i,j} 和 θ₀ 分别表示静态标定姿态下的人手关键点和机器人关节角。
- 手指根部平移向量(δ_i):计算每根手指基部的偏移量。
δi=Fk,i,mcp(θ0)−pˉi,mcp(4) \delta_i = F_{k,i,\text{mcp}}(\theta_0) - \bar{p}_{i,\text{mcp}} \quad (4) δi=Fk,i,mcp(θ0)−pˉi,mcp(4)
- 变换后的关键点(p′_{i,j}):最终通过如下迭代公式得到变换后的点:
pi,j′(t)={pi,0(t),j=0pi,j−1′(t)+si,j−1(pi,j(t)−pi,j−1(t))+δi,j=1pi,j−1′(t)+si,j−1(pi,j(t)−pi,j−1(t)),j≥2(5) p'_{i,j}(t) = \begin{cases} p_{i,0}(t), & j=0 \\ p'_{i,j-1}(t) + s_{i,j-1}(p_{i,j}(t) - p_{i,j-1}(t)) + \delta_i, & j=1 \\ p'_{i,j-1}(t) + s_{i,j-1}(p_{i,j}(t) - p_{i,j-1}(t)), & j\geq 2 \end{cases} \quad (5) pi,j′(t)=⎩ ⎨ ⎧pi,0(t),pi,j−1′(t)+si,j−1(pi,j(t)−pi,j−1(t))+δi,pi,j−1′(t)+si,j−1(pi,j(t)−pi,j−1(t)),j=0j=1j≥2(5)
手指间耦合成本(L_couple):该成本函数用于在抓握、捏取等精细动作中,保持拇指与其他手指之间类似人手的协同关系。
Lcouple(θ(t))=∑i∈Iβi(t)∥R⃗H,i(t)−R⃗R,i(θ(t))∥2(6) L_{\text{couple}}(\theta(t)) = \sum_{i\in\mathcal{I}} \beta_i(t) \| \vec{R}_{H,i}(t) - \vec{R}_{R,i}(\theta(t)) \|^2 \quad (6) Lcouple(θ(t))=i∈I∑βi(t)∥RH,i(t)−RR,i(θ(t))∥2(6)
其中 R⃗_{H,i}(t) = p_{i,\text{fingertip}}(t) − p_{\text{thumb,fingertip}}(t) 为操作者拇指尖到其他指尖的相对向量;R⃗_{R,i}(θ(t)) 是机器手上对应的相对向量。β_i(t) 是基于手指间距离动态调整该成本项影响的自适应权重。
自适应权重(β_i(t)):该权重的大小取决于手指的接近程度。我们先计算一个归一化的接近度度量 ρ_i(t) ∈ [0, 1]:
ρi(t)=1−∥R⃗H,i(t)∥−ρmin,iρmax,i−ρmin,i(7) \rho_i(t) = 1 - \frac{ \| \vec{R}_{H,i}(t) \| - \rho_{\min,i} }{ \rho_{\max,i} - \rho_{\min,i} } \quad (7) ρi(t)=1−ρmax,i−ρmin,i∥RH,i(t)∥−ρmin,i(7)
其中 ρ_min 和 ρ_max 是从标定数据确定的指间最小、最大距离。然后通过 Sigmoid 函数将该度量映射为最终权重:
βi(t)=11+e−σ(ρi(t)−τ)(8) \beta_i(t) = \frac{1}{1 + e^{-\sigma(\rho_i(t)-\tau)}} \quad (8) βi(t)=1+e−σ(ρi(t)−τ)1(8)
其中 σ 和 τ 是控制函数形状与激活阈值的参数。
时间平滑成本(L_smooth):该项作为正则项,惩罚机器手关节角的突变,确保运动轨迹流畅稳定。
Lsmooth(θ(t))=∥θ(t)−θ(t−1)∥2(9) L_{\text{smooth}}(\theta(t)) = \| \theta(t) - \theta(t-1) \|^2 \quad (9) Lsmooth(θ(t))=∥θ(t)−θ(t−1)∥2(9)
3.3 控制与数据采集
TeleDex 的核心是集成化的控制与数据采集管线,作为中央同步与序列化引擎。该组件进一步组织为三层软件架构:控制层(L3)、数据集成层(L2) 和数据存储层(L1)。
3.3.1 控制层
该层以一个主 ROS2 服务节点为中心,体现了核心控制层的主要职责,包括任务管理器、硬件管理器、多传感器时间同步管理器(TimeSync Manager)和数据采集协调器。
在典型的数据采集流程中,操作者首先在配置文件中指定硬件组合。系统启动后,感知组件中相应的 ROS2 节点被激活,从各自的硬件(如 VR 设备或主从臂)读取原始数据,并以标准化的 ROS2 消息发布。控制层订阅这些标准消息,其内部控制策略调度器(Control Strategy Scheduler)基于配置中的预设模式加载并应用相应的控制算法。
例如:(1) 对于高保真主从配置(如 Agilex 臂 + LinkerHand L10/O6 + 主控臂/手套),调度器采用直接的关节空间映射策略以实现最小延迟。(2) 对于低成本、运动学不匹配的配置(如 RealMan 臂 + LinkerHand L10 + VR 手柄),调度器使用混合控制策略:对手部采用基于优化的重定向算法,对臂采用笛卡尔空间相对运动控制。该层生成的标准化机器人控制命令随后被发布,由硬件组件中相应的机器人驱动节点订阅并执行。同时,一条并行的数据采集管线捕获所有传感器数据和控制命令,该管线内的时间同步模块将来自不同来源的时间戳对齐并校验。
数据同步机制:在为模仿学习采集高质量数据时,确保来自多个异构传感器的数据在时间上精确对齐至关重要。哪怕极小的时间偏差都可能导致错误的"状态-动作"配对,严重影响下游策略的学习效果。为应对这一挑战,Open TeleDex 在应用层实现了一套基于 ROS2 分布式时钟服务的稳健的软件级时间戳同步(TimeSync Manager)与校验机制。TimeSync Manager 贯穿整个数据采集过程:
-
建立全局时间基:系统启动时,TimeSyncManager 初始化并等待 ROS2 的全局时钟稳定。这确保系统中所有 ROS2 节点共享单一、同步的时间源,这是所有后续同步操作的基础。
-
逐帧多源时间戳采集与校验:在数据采集的每个控制周期,系统执行严格的时间戳同步检查:
- 收集:RealEnv 接口从所有处于活动状态的 Recorder 模块中收集当前帧数据的时间戳。这些时间戳来自多种来源:相机和灵巧手的时间戳来自其 ROS2 消息头,而机械臂的时间戳可能直接来自其底层 SDK。
- 校验:TimeSyncManager 的核心功能是校验所收集的时间戳集合。该校验包含两项关键检查:
- a. 新鲜度检查:确保所有时间戳都是"最近的"(如距当前 ROS 时间在 1 秒以内),以过滤因节点卡死或网络问题造成的陈旧数据。
- b. 一致性检查:计算集合中所有时间戳的最大差异,并检查该差异是否在预设容差(例如 100ms)内。在典型工作条件下,我们的系统能够持续将此差异保持在 70ms 以下(tp99)。
-
数据标记与存储:校验结果——包括成功标志、max_diff 以及所有原始时间戳——被打包为"同步校验包",存储于当前帧的观测数据中。这些元数据最终连同 qpos、qvel 等数据一起保存到 telemetry.npz 文件中。
通过 TimeSync Manager,Open TeleDex 实现了一种主动、可追溯的数据质量保证,超越了标准 rosbag 的范畴。它不仅努力在采集时保证数据同步性,更重要的是为每一帧数据提供同步质量度量。在后续模型训练时,研究人员可以使用 sync_validation_is_valid 标志轻松过滤掉不同步的时间戳数据,或基于 max_diff 值对数据进行加权。这种可验证的、端到端的时间同步闭环,是 Open TeleDex 作为面向机器人模仿学习的专业数据采集框架的关键特性。
3.3.2 数据集成层
该层充当数据平面,专门负责数据采集、缓冲与序列化,与具体的硬件和文件结构显式解耦。
数据采集节点由多个独立的 Recorder 模块组成(机械臂 Recorder、LinkerHand Recorder、相机 Recorder、可扩展接口)。每个 Recorder 订阅 L1 的特定硬件话题,应用从 L3 TimeSync Manager 收到的全局同步时间戳,并将数据推送到持久化缓冲区。
数据持久化节点负责将缓冲数据结构化地写入磁盘。它将同步后的多模态数据高效编码并存储为结构化格式(如视频压缩格式或 HDF5),附带完整的元数据,可供下游模仿学习任务使用。操作者可通过键盘命令控制数据采集的开始与停止。
要支持新的机械臂,开发者只需实现一个遵循 RealEnv 接口的新的 Recorder 类,而无需修改核心数据采集逻辑。这种设计大幅降低了将新硬件集成到 Open TeleDex 生态的门槛。
3.3.3 数据存储层
该层定义最终的输出结构和基础存储层级,确保数据集可被学习框架直接使用。
标准存储节点强制执行一致、分层的文件结构。它定义了如下输出文件:遥测关节数据(telemetry.npz)、相机数据/内参(视频文件与标定参数、camera_info.json)、Episode 清单(manifest.json)、元数据全局配置(metadata.json)。
3.4 硬件
3.4.1 硬件组件
该组件表示用于执行与感知的物理设备及底层软件接口。图 2 展示了 Open TeleDex 支持的部分硬件组件。
- 相机驱动:标准化驱动(如 RealSense)直接与相机硬件交互,通过 ROS 2 话题发布同步的 RGB-D 流。
- 机械臂驱动:底层控制器负责将 L2 的高层速度或关节位置命令转换为机械臂(如 Piper/Linker Arm)的电机信号。
- LinkerHand 驱动:特定的 SDK 或 API,提供对 LinkerHand 的控制和状态反馈,处理复杂的手指弯曲命令与传感器读数。
- 传感器数据流:连续的反馈回路,将瞬时状态(关节角、末端力、视觉帧)反馈给 L2 数据采集节点,用于同步记录;若已实现,也用于实时闭环控制。
3.4.2 异构硬件接口
为实现广泛的硬件兼容性,我们设计了一个核心的异构硬件接口。它通过软件抽象屏蔽底层物理硬件差异,为上层应用提供稳定、统一的交互逻辑。其设计遵循两个核心原则:主端输入归一化与从端设备抽象。
主端输入归一化:操作者意图的统一表达。遥操作前端(主端)的首要挑战,在于处理来自截然不同的来源且格式迥异的输入信号——例如,数据手套输出高维关节角,VR 设备通过 UDP 流提供手部关键点位姿,而主控臂则直接输出其自身的关节状态。
为屏蔽这种异构性,Open TeleDex 引入了一个中间的"意图解析与归一化"步骤。无论输入设备是什么,其原始数据流都先由专门的前端适配器节点处理。在我们的实现中,这是一个名为 hand_retarget 的独立 ROS2 节点。
该节点的核心职责是将这些不同的输入信号统一翻译为标准化的"意图信号"。该信号代表操作者的核心意图,通过固定的 ROS2 话题发布。具体来说:
- 对于来自 VR 手柄的输入,该节点运行我们的手部重定向算法和笛卡尔空间相对运动控制策略,以目标手位姿驱动灵巧手,并以腕部关键点数据驱动机械臂。
- 对于来自数据手套与主控臂的输入,该节点执行直接的关节空间映射控制策略,将其姿态映射为灵巧手和机械臂的标准目标关节角。
从端设备抽象:统一的机器人环境接口。在遥操作后端(从端),挑战在于用单一的统一逻辑控制不同型号、自由度、通信协议的机器人。
为实现对 AnyArm 与 AnyHand 的广泛兼容,Open TeleDex 实现了一个名为 RealEnv 的环境抽象层。该设计旨在为所有物理机器人硬件提供统一、高层 的 API。
RealEnv 本身是一个抽象基类,定义了与机器人交互的标准方法,如获取机器人当前状态、向机器人发送动作命令。对每款支持的硬件(如 Agilex Piper 臂或 Linker 臂 A7),我们实现一个对应的 Recorder 子类(如 PiperRecorder)。
该 Recorder 子类充当"设备驱动"。它处理与特定硬件 SDK 或底层 ROS 驱动交互的所有底层细节,同时严格遵循 RealEnv 定义的接口。例如,当上层数据采集逻辑调用 get_observation() 时:
- PiperRecorder 通过其 SDK 查询编码器以获取关节状态;
- LinkerHandRecorder 订阅相应的 ROS2 话题以获取最新关节消息;
- RealSenseRecorder 订阅图像话题。
尽管它们的内部实现不同,最终都会返回一个结构完全相同的观测字典,其中包含 qpos、qvel、images 等标准化字段。
通过这种 RealEnv 抽象,Open TeleDex 中的上层应用可以完全忽略正在使用的是哪一款具体的臂或手。未来要支持新机器人,开发者只需按照 RealEnv 接口实现一个新的 Recorder 类,无需对核心逻辑做任何修改。这种"一次定义,处处可用"的插件化设计,是 Open TeleDex 高扩展性与硬件无关性的技术基石。
3.5 小结
Open TeleDex 被设计为一个统一的、通用的遥操作框架,旨在支持广泛的硬件和应用场景。其主要特性包括:
- TripleAny 兼容性:该架构从根本上做到硬件无关,支持机械臂(AnyArm)、灵巧手(AnyHand)与主端输入设备(AnyExternalDevice)的多样化组合,涵盖从高保真主从系统到低成本 VR 手柄。
- 多模态数据管线:Open TeleDex 具备为模仿学习量身打造的高性能数据采集管线,为多模态数据流(包括运动状态、多视角图像、深度数据)提供稳健的、基于软件的时间同步与校验。
- 模块化、原生 ROS2 架构:系统完全构建于 ROS2 之上,采用解耦的三层架构。这种以标准化 RealEnv 抽象层为中心的模块化设计,大幅简化了新硬件的集成。
- 灵活的控制策略:框架可基于用户配置在不同控制范式间无缝切换——例如低延迟的直接关节空间映射、灵活的笛卡尔空间控制等。
- 面向 AI 的结构化数据输出:所有采集到的数据均以定义良好的结构化格式(如视频压缩或 HDF5)存储,附带完整元数据,可直接用于训练下游模仿学习策略。
4. 系统评估
本节对 Open TeleDex 系统进行严格评估,重点关注其支持复杂单臂操作数据采集的能力,以及应对姿态对齐和精确物体放置中所固有挑战的能力。评估在两项基准任务上进行:瓶子插孔(Bottle Peg-in-Hole) 和 方块组装(Cube Assembly)。
4.1 评估设置与指标
4.1.1 任务描述
- 任务 1:瓶子插孔。该任务用于评估系统在操作非刚性物体时处理姿态对齐挑战的能力。操作者需控制机器人从侧面抓取一只水瓶(直径约 6cm)。机器人需将瓶子插入一个水平放置在桌面上的方形底座(约 7cm 宽,4cm 高)中。试验台上两物体初始水平距离约 20cm。
- 任务 2:方块组装。为评估系统对物体的精确抓取与放置能力,操作者需控制机器人从桌面拾起半个方块,然后将其放在另一半之上组装成完整方块。试验台上两部分初始水平距离约 10cm。
4.1.2 硬件配置
如表 1 所示,评估采用两套不同但主要的机器人配置:(1)自研配置(TeleDex 验证集):配置采用我们自研的机械臂(Linker Arm A7)与自研灵巧手(LinkerHand O6)。(2)商用现货(COTS)基线集:配置采用业内主流的标准设备,具体为 Agilex Piper 7 自由度机械臂与 LinkerHand O6 灵巧手。
表 1:系统评估的硬件配置
| 实验组 | 机械臂 | 灵巧手 | 主端设备(输入) |
|---|---|---|---|
| COTS 臂 | Agilex Piper(6 自由度) | LinkerHand O6 | UdexReal 手套 |
| 自研臂 | Linker Arm A7(7 自由度) | LinkerHand O6 | UdexReal 手套 |
4.1.3 评估指标
为定量评估每套系统配置的表现,我们测量了一组聚焦于任务效率与数据质量的指标,关键指标定义如下:
- 平均任务时长(秒):该指标衡量遥操作系统的整体效率。对于每次成功试验,我们将任务时长定义为从机器手开始向物体运动的那一刻起,到任务成功完成(如瓶子被插入或方块被组装好)所经过的时间。最终值是给定任务和配置下所有成功试验时长的平均值。值越低表示操作效率越高。
- 同步成功率(%):该指标量化数据采集管线的可靠性。如第 3.3.1 节所述,我们的 TimeSyncManager 在每个时间步对所有传感器流的时间戳进行一致性检查。如果所有传感器时间戳中的最大时间差(max_diff)在预设容差(100ms)内,则该时间步被标记为"成功"。同步成功率是整个示教 episode 中成功同步的时间步数占总时间步数的百分比。值越高表明所采集数据在时间上的一致性越强。
- 平均同步误差(毫秒):该指标衡量成功同步数据的时间精度。其计算方式为:在一个 episode 内所有成功同步的时间步上对 max_diff 值(单帧内最早与最晚传感器时间戳之间的最大时间差)求平均。该值代表我们多模态数据快照的平均"时间模糊度"。值越低,表示数据更高质量、对齐更精确,这对学习对时间敏感的操作技能至关重要。
结果:在两套不同硬件配置上进行的两项基线任务的性能结果汇总于表 2。每项任务在各自系统上执行 20 次。表格展示了任务效率(平均时长)与数据质量(同步成功率与误差)的关键指标。
表 2:不同任务和硬件配置下的性能与数据质量指标
| 配置 / 任务 | 试验数 | 平均时长(秒) | 同步成功率(%) | 平均同步误差(毫秒) |
|---|---|---|---|---|
| COTS 臂配置:Agilex Piper 臂 + LinkerHand O6 | ||||
| 瓶子插孔 | 20 | 20.06(±2.88) | 99.27 | 64.38 |
| 方块组装 | 20 | 24.53(±3.85) | 99.99 | 60.77 |
| 自研臂配置:Linker Arm A7 + LinkerHand O6 | ||||
| 瓶子插孔 | 20 | 15.28(±2.42) | 99.98 | 42.75 |
任务效率与硬件表现。我们的结果首先凸显了系统捕获任务复杂度的能力。在同一硬件(COTS 臂配置)上,方块组装任务所需完成时间(24.53s)明显长于瓶子插孔任务(20.06s),这与组装任务对精度更高要求相符。更重要的是,结果表明不同硬件配置之间存在明显的性能差异。在同一项瓶子插孔任务上,采用自研臂配置的系统平均比采用 Agilex Piper 臂(COTS 臂配置)的系统快约 24%。这说明自研硬件更紧密的集成与潜在的底层优化带来了更高效的遥操作体验。
数据质量与系统稳健性。数据质量指标突显了 Open TeleDex 数据采集管线的稳健性。在所有任务和硬件配置上,同步成功率均保持在 99.2% 以上,表明我们的 TimeSyncManager 模块能够持续、可靠地在预设 200ms 容差内对齐多模态数据流。这种可靠性水平对于生成大规模、干净的模仿学习数据集至关重要。
此外,平均同步误差进一步揭示了系统内部的时间精度。自研臂配置不仅任务完成更快,而且平均同步误差(42.75ms)也显著低于 Agilex Piper 配置(60-65ms 区间)。约 40-65ms 的同步误差大致相当于我们 25Hz 频率下 1-2 个控制周期,对于复杂 ROS2 环境中的软件级同步机制而言,这是一个坚实的基线。这定量地表明我们的管线能够保持一致且可度量的数据质量水平,并揭示了硬件选择如何直接影响最终数据集的时间保真度。
5. 结论与未来工作
5.1 结论
在本技术报告中,我们通过提出并实现一个名为 Open TeleDex 的遥操作框架,解决了为机器人模仿学习采集高质量、多样化示教数据的挑战。我们的工作以两项核心贡献为中心,这些贡献已通过系统设计和一系列定量实验得到验证。
首先,我们贡献了一个统一的、设备无关的遥操作框架,为机器人学习提供了端到端的工作流。通过分层的、解耦的软件架构和标准化的硬件抽象层(RealEnv),Open TeleDex 成功打破了不同硬件生态之间的壁垒。至关重要的是,该框架封装了从多模态数据的同步采集到结构化存储的完整管线。我们的数据质量分析结果显示同步成功率持续保持在 99% 以上,这证实了我们面向 AI 的数据采集管线能够确保所采集数据的内在质量,为训练高性能模仿学习策略提供了坚实基础。我们的实验评估采用两套不同的硬件配置,展示了该框架在实践中无缝集成和操作异构系统的能力,有力支持了 TripleAny 愿景。
其次,我们引入了一种新颖的通用运动映射算法。该算法通过生成整体姿态超越了传统的"点对点映射"范式,为形态各异的人手和机器手之间提供了更自然、更具功能性的运动重定向。我们在方块组装和瓶子插孔等复杂任务上的成功演示,实际验证了该算法的有效性。
5.2 未来工作
尽管 Open TeleDex 为通用遥操作数据采集奠定了坚实基础,仍有大量空间值得探索。我们的未来工作将主要聚焦以下方向:
- 严格的基准评测:我们计划开展严格、全面的性能基准评测,包括执行标准化的人机交互实验(如 Fitts 定律测试),以定量测量系统吞吐量(IP)等关键指标。我们还将分析所采集数据的轨迹平滑度(Jerk),进一步量化示教质量。这些深入指标将使我们能够与 ALOHA、AnyTeleop 等最先进的框架进行更细致的比较。
- 全面的用户体验(UX)研究:计划开展全面的 UX 研究,评估系统的"人在回路"方面。我们将使用 NASA-TLX [20] 问卷等收集主观指标(如操作者工作负荷),评估不同硬件配置的直观性与人体工程学。
- 硬件生态扩展:我们将通过为主流机械臂、灵巧手、传感器提供官方 Recorder 实现,继续扩展 TripleAny 硬件生态,并向社区开源,进一步降低研究门槛。
- 协作遥操作:我们最激动人心的目标之一,是探索并实现"一主多从"的协作遥操作模式。基于 ROS2 的 TeleDex 分布式架构为此目标提供了天然基础。我们计划开发一个高层任务分配与协作控制模块,大幅提升用于训练通用机器人策略的数据采集的多样性和效率。
参考文献
[1] A. Brohan, N. Brown et al., “RT-1: Robotics transformer for real-world control at scale,” arXiv:2212.06817, 2022.
[2] T. Hulin, C. Preusche, and G. Hirzinger, “On the fidelity of haptic telepresence systems,” IEEE Transactions on Haptics, 4(3):221–235, 2011.
[3] J. Nielsen, Usability engineering. Morgan Kaufmann, 1994.
[4] M. A. Goodrich and A. C. Schultz, “Human-robot interaction: a survey,” Foundations and Trends® in Human-Robot Interaction, 1(3):203–275, 2007.
[5] J. Lee and Y.-B. Cho, “Fitts’ law-based performance evaluation of a haptic interface for teleoperated robot-assisted surgery,” Applied Sciences, 8(11):2264, 2018.
[6] T. Z. Zhao, V. Kumar, and C. Action, “Learning fine-grained bimanual manipulation with low-cost hardware,” arXiv:2304.13705, 2023.
[7] A. Sivakumar, K. Shaw, and D. Pathak, “Robotic telekinesis: learning a robotic hand imitator by watching humans on youtube,” CoRL, 2022.
[8] Y. Qin, H. Su, and X. Wang, “From one hand to multiple hands: Imitation learning for dexterous manipulation from single-camera teleoperation,” IEEE RA-L, 7(4):10873–10881, 2022.
[9] Y. Qin, W. Yang, B. Huang, K. Van Wyk, H. Su, X. Wang, Y.-W. Chao, and D. Fox, “Anyteleop: A general vision-based dexterous robot arm-hand teleoperation system,” RSS, 2023.
[10] P. Corke, Robotics, Vision and Control: Fundamental Algorithms in MATLAB. Springer, 2017.
[11] S. P. Arunachalam, I. Guzey, S. Chintala, and L. Pinto, “Holo-dex: Teaching dexterity with immersive mixed reality,” CoRL, 2022.
[12] S. Li, X. Ma, H. Liang, M. Gorner, P. Ruppel, B. Fang, F. Sun, and J. Zhang, “Vision-based teleoperation of shadow dexterous hand using end-to-end deep neural network,” ICRA, 2019.
[13] H. Zhang, W. Li, Y. Liang, Z. Chen, Y. Cui, Y. Wang, and R. Xiong, “Human-robot motion retargeting via neural latent optimization,” arXiv:2111.14811, 2021.
[14] T. Osa, J. Pajarinen, G. Neumann, J. A. Bagnell, P. Abbeel, and J. Peters, “An algorithmic perspective on imitation learning,” Foundations and Trends in Robotics, 7(1-2):1–179, 2018.
[15] A. Rajeswaran, V. Kumar, A. Gupta, G. Vezzini, J. Schulman, E. Todorov, and S. Levine, “Learning complex dexterous manipulation with deep reinforcement learning and demonstrations,” arXiv:1709.10087, 2018.
[16] X. B. Peng, P. Abbeel, S. Levine, and M. van de Panne, “Deepmimic: Example-guided deep reinforcement learning of physics-based character skills,” ACM TOG, 37(4):1–14, 2018.
[17] C. Lynch, M. Khansari, T. Xiao, V. Kumar, J. Tompson, S. Levine, and P. Sermanet, “Learning latent plans from play,” CoRL, 2020.
[18] C. Wang, Z. Xu, X. Chen, W. Yu, and H. Wang, “Dexcap: Scalable and portable mocap data collection system for dexterous manipulation,” arXiv:2403.07788, 2024.
[19] S. Macenski, T. Foote, B. Gerkey, C. Lalancette, and W. Woodall, “Robot operating system 2: Design, architecture, and uses in the wild,” Science Robotics, 7(66), 2022.
[20] S. G. Hart and L. E. Staveland, “Development of a multi-dimensional workload rating scale: Results of empirical and theoretical research,” Human Performance and Ergonomics, 2:139–183, 1988.
附录
A1 Open TeleDex 硬件生态
下表列出了 Open TeleDex 框架设计支持的硬件设备,包括已集成和计划未来扩展的设备。Open TeleDex 的模块化架构(特别是其 RealEnv 抽象层)通过实现对应的 Recorder 类即可方便地集成新硬件。
表 3:Open TeleDex 生态支持与计划中的硬件
| 类别 | 型号 / 类型 | 备注 |
|---|---|---|
| 机械臂 | ||
| Agilex Piper | 6 自由度臂。核心试验台组件。 | |
| Linker Arm A7 | 7 自由度臂。核心试验台组件。 | |
| RealMan | 计划支持。 | |
| Universal Robots (UR) | 计划支持。 | |
| 灵巧手 | ||
| LinkerHand O6 | 6 自由度手。核心试验台组件。 | |
| LinkerHand L10 | 10 自由度手。核心试验台组件。 | |
| LinkerHand L20 | 20 自由度手。核心试验台组件。 | |
| LinkerHand L30 | 计划支持。 | |
| 遥操作与传感器设备 | ||
| 主从臂 / 手套 | 高保真输入设备。已集成。 | |
| VR 手柄(如 PICO、Meta Quest) | 低成本沉浸式输入设备。已集成。 | |
| UdexReal 触觉手套 | 高保真触觉/动捕手套。已集成。 | |
| 外骨骼 | 计划支持。 | |
| Intel RealSense D455 | RGB-D 相机。核心试验台组件。 | |
| Intel RealSense D405 | 高精度、近距离 RGB-D 相机。已验证。 |
A2 典型任务数据集组成示例
本附录以一个具有代表性的抓取任务中的单次 episode(episode_000015)为例,详细说明 Open TeleDex 框架生成的结构化数据集的完整结构。
Episode 元数据:该表汇总了该 episode 记录的完整硬件与软件环境及采集参数,确保完全可复现。
表 4:episode_000015 记录的元数据
| 类别 | 参数 | 值 / 描述 |
|---|---|---|
| Episode 信息 | 任务名 | linkerhand_piper_grasp |
| Episode ID | episode_000015 | |
| Session ID | session_2025-10-10_13-46-35 | |
| 时长(秒) | 19.64 | |
| 时间步数 | 491 | |
| 硬件配置 | 预设 | piper_linkerhand_o6_single |
| 机械臂类型 | Agilex Piper(6 自由度) | |
| 灵巧手类型 | LinkerHand O6(6 自由度) | |
| 总自由度 | 12 | |
| 相机配置 | 预设 | intel_d455_single_top |
| 相机类型 | Intel RealSense D455 | |
| 位置 | 顶视(1280×720 @ 30fps) | |
| 采集参数 | 控制频率(Hz) | 25 Hz(dt = 0.04s) |
| 视频编码 | libx264(高质量) | |
| 数据结构 | 格式 | video_compressed |
| qpos 维度 | 12(6 臂 + 6 手) | |
| 相机流 | cam_top | |
| 触觉传感器 | right_hand |
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)