26年4月来自自变量机器人公司(X SQUARE ROBOT)的论文“XRZero-G0: Pushing the Frontier of Dexterous Robotic Manipulation with Interfaces, Quality and Ratios”。

获取高质量且动作对齐的演示数据,仍是扩展用于灵巧机器人操作的基础模型(foundation models)时面临的关键瓶颈。尽管无需机器人参与的人类演示(如 UMI 范式)为传统的遥操作提供了一种可扩展的替代方案,但现有系统仍受限于硬件人机工效不佳、工作流程呈开环状态以及缺乏系统性数据混合策略等问题。为解决这些局限,推出 XRZero-G0,这是一个软硬件协同设计的系统,旨在支持具身数据采集与策略学习。该系统配备符合人机工效学的虚拟现实(VR)界面,并集成俯视摄像头与双专用抓手,从而直接提升了数据采集效率。

为确保数据集的可靠性,针对非本体感知(non-proprioceptive)数据提出一套包含采集、检查、训练与评估的闭环流程。该流程实现 85% 的数据有效率,并建立一套透明的质量控制机制。此外,还研究无需机器人数据(robot-free data)在规模扩展过程中的经验性表现及最佳混合比例。大量实验表明,将少量真实机器人数据与大规模无需机器人数据相结合(例如按 10:1 的比例),所达到的性能可媲美纯真实机器人数据集,同时能将数据获取成本降低至原来的二十分之一。利用 XRZero-G0,构建一个时长达 2,000 小时的无需机器人数据集,实现了向目标物理机器人的零样本跨具身迁移(zero-shot cross-embodiment transfer),从而展示一种适用于通用现实世界操作的高度可扩展方法。


问题:什么样的硬件接口才是实现稳健且持续数据采集的最佳选择?该如何系统性地保证数据集质量?以及,何种数据混合比例能最有效地利用非本体感知(non-proprioceptive)的演示数据?

本文的核心见解在于,应对这些挑战需要对硬件组件、验证流程和训练方法进行紧密的协同设计。为此,其推出 XRZero-G0(见图 1所示),这是一个旨在通过在接口、质量和比例方面进行针对性创新来推动灵巧操作发展的综合框架。在接口层面,将方案从不受限的视觉 SLAM 转向高度稳健的可穿戴架构。
请添加图片描述

XRZero-G0 架构如图 2所示:通过符合人体工程学的 VR 界面采集原始的视觉-运动数据,并将其送入多级质量保证流水线进行处理,从而消除数据“黑箱”问题。随后,将由此生成的高保真、非机器人(robot-free)数据集与真实机器人数据进行策略性混合,用于训练基础策略网络;结果表明,该方法在实现精确机器人操作方面展现出了强大的正向迁移效应(即 1 + 1 > 2)。
请添加图片描述

通过集成商用 VR 头显以实现稳定的“由内而外”(inside-out)空间追踪、采用专用双模夹爪(包括按压驱动的 H 型和手指驱动的 G 型)以实现运动学对齐(见图 3所示),并配备背包式计算单元,XRZero-G0 确保无论环境条件如何,都能进行不间断的高频数据采集。
请添加图片描述

为了确保数据集的卓越质量,其用闭环的“采集-检查-训练-评估”流程取代传统的开环采集方式。该架构集成自动过滤和标注模块,能够在次优演示影响策略学习之前系统地识别并剔除它们,从而显著提高了可用训练数据的产出率。此外,为了严格验证数据的可扩展性,对数据比例进行了系统性研究。评估了四种不同的训练方案:仅使用真实机器人数据训练的基准模型、仅使用非机器人数据(robot-free data)的零样本(zero-shot)模型、用于表征对齐的协同训练方法,以及一种激进的数据扩展策略(10)——即将极少量的真实机器人锚定数据与海量的非机器人轨迹数据相结合。该架构的最后环节是一个自动基准测试框架,能够快速评估策略性能,从而形成一个高效的迭代闭环。


1 接口:稳健且符合人体工学的硬件架构

传统的遥操作受限于机器人硬件的物理特性,而近期基于手持式单目视觉SLAM(即时定位与地图构建)的无机器人本体操作范式,在无纹理或动态环境中极易出现追踪漂移。为克服这些空间局限性,XRZero-G0 引入了一种可穿戴架构,在保持高精度追踪稳定性的同时,实现了人类操作灵活性与机器人运动学特性的解耦。

• 多视角感知与抗漂移设计:操作员佩戴高精度 PICO 4 VR 头显,通过可调节 RGB 摄像头提供真实的“以自我为中心”(egocentric)视角。为缓解复杂任务中常见的严重视觉遮挡问题,系统在记录主视角的同时,同步采集双腕摄像头的画面。这种综合的多视角数据流确保了无论操作角度如何,都能提供稳健的视觉上下文信息。

• 异构夹爪与精确位姿追踪:首先评估了不同控制器安装配置下的追踪精度,以确定空间定位的最佳位置与朝向。为适应不同精细度要求的操作任务,该系统原生支持异构末端执行器。其设计了两种新型物理夹爪,并将左右 VR 控制器刚性固定其上:一种是针对快速宏观抓取优化的 H 型按压式夹爪,另一种是专为灵巧精细操作设计的 G 型手指驱动式夹爪。在数据采集过程中,为最大限度缩小人类操作员与目标双臂机器人之间的形态差异,对两个 VR 夹爪间的空间距离进行了精确校准,使其与真实机械臂的基准间距相匹配,从而确保结构上的一致性。同时,PICO 4 系统利用其高度稳定的“由内而外”(inside-out)追踪技术,在统一的世界坐标系下提供毫米级精度的 6 自由度(6-DoF)位姿估计,从而能够精确提取平移(x, y, z)和旋转(翻滚、俯仰、偏航)轨迹。

• 边缘端时空解析:系统配备一个可穿戴边缘计算单元,负责管理硬件级的同步工作。该模块利用严格的时空匹配机制,将自然语言指令、高频 6-DoF 控制器轨迹以及 30Hz 多视角视频流进行精确对齐。同步后的数据包随后被传输至中央服务器,在确保数据高保真度的同时,彻底解放了操作员的物理工作空间。

2 质量:数据验证自动化流水线

若将未经核实的原始机器人无关(robot-free)轨迹直接输入视觉-语言-动作(VLA)架构,会引入难以察觉的噪声,从而降低策略收敛效果。XRZero-G0 部署了一套多级后处理流水线,旨在过滤异常数据并确保物理真实性,从而缓解上述问题。

  1. 视觉清洗与运动滤波:人类运动的频率往往超出标准机器人控制的极限,导致严重的运动模糊。采用自动化图像质量评估算法,识别并剔除严重模糊的帧。同时,对于位置变化低于预设阈值的静止帧,我们进行降采样处理,以防止模型习得被动行为。
  2. 运动学重定向与逆运动学(IK)验证:利用时空对齐参数及目标载体(embodiment)的统一机器人描述格式(URDF),将人类的 6 自由度(6-DoF)轨迹直接映射至机器人末端执行器空间。自动化逆运动学(IK)求解器会对这些轨迹进行处理,严格剔除违反关节限位、遭遇运动学奇异点或存在自碰撞风险的无效片段。
  3. 物理回放验证:为确保向物理硬件转换时保持高保真度,建立一套闭环回放协议。针对每类任务,从过滤后的轨迹中随机抽取子集,并在目标双臂机器人上严格执行开环回放。物理执行过程中的任务成功完成即作为轨迹有效性的最终基准,从而确保剩余数据集在本质上是可执行的。
  4. 语义标注:将长时间的连续轨迹分割为离散的子任务片段。这些片段辅以细粒度的语义标注,详细描述被操作物体及关键帧信息,从而为大规模预训练和特定任务微调提供支持。

通过这一严谨的验证流程,该框架实现高达 85% 的数据有效率,为下游的策略学习奠定了坚实基础。

3 比例:基于原则的数据混合与扩展策略

扩展具身基础模型(Embodied Foundation Models)面临的核心挑战在于,如何确定大规模、低成本的“无机器人”(robot-free)数据与精确但高成本的真实机器人演示数据之间的最佳算法融合方式。其制定一种协同数据混合方法,使这两类数据在不同的训练阶段发挥互补作用。

• 通过预训练构建可泛化的潜空间:在初始训练阶段,海量的 XRZero-G0 数据充当语义与空间泛化的引擎。通过接触多样化的环境,基础模型获得稳健的视觉-语义对齐、物体affordance识别以及拓扑轨迹规划能力。该阶段构建了一种独立于特定机器人硬件的通用多模态表征。
• 通过按比例微调实现运动学落地(Kinematic Grounding):尽管“无机器人”数据提供了深刻的环境认知,但它天生缺乏针对具体具身形态的底层物理先验知识。在随后的微调阶段,引入严格控制比例的真实机器人数据,作为运动学层面的“锚点”(anchor)。这一物理精确的子集引导预训练阶段形成的潜在空间进行收敛与对齐,以适应目标硬件特有的电机延迟、摩擦系数及关节限位等特性。

这种结构化的混合比例方法在理论上阐明:为何将极少量的真实机器人数据与海量的“无机器人”轨迹数据相结合,能够实现对新环境的快速零样本(zero-shot)适应。

4 策略网络:通用的模型兼容性

XRZero-G0 的核心设计目标是输出一种通用的、与具体模型无关(model-agnostic)的具身数据集。这些经过严格验证的多模态数据流(包含同步的多视角图像、语言指令以及经逆运动学(IK)验证的 6 自由度轨迹)并未与特定的学习算法强耦合,而是被格式化以提供标准化的监督信号。这确保了其能直接兼容当前机器人领域主导的两大策略范式:

• 视觉-语言-动作(VLA)范式:主流的端到端连续控制模型需要海量的精确视觉-运动(visuo-motor)配对数据。XRZero-G0 数据集能够原生满足这一需求。三视图相机配置所提供的全面空间上下文信息,直接增强了视觉特征提取的鲁棒性;而经过严格筛选的6自由度(6-DoF)位姿轨迹则充当了纯净、无噪声的动作标签。这种高保真的数据配对使得VLA(视觉-语言-动作)架构能够将观测映射为精确的末端执行器运动,从而避免了因人类演示异常而通常会导致的性能下降。

• 世界动作模型(WAM)范式:融合了预测性世界模型的新兴架构,高度依赖于对物理状态转移动态的理解。该数据集通过提供稳定、高频的视觉流,辅以细粒度的语义标注和离散的时间分割,有力地支持了这一目标。这种结构化的多模态时序数据,能够明确辅助WAM建立动作与后续环境状态变化之间严谨的因果关系,进而实现复杂、长时程操作任务所需的前向预测规划。


1 数据集统计与分布

为验证 XRZero-G0 框架的有效性,构建综合性的 G0 数据集。利用可穿戴式采集装置,操作人员收集了超过 2000 小时的高保真、多模态演示数据。该数据集涵盖了 3000 种不同的操作任务,捕捉了复杂、非结构化环境中的广泛物体交互行为。

任务分布:数据集的构成呈现出显著的长尾分布特征(如图 4所示)。分布的头部主要由基础性、高重复性的任务构成(例如“折叠毛巾”、“清理桌面”和“整理物品”)。这些海量的常见交互数据使策略网络能够学习到鲁棒的视觉-语义对齐关系以及通用的空间可供性(spatial affordances)。相比之下,长尾部分则由数千种细粒度、专业化的任务组成。这种结构上的多样性确保了广泛的语义覆盖,从而提升了模型在新操作场景下的泛化能力。
请添加图片描述

采集效率:这种无需机器人本体参与的可穿戴式采集范式,其主要结构优势在于极高的数据采集吞吐量。基于针对典型日常任务的专项连续采集基准测试,操作人员的峰值采集速度达到了每小时 93.2 个任务片段(episodes)。这种高吞吐效率有效解决了传统实体机器人遥操作中固有的空间占用限制和操作瓶颈,证明了通过深度利用人体运动学特性来扩展具身智能数据规模的可行性。


1 实验设置

具身载体(Embodiments):为严格验证跨载体泛化能力,部署了两种结构迥异的双臂机器人系统。CX001 平台采用多关节配置,侧重于高灵活性;而 EX001 平台则专为重负载和扩展操作空间而设计。这两种载体均采用了异构物理夹爪。

基础策略网络:用三种主流的视觉-语言-动作(VLA)基础模型对数据流水线进行评估,以展示其广泛的架构兼容性:
• Wall-OSS (21):一种端到端的具身基础模型,集成统一跨层思维链(Uni-CoT)机制,旨在实现鲁棒的语言-动作对齐及复杂的 3D 空间推理。
• π0 (2):一种通用机器人基础模型,利用流匹配(flow-matching)架构,根据视觉观测生成底层运动指令。
• π0.5 (9):π0 的进阶版本,基于异构多机器人数据集与网络规模数据联合训练,针对开放世界泛化能力进行了优化。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐