Ego2Robot:基于以自我为中心的人类数据的可扩展机器人数据合成
26年8月来自人民大学、阿里千问、上海科技大学、北京BIGAI和北航的论文“Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data”。
学习可泛化的机器人操作策略需要大规模且多样化的演示数据。以人类为中心的操作视频提供丰富的场景和任务多样性,先前的研究表明,将此类视频重定向并渲染成机器人格式的数据可以在小规模下产生有效的单任务策略。然而,这种方法能否大规模地为视觉-语言-动作模型提供预训练优势仍有待探索。Ego2Robot,这是一个可扩展的流程,它通过动作重定向、机器人手臂视觉合成和多级质量管理,将以人类为中心的操作视频转换为机器人训练数据。Ego2Robot 同时支持精选数据集和真实场景视频,生成 18,561 小时的机器人训练数据,涵盖 15 种机器人形态,使其成为迄今为止最大的自体到机器人数据集。为了评估泛化能力,扩展 RoboTwin2.0,使其包含解耦的扰动轴,涵盖视觉外观、场景布局、具身形态和任务语义。实验表明,在 Ego2Robot 合成数据和机器人数据上进行联合预训练,可以持续提高多种扰动类型下的分布外泛化能力,并且在真实机器人部署中验证了其优势。
Ego2Robot是一个端到端的流程,它通过动作对齐、视觉对齐和多级质量管理(图1所示),将以自我为中心的人类操作数据转换为特定于机器人形态的训练数据。该流程支持带标注的自我数据集和纯自我视频,并处理了来自四个不同来源、涵盖15种机器人形态的约1940小时的以自我为中心的视频,生成了18561小时的有效机器人训练数据,这是迄今为止最大的一个自我到机器人数据集。

如图所示15个机器人形态:

为了评估ego2robot合成的数据是否能提高机器人的泛化能力,进一步引入一种基于RoboTwin2.0 [16] 的解耦评估协议。与以往将多个分布偏移聚合为单一分数的评估方法不同,协议将扰动从四个维度进行解耦:视觉外观、场景布局、形态和任务语义。这可以对结合机器人和ego2robot合成数据的预训练的优势进行精细分析,并探究这些优势是源于视觉鲁棒性、具身迁移还是语义泛化。大量实验表明,ego2robot合成数据能够持续提升分布外性能,并为机器人数据提供补充价值。尤其值得注意的是,在视觉、具身和语义扰动下,这些优势最为显著,这表明大规模ego2robot合成数据主要提升的是不变性和跨分布鲁棒性,而不仅仅是增加轨迹覆盖范围。
针对以自我为中心的、描绘人类手部操作的视频,其流程通过三个阶段生成特定于人体的机器人训练数据:动作对齐、视觉对齐和质量筛选(图 1所示)。
动作对齐通过重定向和时间平滑将手部姿态转换为机器人末端执行器轨迹。视觉对齐通过手臂分割、手部移除、使用逆运动学求解进行机器人基础姿态搜索以及深度感知渲染,将人类手臂替换为渲染的机器人手臂。质量筛选则在轨迹、帧和片段级别对样本进行过滤。该流程支持两条输入路径:路径 A 接受带有现有手部姿态标注的自我数据集,而路径 B 处理未标注的视频,首先使用 WiLoR [47, 48] 逐帧重建和 DynHaMR [49] 时间优化估计手部姿态。对于较长的视频,采用 Qwen3.5 [50] 将连续录像分割成具有自然语言描述的离散子任务。在手部姿态估计之后,两条路径共享一个统一的流程,该流程并行生成 15 种支持的机器人形态的训练数据。
- 动作对齐:动作对齐阶段通过重定向和时间平滑将手部姿态转换为平行夹爪末端执行器的运动轨迹。
- 视觉对齐:视觉对齐将自视频从描绘人手转换为显示在同一场景中操作的机械臂。
- 质量控制:应用三级质量过滤。L1(流水线内部):在处理过程中标记存在逆运动学故障、自碰撞、动作异常值或工作空间覆盖不足的帧。L2(统计):移除具有极端动作值、突然不连续或无效帧比率过高的轨迹。L3(VLM 一致性):使用视觉-语言模型 [50] 审核合成视频,以确保渲染的机器人动作与原始操作意图之间的语义一致性。
- 将该流程应用于四个以自我为中心的数据集:ANT(7 小时,内部的带有手部姿态标注的抓取放置数据集)、EgoDex [12](732 小时)、ViTRA [29](249 小时)和 EgoVerse [13](954 小时),总计约 1940 小时的带标注自我数据。由于以自我为中心的手部操作速度远快于机器人远程操作,在训练过程中对每个数据集的帧进行下采样,以匹配机器人的速度分布:ANT 和 EgoDex 的帧率下采样至原始帧率的 60%(约慢 1.7 倍),EgoVerse 下采样至 45%(约慢 2.2 倍),ViTRA 下采样至 25%(约慢 4 倍)。
经过对 15 种机器人形态的处理和质量控制后,最终得到 18561 小时的合成机器人训练数据。每个样本包含一个机器人合成的视频帧、对应的相机帧末端执行器(EEF)动作、相机参数以及一段文本指令。由于以自我为中心的视频是在各种未知的相机位置拍摄的,因此采用世界坐标系下的动作表示方法需要对每个视频进行校准,并且会导致不同来源的动作空间不兼容。相机帧相对的EEF动作表示末端执行器在观察者坐标系中的位移,自然地统一了来自不同相机设置和机器人形态的数据。
了解哪些泛化维度受益于 ego2robot 合成数据,以及哪些维度受限于领域差异,需要现有基准测试无法提供的评估粒度。当前协议(例如 RoboTwin 2.0 [16])同时应用多个扰动因子,生成一个单一的综合 OOD 指标,该指标混淆了视觉、空间、具身性和语义变化。
扩展 RoboTwin 2.0,使其包含 11 个独立的扰动设置和相机帧相对 EEF 支持,并补充 EBench [46]。EBench 在 Isaac Sim 中提供 7 个精确的桌面任务,其头部摄像头位置更高,更接近自我中心视角。该扩展涵盖四个泛化维度,如图 2 所示:

(1) 视觉外观——独立控制背景纹理、光照和机器人颜色。背景和光照与原始捆绑的随机化解耦,以便进行单独测试。 对所有机器人连杆应用随机色调偏移,测试其对训练期间未见过的外观变化的视觉不变性。
(2)场景布局:桌面高度变化(±4厘米)、干扰物和相机视角偏移(±5厘米),所有这些都相互独立,以便进行独立评估。这些空间扰动旨在探测其对真实部署中常见的物理布局变化的鲁棒性。
(3)机器人形态:将默认的Aloha-Agilex替换为UR5-WSG、ARX-X5和Franka Panda,进行零样本跨形态评估,并通过逆运动学(IK)对齐初始末端执行器姿态,以确保一致的起始条件。这测试相机帧动作表示是否能够在形态不同的机器人之间泛化,而无需针对特定形态进行微调。
(4)任务语义:使用在任务训练期间未见过的物体实例评估50个任务,并使用505条用口语形式重新表述的自然语言指令进行评估。这可以探究模型对新物体外观的泛化能力以及对语言变异的鲁棒性。这种分解方法能够将泛化能力的提升精确地归因于特定的扰动类型。
实验设置
模型架构。采用基于VLA的架构,以Qwen3.5-4B作为视觉语言骨干,并使用扩散transformer(DiT)作为动作头。该模型预测以相机帧为基准的末端执行器表示的32步动作块,扩散步骤数为8。
训练协议。所有预训练运行均使用相同的超参数:8个GPU,批大小为12/GPU,学习率从1e-5递增至1e-6(采用余弦衰减),bf16,训练步数为20万。由于所有配置均使用相同的批大小训练相同数量的步数,因此每种设置处理的训练样本数量相同(约1920万帧),从而确保了无论数据集大小如何,都能进行公平的比较。微调加载预训练权重,并使用ColorJitter增强进行5万步训练。
预训练数据。比较四种配置:(i)仅机器人数据(DROID [7] + AgibotWorld [8] + InternData [55],约 6,565 小时),以及(ii-iv)Ego2Robot 合成数据(简称 Ego2R)与机器人数据按 1:3、3:1 和 1:1 的比例混合。微调和评估。所有模型均在 RoboTwin 的 50 个干净设置任务(每个任务 50 次演示)上进行微调,并在每种扰动设置下进行评估,每个任务 50 次演示。EBench 模型在其训练集上单独进行微调。对于真实机器人评估,在 ARX ACone 平台上测试了 5 个长时域操作任务。
真实机器人实验
在 ARX ACone 平台上对五项长时程任务(图 5所示)进行评估:将水果放入篮子、将积木放入抽屉、折叠毛巾、将垃圾扫入垃圾桶以及拧入螺丝。对于每项任务,收集 20 个远程操作演示。此外,还录制以自我为中心的手部操作视频(每个场景约 7 分钟),并通过Ego2Robot 流程处理这些视频,以生成 ACone 特有的合成演示。比较三种配置:纯机器人配置,使用纯机器人预训练,并在远程操作演示上进行微调;混合配置,使用 Ego2R+机器人 (1:1) 预训练,并使用相同的演示;混合 + Ego2R 播放配置,在远程操作演示和经流程转换的自我操作 (Ego2R) 数据 1:1 混合的基础上进行微调。

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)