26年6月来自乔治亚理工和清华的论文“EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations”。

灵巧操作受限于大规模机器人演示数据采集的成本。以人类视角拍摄的视频提供了丰富的操作行为数据,但直接将其用于机器人学习需要弥合两个差距:人类和机器人观察结果之间的视觉差距,以及人类运动和机器人可执行动作之间的动作差距。EgoEngine,一个可扩展的框架,用于将以人类视角拍摄的操作视频转换为高保真度的机器人数据。给定一个以人类视角拍摄的 RGB 视频,EgoEngine 可以生成:(i) 一个高保真度的机器人观察视频,该视频将人类替换为机器人,同时保留场景上下文和时间对齐;(ii) 在可行性约束下,生成一个与任务对齐的、可执行的机器人动作轨迹。仿真和真实机器人实验表明,EgoEngine 能够将人类视频可扩展地转换为机器人数据,并且它实现了无需真实机器人演示,仅从以人类视角拍摄的视频中学习零样本视觉运动灵巧策略。


如图 1 所示,给定一段人类 RGB 视频,EgoEngine 会生成一个包含以下两部分的机器人演示:(1) 一段机器人观察视频,展现机器人在原始场景中执行交互操作的过程;(2) 一条与任务目标运动方向一致的可执行机器人轨迹。通过生成与原始人类视频保持一致且对机器人而言物理上可执行的观察-动作对,EgoEngine 能够生成高保真度的大规模数据集,并支持零样本视觉运动策略学习,而无需任何机器人远程操作数据。
请添加图片描述

EgoEngine 通过以目标为中心的视觉-动作生成流程,解决了人机迁移的核心挑战。EgoEngine 首先对视频进行预处理,构建一个能够对齐场景、目标和机器人形态的数字孪生模型。在视觉生成过程中,EgoEngine 将视频中的人替换为机器人,从而生成在每一帧中都保留原始场景上下文和目标状态的机器人观察视频。为了生成动作,EgoEngine 首先将人体运动重映射到机器人参考轨迹上,然后在仿真中对其进行细化,生成由参考物体运动监督的可执行机器人轨迹。为了提高效率,EgoEngine 采用蒙特卡洛树搜索(MCTS)风格的自适应模式切换策略,在需要更强细化时,从回放(Replay)升级到模型预测控制(MPC),最后升级到强化学习(RL)。经过这两个分支后,生成的演示数据可用于下游策略训练。


1. 人体视频到仿真

对于每个人体视频,按如下方式重建以对象为中心的数字孪生体。使用 Aria Gen2 眼镜 [9] 捕捉人体演示 τ(h),该眼镜提供同步的 RGB 帧和每帧 3D 手部姿态(包含 21 个手部关键点)。用 FoundationStereo [46] 从 RGB 帧估计绝对深度图。然后,用 SAM2 [47] 生成两种类型的掩码:手部关键点提示提供用于移除演示者的手臂-手部掩码,而首帧点提示则跟踪整个视频片段中的任务-对象掩码。给定 RGBD 帧、跟踪的对象掩码和对象网格,FoundationPose [48] 估计一个时间一致的 6D 对象轨迹 {Tt_o}。最终得到的相机几何结构、深度、掩码、手部姿态、对象网格和对象轨迹共同定义了动作分支和视觉分支所使用的数字孪生体。

2 动作生成

以人为中心的重定向

将人手的运动重定向到参考机器人轨迹。

以物体为中心的轨迹优化

在重定位之后,EgoEngine 面临着一个长时域、高自由度的轨迹优化问题:参考轨迹保留人类运动的先验信息,但必须将其转换为可执行的机器人动作,以重现演示的物体运动。仅靠重新定位是不够的,原因有二:(1) 由于人机本体差异(包括运动学不匹配和接触动力学差异),重放操作常常失败;(2) 人类视频提供的是可观察的本体感受轨迹,而非动作指令,这导致在施加力和维持接触方面存在本体感受到动作的差距。在仿真中采用以物体为中心的目标函数来优化参考轨迹,将从人类视频中提取的物体运动作为可执行机器人动作的任务级目标。

求解器模式。EgoEngine 将长时域轨迹分解为多个时间片段,并逐步优化每个片段。对于每个片段,EgoEngine 使用三种优化能力递增的求解器模式。回放模式直接执行参考机器人轨迹。模型预测控制 (MPC) 在参考轨迹周围的短时域动作样本上进行搜索,以适中的代价提供局部修正。强化学习 (RL) 则针对难处理片段训练手部残差策略。

MCTS风格的自适应模式切换。与以往学习通用或链式策略以进行长时域操作的灵巧强化学习方法[53]不同,这些方法通常需要大量的奖励工程[54, 55]或大规模仿真[56],EgoEngine采用一种蒙特卡洛树搜索(MCTS)风格的模式切换策略[57]。这里,MCTS风格指的是一种轻量级的、基于启发式的求解器模式渐进式搜索,而不是完整的MCTS算法。EgoEngine并非将最强的求解器应用于整个轨迹,而是在每个数据块中,从回放模式开始,只有当当前模式无法产生可行或足够改进的展开结果时,才会升级到MPC或强化学习模式,如图2所示。
请添加图片描述

当参考轨迹满足以对象为中心的准则时,则保留回放模式;否则,EgoEngine 会调用 MPC 进行局部修正,如果 MPC 仍然不足以进行更精细的优化,则会回退到 RL 进行更强的强化。为了避免孤立地优化每个数据块而陷入局部最小值,EgoEngine 使用双数据块优化窗口,同时求解当前数据块和下一个数据块,但只有当两个数据块都可行时才执行当前数据块。这种设计通过避免不必要的优化和消除在整个轨迹上维护 RL 策略的需要来提高效率。

3 视觉生成

人体移除。原始的以自我为中心的帧 I(h)_t 显示正在执行任务的人体手臂和手;在合成到机器人渲染之前,必须移除这些区域。用SAM2 遮罩对手臂和手部区域进行掩码,并使用 Inpaint-Anything v2 [58] 填充,从而恢复被演示者遮挡的场景和物体内容。这样就得到一个不包含演示者的帧 I ̄ t,其中保留场景和目标物体,机器人将被合成到该帧上。

遮挡-觉察混合。给定动作分支中的机器人轨迹,以自我为中心的视角渲染机器人获得 R_t,并通过两遍差分渲染恢复一个遮挡感知掩码。在两遍渲染中都保持物体几何体不透明,分别渲染机器人全透明 (It_bg) 和机器人不透明 (It_rob) 的场景;掩码是根据阈值化的 RGB 差值,逐像素 p 计算得出的。

由于物体在两次扫描中都存在,这隐式地移除被遮挡的机器人像素,从而得到可见机器人掩模 M̃t_r。最终生成的观测结果与 R_t 和 M̃t_r 混合。

4 策略蒸馏

在动作分支和视觉分支之后,每个人类视频都被转换为一个机器人演示视频,该视频包含同步的机器人观察和动作。将这些视频聚合起来,得到一个合成机器人数据集 D̃_robot = {(õ, ã)},其中 õ 表示从视觉分支(包含本体感觉)生成的机器人观察结果,ã 表示从动作分支生成的相应动作。用该数据集,通过 HPT [59] 训练一个视觉运动策略 π_θ,并采用 l2 动作回归损失。该策略将两个分支蒸馏为一个闭环控制器,该控制器将机器人观察结果映射到动作。

实验设置

评估围绕三个问题展开。

首先,生成的机器人观测结果在视觉上是否与真实机器人的观测结果一致?在外观和表征空间中比较合成的和真实的机器人观测结果。
其次,生成的机器人动作是否可执行且与任务一致?测试它们是否能在 TACO 和 Aria 仿真环境中重现演示的对象交互。
第三,生成的观测-动作对是否支持零样本策略学习?用 EgoEngine 生成的演示训练策略,并在真实机器人上进行评估。

数据集和设置。用两个数据源进行评估。TACO [60] 提供 2500 个视频序列用于视觉和动作评估。用 Aria Gen2 Glasses [9] 收集 Aria 数据集,其中包含 200 个涵盖四个任务的真实世界以自我为中心的人类视频。为了进行比较,还收集 200 个真实机器人远程操作演示,这些演示未被 EgoEngine 使用。在仿真中,用一台配备两个 7 自由度机械臂和两个 12 自由度 XHand 的双臂 RB-Y1 机器人。在真实机器人上,用了一台配备一个 XHand 的单臂 RB-Y1 机器人。

任务。在仿真中,用 TACO 中选定的 16 个演示对进行评估,这些演示对与机器人本体和数字孪生重建流程兼容。在真实环境中,用 Aria 的四个任务进行评估:芥末(将芥末瓶放在目标板上)、抽屉(打开抽屉并将立方体放入其中)、锤子(拿起锤子并敲击钉子)和花朵(将水瓶递给花朵)。这些任务涵盖多种交互模式,包括拾取和放置、工具使用和精细接触。

评估指标。用与每个评估问题相匹配的评估指标。为了保证视觉保真度,报告与真实机器人观测结果的定性比较和特征空间对齐情况。为了保证动作保真度,报告成功率、目标跟踪奖励和生成成本。为了保证下游策略性能,报告在固定部署试验条件下真实机器人的成功率。


1 硬件和数据预处理

图 A.1 展示整体数据采集和机器人系统。为了最大限度地减少动作差距,在实验中使用了配备 XHand 灵巧手的 RB-Y1 人形机器人。在仿真中,用双臂双 XHand 设置;在实战机器人实验中,用单臂单 XHand 设置。用 Aria Gen2 采集人类演示视频,以建立用于研究的综合数据集。为了最大限度地减少人类和机器人演示之间的视觉差距,在机器人上安装了相同的眼镜,以实现以自我为中心的视角感知。
请添加图片描述

Aria Gen2 眼镜。Aria Gen2 是 Project Aria 项目 [9] 中的下一代研究设备。它作为一个以自我为中心的感知平台,从佩戴者的视角记录人类演示,然后用于机器人的以自我为中心的感知,从而提供最先进的手部跟踪、SLAM 和深度估计结果。

RB-Y1 人形机器人。 RB-Y1 是一款全身人形机器人,将其用作目标实体来执行重定向演示。它提供一个包含躯干和两条手臂的全身操作平台,能够在保持身体运动稳定的情况下,与日常物品进行双手交互。在系统中,通过标准的底层控制器接口(例如,关节空间位置/速度控制)来控制机器人,并执行由重定向模块生成的轨迹。

XHand。XHand 是一款 12 自由度的灵巧机械手,拇指和食指各有 3 个自由度,其余手指各有 2 个自由度。将其安装在 RB-Y1 的末端执行器上,以实现更精细的物体交互。

2 机器人远程操作

收集真实的机器人远程操作演示数据,用于参考和样本效率比较。将EgoEngine生成的数据与真实机器人远程操作数据的样本效率进行了比较。

用RB-Y1机器人最先进的远程操作系统SEW [19]进行全身手臂重定向,并使用Open-TeleVision (OpenTV) [20]进行灵巧手部远程操作,如图A.2所示。对于上半身,SEW提供一种解析重定向方法,利用该方法将操作者的肩部、肘部和腕部运动实时映射到机器人手臂上。人体运动观测数据从Aria眼镜传输到MetaQuest,生成的重定向指令用于机器人的全身控制。对于手部动作,遵循 OpenTV 的理念,利用从手掌到五个指尖的向量作为手部动作的表示,将操作者的手部运动重定向到 XHand 模型。将 RB-Y1 机械臂表示为笛卡尔坐标系中的腕部姿态,将 XHand 模型表示为关节位置。这种设计足以满足数据采集流程,并为远程操作演示的录制提供了一个实用的接口。
请添加图片描述

3 数字孪生重建的扩展

EgoEngine 依靠数字孪生技术来连接以人为中心的视频和机器人可执行的演示。给定一个以人为中心的输入视频,数字孪生重建模块会构建一个仿真场景,该场景保留了原始交互中与任务相关的几何形状、物体布局和摄像机视角。值得注意的是,虽然数字孪生重建目前仍然是 EgoEngine 的一项实际要求,但这一阶段可以日益自动化:诸如 SAM3D [66] 等最新的 3D 基础模型可用于从以人为中心的观察结果中分割和重建与任务相关的物体,从而减少手动场景建模或物体标注的需求。这使得数字孪生构建成为一个可扩展的系统组件,而不是一个固定的手动瓶颈。重建的数字孪生随后为 EgoEngine 的两个分支提供了共同的基础空间:视觉分支将机器人渲染到对齐的场景中,而动作分支则根据以物体为中心的任务运动优化机器人轨迹。

为了验证该重建阶段的可扩展性,将数字孪生重建流程应用于来自 EgoVerse [5] 和 EgoDex [7] 的以自我为中心的操控视频。这些数据集包含各种不同的物体、视角以及丰富的接触式手-物体交互,使其成为评估数字孪生构建过程能否推广到人工整理场景之外的理想测试平台。结果表明,EgoEngine 能够以足够的保真度恢复与任务相关的场景结构和物体属性,从而支持下游的机器人视觉生成和动作优化。

图 A.3 展示来自 EgoDex 和 EgoVerse 的 12 个示例,以说明将数字孪生重建扩展到各种以自我为中心的操控视频的潜力。这些示例涵盖了不同的物体、布局、视角和手-物体交互,表明重建阶段并不局限于手动准备的场景或一组固定的任务对象。通过保留与任务相关的几何形状和以自我为中心的场景结构,这些数字孪生为 EgoEngine 的视觉和动作分支提供了所需的共享表示。这展示了将 EgoEngine 扩展到大型以自我为中心的视频数据集的潜力,其中各种人类操控视频可以自动导入仿真环境,用于生成机器人演示。
请添加图片描述

EgoDex 是一个大规模数据集,也是一个基准数据集,用于测试以自我为中心的灵巧操作,该数据集使用 Apple Vision Pro 上的 ARKit 采集。该数据集包含 829 小时的 30Hz 1080p 以自我为中心的视频,并配有头部、上半身和手部的配对 3D 姿态标注以及自然语言标注。它完全由 194 个不同任务的桌面操作组成。

EgoVerse 是一个基于人类数据驱动的机器人学习协作平台,它将数据采集、处理和访问统一到一个共享框架下,从而支持个人研究人员、学术实验室和行业合作伙伴的贡献。当前版本包含 1362 小时(8 万个视频片段)的人类演示,涵盖 1965 个任务、240 个场景和 2087 位不同的演示者,并采用标准化格式、与操作相关的标注以及用于下游学习的工具。

4 策略架构和训练细节

仅使用 EgoEngine 生成的合成机器人演示数据来训练策略。此阶段未使用任何真实机器人的远程操作数据或协同训练方案。

观测编码器

策略基于 HPT [59],以 RGB 观测值和本体感觉状态作为输入,并使用流匹配头直接输出动作。

视觉部分。给定一个 RGB 图像 I ,首先对其进行 ImageNet 归一化,并使用在全局平均池化之前截断的 ResNet-18 骨干网络对其进行编码。这将生成一个空间特征图,该特征图被展平并线性投影到 Transformer 的隐藏维度。一组可学习的查询token通过单个交叉注意力模块关注视觉特征,从而生成固定数量的视觉token。

本体感觉部分。本体感受观测向量 q(包含机器人状态信息,例如关节位置和末端执行器姿态)首先被归一化,然后通过线性层进行投影。一组可学习的查询token通过交叉注意力模块提取固定数量的本体感受token。

token融合编码器。来自所有观测维度的token沿序列维度连接起来。添加少量可学习的上下文tokens,并使用 Transformer 编码器处理生成的序列。输出的上下文tokens作为动作预测的紧凑观测表示。

流匹配动作解码器

用基于编码器上下文token的流匹配 Transformer 解码器预测长度为 T 的动作范围。

在训练过程中,给定一个真实动作序列 a_1 = a 和高斯噪声 a_0 ∼ N (0, I ),对一个连续插值时间 τ ∈ (0, 1] 进行采样,并构建

x_τ = τa_0 + (1 − τ)a_1。

解码器以 x_τ 和 τ 的时间嵌入作为输入,并预测速度场 v_θ (x_τ , τ ),然后将其与目标速度 dx_τ/dτ = a_0 − a_1 进行回归,该目标速度从干净的动作序列指向噪声。

解码器采用 Transformer 实现,并交替使用自注意模块和交叉注意模块,其中动作token关注编码器上下文token。最后一个线性层将解码器的输出映射到动作空间。

在推理阶段,将动作序列初始化为 τ = 1 时的高斯噪声,并将学习的速度场沿 τ 递减方向从 τ = 1 到 τ = 1 进行积分。 0 使用固定步长的欧拉更新。所有实验中都使用 10 个推理步骤。

真实机器人实验设置

在四个真实机器人操作任务上评估 EgoEngine:芥末、抽屉、锤子和花朵,如图 D.1 所示。每个任务都引入随机的初始物体姿态,以评估其在实际执行变化下的鲁棒性。

芥末。芥末任务是一个抓取和放置任务。机器人需要从初始姿态抓取一个芥末瓶,并将其放置在目标板上。芥末瓶的初始位置在一个 10 cm × 10 cm 的正方形区域内随机生成,并围绕垂直轴存在 ±30° 的方向扰动。物体最初放置在桌面上。只有当芥末瓶完全放置在目标板上并在释放后保持稳定时,试验才被视为成功。

抽屉。抽屉任务要求机器人先打开抽屉,然后将一个立方体放入其中。立方体的初始化遵循与芥末任务相同的随机化设置,并具有一个位置偏移范围为 10 cm × 10 cm,方向扰动为 ±30°。只有当抽屉打开且立方体被放入抽屉内时,试验才被视为成功。

锤子。锤子任务要求机器人从支架上拿起锤子,并用它敲击目标钉子。钉子的位置在 5 cm 的偏移范围内随机变化,锤子的初始位置在横向偏移范围内随机变化,最大偏移量为 5 cm。只有当机器人成功地从支架上拿起锤子并敲击目标钉子时,试验才被视为成功。

花。花任务要求机器人拿起水瓶并将其对准花盆。水瓶的位置在 10 cm × 10 cm 的正方形区域内随机变化,方向绕垂直轴有 ±30° 的扰动。花盆的位置在 5 cm 的偏移范围内随机变化,并允许任意平面旋转。只有当机器人拿起水瓶并最终将其对准花盆时,试验才被视为成功。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐