HOST :机器人仅需观看一段人类视频,即可在几秒钟内掌握操作技能
26年8月来自北理工、自变量机器人和清华的论文“HOST: Robots Acquire Manipulation Skills in Seconds from a Single Human Video”。
对于机器人而言,快速轻松地习得新技能并保留已掌握的技能至关重要。然而,现有方法仍然依赖于繁琐的训练循环,这不仅成本高昂、速度缓慢,还会削弱已掌握的技能。本文提出 HOST(人机单样本技能习得)的框架,该框架使机器人能够从单个人类视频中快速习得技能,同时保留先前掌握的技能。HOST 通过一系列基于自我认知的预测来解决技能习得问题。它首先估计机器人在演示任务中的进度,然后将即将发生的进度转化为机器人自身的未来观察结果,最后根据这些预测结果导出动作。该级联模型基于与视频演示相关的目标进行训练,这些目标通过将机器人轨迹和视频演示映射到共享的任务进度流形上获得,然后重新定义每个目标以使其与视频的未来进度保持一致。因此,HOST 使机器人能够主动跟随演示流程并将其适应自身的身体结构。 HOST 仅需 29 秒即可从一段人类视频中习得新技能,平均成功率达 62%。它比零样本基准模型高出 45%,同时还能保留已掌握的技能。HOST 甚至超越了基于 50 个机器人演示进行微调的基准模型,而所需的演示次数却减少了 50 倍,习得每项技能的速度也提高了 507 倍。
如图1 所示机器人仅需几秒钟即可通过观看一段人类视频掌握操作技能。
(A) 现有方法通过繁琐的训练循环来教授机器人新技能,这种方法成本高昂且耗时,并且会削弱机器人先前掌握的技能。HOST 则不同,它仅需 29 秒即可从一段人类视频中推理并习得技能,同时还能保留机器人先前掌握的技能。

(B) 从一段人类视频中习得技能面临着视频演示与实际操作之间结构性不匹配的问题。两者之间的时间异步性导致预测目标与视频演示脱钩,而状态差异则阻碍了将观察到的行为转化为实际行动。© HOST 通过两种机制克服了这种不匹配:将预测目标与演示内容耦合,并通过自我定位的预测来解决执行问题,从而使机器人能够主动遵循演示流程并将其调整为符合自身特性。

如图 2 所示HOST 方法概述。(A) 将预测目标与演示视频耦合。HOST 将机器人轨迹和视频演示映射到共享的任务进度流形上,然后重新定义每个目标以使其与视频的未来进展保持一致,从而将视频转化为机器人预测的主动驱动因素。(B) 通过自定义预测解决执行问题。HOST 通过一系列自定义阶段的因果级联进行工作。它首先定位机器人在视频演示中的进展,然后将其即将发生的进展转化为机器人自身的未来观测结果,最后从这些预测的观测结果中导出动作。© 给定一段之前未见过的人类任务视频,HOST 运行相同的自定义级联来执行该任务,从而在掌握新技能的同时保留已掌握的技能。

如图 3A 所示,HOST 可以从一段人类视频中习得操作技能。给定顶部一行所示的人类视频,HOST 能够主动学习视频中演示的操作流程,并将其应用到自身,无需任何参数更新即可完成底部一行所示的各项任务。这些任务涵盖了不同的物体、工具和操作基元。

如图 3B 所示,从新任务的性能、数据效率、时间效率以及对已掌握技能的保持等方面,将 HOST 与最强的基线模型进行了对比。HOST 仅需一段人类视频即可完成 62% 的新任务,比未进行参数更新的最强基线模型高出 43%,并且在仅需 50 倍演示次数和 507 倍学习速度的情况下,超越了最强的微调基线模型。此外,HOST 并未牺牲已掌握的技能。HOST 保持了其原有的性能,而最强的微调基线模型则下降至 43%。

实验设置。所有实验均在一个双臂操作平台上进行,该平台由两个ARX R5六轴机械臂组成,每个机械臂均配备一个平行爪夹爪。三个RGB摄像头用于观察工作空间,每个机械臂上各安装一个腕部摄像头,另一个提供静态第三人称视角。每个机械臂在一个包含笛卡尔坐标位置、6D旋转表示和夹爪开口的10维动作空间中运行,从而构成一个20维双臂动作空间。
评估在需要训练数据中不存在的操作技能的新任务上的技能习得情况,并评估在从训练集中选取的先前已掌握任务上的技能保持情况。每个任务进行20次试验,初始物体位置和方向随机化,由人类评估者根据特定任务的完成标准来判断成功与否。
基线。将HOST与来自两种范式的基线进行比较。 (1) 为了确保公平比较,对 OSVI 方法(即 Vid2Robot (30) 和 AWDA (39))进行评估,并将它们条件化机制集成到 HOST 主干网络中。由于 Vid2Robot 不是开源软件,报告重实现的结果。这些方法在测试时接收一段人类演示视频。(2) 模仿学习方法(即 𝜋0.5 (15)、Wall-OSS (40) 和 HOST-base (41))在测试时接收语言指令。HOST-base 与 HOST 共享主干网络,但省略了目标耦合和自接地预测,直接以语言为条件。
HOST 和 OSVI 方法遵循描述的相同的两阶段训练协议。 第一阶段使用由 193,462 条机器人轨迹(涵盖 229 个任务)构成的同体机器人-机器人对进行预训练;第二阶段则使用由另外 5,847 个自行收集的人类视频演示构成的人类-机器人对来调整模型,每个演示都与从该语料库中提取的相同任务的机器人轨迹配对。在模仿学习方法中,𝜋0.5 和 Wall-OSS 的权重均基于各自的大规模语料库进行预训练,然后使用相同的 193,462 条机器人轨迹进行训练;而 HOST-base 则直接使用这些机器人轨迹进行训练。
如图 4 所示HOST 通过观看一段人类演示视频,在 50 个全新的操作任务中习得各种操作技能。这 50 个操作任务涵盖不同的物体、工具和操作基本要素。HOST 在推理阶段通过观看一段人类演示视频来习得每项技能。

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)