26年8月来自蚂蚁集团Robbyant和港科技大学的论文“Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization”。

零样本跨任务泛化,即策略必须执行训练过程中从未见过的操作任务,仍然是机器人学习的核心挑战。在大语言模型中,只需在上下文中指定新任务,即可执行该任务,而无需任何参数更新。这种上下文学习(ICL)形式将泛化问题转化为任务指定问题。为了实现跨任务泛化,将这种范式引入机器人操作领域,并论证操作的自然任务指定方式是人类视频:与语言不同,它提供关于预期任务演化的丰富视觉线索。Zero-WAM,一种因果视频动作模型,它通过遵循上下文中的人类视频指导来执行未见过的任务。为了解决任务丰富的配对人机数据稀缺的问题,提出一种自动流程,将任务采样的机器人轨迹转换为语义匹配的人类视频,从而生成 HumanGen 数据集,该数据集包含 8600 个任务的 74200 个人机 ICL 对。为了进行模型训练进一步引入了上下文未来片段预测(IFP)目标,该目标抑制从已见任务中学习的捷径,并强制策略从视频提示中提取任务信息。在 RoboTwin 2.0 仿真中,Zero-WAM 在七个未见任务上取得 47.0% 的平均成功率,比最强的视频动作基线模型提高 29.5 个百分点。在真实场景评估中,它能够根据人类视频的指导,泛化到涉及多物体场景、长距离操作和细粒度插入等未见任务配置。


如图1所示Zero-WAM概述。Zero-WAM能够根据上下文相关的人类视频提示或语言指令预测机器人未来的视频和可执行动作。人类视频指令基于任务采样的机器人轨迹大规模生成,并结合任务平衡的机器人视频-动作预训练语料库。在未见过的模拟任务和复杂的真实世界任务上验证Zero-WAM的有效性。
请添加图片描述

零样本机器人任务泛化需要一个能够迁移到未见过的任务的指令接口,以及涵盖多样化任务动态的训练数据,而不仅仅是增加机器人轨迹的数量。作为工程基础,首先通过在任务级别对公开的机器人预训练数据进行重采样,整理出任务多样化的视觉辅助(VA)数据。基于相同的任务级别采样,引入上下文相关的人类视频生成流程,将任务采样的机器人视频转换为人类视频指令。生成的人类-机器人指令组合构成HumanGen,其中包括预训练指令组合(外部)、预训练指令组合(内部)、仿真指令组合和真实世界指令组合。图2总结这种数据构成以及用于生成HumanGen数据的流程。

请添加图片描述


1. 任务多样化的视频动作数据

任务多样化的VA数据来自公开的机器人视频动作(VA)预训练数据集,包括AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和 RoboMIND [26]。这些源数据集与LingBot-VA [11] 使用的公开VA预训练数据集相同。尽管这些数据集包含大量的机器人轨迹和广泛的任务覆盖范围,但许多轨迹来自对同一任务的重复远程操作。直接使用原始分布会导致预训练过度受到冗余轨迹的影响,从而阻碍模型充分利用源数据集中已有的任务多样性。通过将每个数据集重新划分为任务来解决这个问题,其中每个任务由操作动作和目标对象的组合定义。任务标签在可用时从原始数据集元数据中获取,或在元数据不足时从机器人轨迹中解析。然后,从每个任务中抽取有限数量的轨迹,抽样范围根据每个源数据集的任务内多样性进行调整。在五个源数据集中,在每个训练周期中抽取超过 6000 个任务和约 40 万条相应的机器人轨迹。这种均衡的视频-动作语料库能够有效地将通用领域的视频生成模型适配到自回归机器人视频-动作模型。

2 上下文中的人机视频生成流程

人机视频演示通过视觉状态变化直接传达任务语义,比机器人演示更容易获取,并且不依赖于测试时使用的机器人实例。因此,扩展任务丰富的人机上下文学习对是实现跨任务泛化的有效途径。

手动收集此类配对的人机动作数据非常困难,尤其是在需要高任务多样性时,成本更是高得令人难以承受。因此,从机器人预训练语料库出发,再次按照所述方法,在任务层面采样轨迹。这提供一系列带有可执行动作标注的机器人视频。然后,引入一个上下文相关的人类视频生成流程,将这些机器人轨迹转换为具有相同任务语义的人类操作视频。为了增加人机 ICL 对中视觉对齐的多样性,生成的人类视频在保持相同任务语义的前提下,包含了背景、视角、环境风格、物体实例和物体位置等方面的变化。

图 2 所示的下半部分展示用于生成人类视频指令的上下文相关人类视频生成流程。对于每个采样的机器人视频,首先使用 VLM(Gemini 3.1 Pro [27] 或 Qwen 3.6-Plus [28])进行任务分析。VLM 提取任务层面的信息,包括任务名称、初始物体状态、物体状态变化和最终物体状态。它还会生成一个图像编辑提示,将机器人视频的第一帧转换为人类操作场景的初始观察图像。通过该图像编辑提示注入上述视觉对齐变化,同时保持任务语义。给定机器人的第一帧和图像编辑提示,图像编辑模型(Nano Banana 2 [29] 或 Qwen-Image-2.0 [30])会生成相应任务的初始人类观察图像。然后,用 VLM 处理该编辑后的人类观察图像以及提取的物体状态信息,生成一个视频生成提示,描述人手应如何操作物体以完成任务。该提示被发送到视频生成模型(Wan 2.7 [31] 或 Kling AI 3.0 [32])以合成人类操作视频。最后,VLM 评估每个生成的视频的任务语义保持性和物理合理性,并将合格的人类视频与其原始机器人轨迹配对,作为 ICL 样本。

3. 上下文人机交互数据集

HumanGen 是一个包含一系列人机交互指令对的集合,这些指令对是通过上下文人机视频生成流程生成的。每个指令对包含一个生成的人类视频指令及其对应的机器人轨迹,该轨迹包含可执行的动作。HumanGen 按数据来源分为预训练 ICL(外部)、预训练 ICL(内部)、仿真 ICL 和真实世界 ICL。遵循与任务多样化 VA 数据集相同的任务多样化采样原则,源机器人视频按任务而非原始轨迹频率进行采样,从而避免 ICL 数据被少数任务的重复执行所主导。

预训练 ICL(外部)。该子集由与任务多样化 VA 数据集相同的五个公开机器人视频动作数据集构建而成:AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和 RoboMIND [26]。这些数据集涵盖多种机器人形态、场景和物体,包括超过45种机器人形态。从每个数据集中按任务采样机器人轨迹,并使用上下文相关的人类视频生成流程将其转换为语义匹配的人类视频。具体而言,从AgiBot数据集中采样3354个任务和6660条轨迹,从InternData-A1数据集中采样261个任务和12515条轨迹,从Open-X-Embodiment数据集中采样438个任务和9290条轨迹,从RoboCOIN数据集中采样512个任务和6513条轨迹,以及从RoboMIND数据集中采样了497个任务和6210条轨迹。总而言之,预训练ICL(外部)包含5062个任务和41188个人机ICL对。对于此子集,有意地使人机视频之间的视觉对齐方式多样化:强制改变场景环境、桌面背景、物体实例和物体位置,并平衡第一人称和第三人称视角。由于任务语义在这些视觉变化中得以保留,模型能够学习到不受场景、物体和视角变化影响的人机任务对应关系,从而提高其对视觉多样化 ICL 提示的鲁棒性。

预训练 ICL(内部)。为了进一步扩大任务覆盖范围,从内部机器人数据集中按任务对机器人轨迹进行采样。该子集涵盖多种机器人形态,例如双手 Franka 和 Galaxea R1 Pro,包含 3,522 个任务和 30,247 对人机 ICL。在使用上下文相关的人类视频生成流程为该子集生成相应的人类视频时,降低第三人称视角的比例,并减少场景、物体和物体位置变化的频率。这在保持任务多样性的同时,生成更多视觉上对齐的ICL样本。

仿真ICL。为了支持仿真中的跨任务评估,为50个RoboTwin任务[22]生成ICL数据。该子集包含2500个ICL样本,每个任务50个样本。其中,43个任务用于训练后评估(2150个训练样本),其余7个任务作为未见过的任务,用于零样本跨任务评估。

真实世界ICL。真实世界ICL包含在双手Franka评估模型上收集的人机交互对。它包含252个人机ICL对,涵盖评估中使用的三个真实世界任务系列:120对来自30个物体到容器放置训练任务组合,96对来自16个三物体顺序操作训练任务组合,以及36对用于双桌腿插入任务。该子集用于后训练,以便模型能够拟合用于跨任务评估的评估机器人的运动学数据。

与现有数据集的比较。表 1 将 HumanGen 与现有的任务级人机配对数据集进行了比较。统计数据来自其官方论文。与以往依赖人工收集人类数据的数据集不同,HumanGen 使用上下文相关的人类视频生成流程,从机器人轨迹自动生成语义匹配的人类视频,从而能够可扩展地构建人机 ICL 对。HumanGen 还整合了多个数据源(公共数据、内部数据、仿真数据和真实世界数据),涵盖了更多机器人实例,包含来自第一人称和第三人称视角的人类数据,以及具有不同视觉对齐程度的配对数据。最重要的是,HumanGen 包含更广泛的任务覆盖范围,这是实现零样本跨任务泛化的关键因素。
请添加图片描述


在零样本跨任务操作中,机器人必须在不进行微调的情况下执行一项全新的任务。利用世界-动作模型(WAM)来实现这一能力,该模型基于大规模人机交互(ICL)对和任务平衡的机器人视频动作数据进行预训练:在部署时,Zero-WAM 使用语言指令或人类视频演示作为任务规范来驱动未见过任务的执行。

继 LingBot-VA 之后,通过将双向文本/图像到视频生成模型 Wan-2.2-TI2V-5B [36] 转换为上述因果视频动作策略,实现 Zero-WAM。基于此框架,Zero-WAM 特有的组件包括:将人类视频作为上下文任务规范,以及上下文未来片段预测。

1 以人类视频作为任务规范

对于一个未见过的任务,用语言完整地描述期望的行为通常很困难,而且指令必须进一步融入策略从未观察到的任务动态中。因此,采用人类视频作为上下文任务规范,直接呈现期望的动态:在部署时,一段演示未见过任务的人类视频作为指令。为了教会策略遵循此界面,用 HumanGen 数据集进行训练。该数据集通过在任务级别对源机器人轨迹进行采样构建而成。每个语义匹配的配对包含一个生成的人类视频 h(作为视觉任务规范)及其对应的机器人轨迹(提供监督式的未来视频和动作片段)。由于人类视频和配对的机器人轨迹在具身性、视角、背景和物体位置上可能存在差异,模型必须学习任务级别的对应关系,而不是简单地复制人类视频中的动作。

在训练过程中,对人类视频片段、机器人视频片段和动作片段的token化表示应用教师强制注意力掩码。人类视频 h 被添加到机器人轨迹之前,作为机器人视频预测的前缀记忆。

对于下一个机器人动作片段的预测,动作Transformer根据机器人领域历史和预测的下一个机器人视频片段,按照逆动力学分解来预测ai+1。它并不直接关注人类视频h:h所传达的任务语义已被吸收到预测的下一个机器人视频片段中,因此动作解码简化为标准的逆动力学。因此,动作预测条件与标准的机器人视频动作训练条件保持一致。

在训练过程中,动作上下文中的 xi+1 是在教师强制下下一个机器人视频片段的真实值;在推理过程中,它被视频 Transformer 生成的视频片段所替换。

RoPE [37] 偏移用于 ICL 人类视频。ICL 人类视频和多视角机器人视频由同一个 VAE 编码器编码,因此共享同一个视觉潜空间。在token序列中,通过高度轴 RoPE 坐标来区分 ICL 人类视频和机器人视频:机器人视频的潜值保持其原始坐标,而人类视频的潜值则沿高度轴偏移一定值。令 (q,y,x) 表示视觉潜值的时间、垂直和水平坐标,令 H_mv 表示多视角机器人视频潜布局的高度。RoPE的偏移将人类视频的潜值置于机器人视频潜值的坐标范围之外,从而防止 ICL 人类视频和机器人视频在同一序列中交互时出现表示混淆。

2 上下文未来片段预测

对于上下文样本,模型应从人类视频 h 中推断任务演化过程,并将其迁移到机器人领域。然而,在对已见任务进行教师强制训练时,通常可以通过外推最近的机器人历史 (x≤i) 来预测下一个机器人视频片段。这形成一个捷径,使得模型无需学习使用上下文人类视频即可降低训练损失。当模型在未见任务上进行评估时,这种捷径会导致模型继续依赖机器人历史,并在需要 ICL 信号来指定新任务时,未能充分利用该信号。为了克服这种捷径,借鉴 Next Forcing [14] 的多片段预测方法,引入上下文未来片段预测 (IFP):一个仅用于训练的辅助目标,要求模型根据当前的机器人视频表示预测多个步长的未来机器人视频片段。IFP 基于主分支生成的当前机器人视频表示进行操作。

IFP 损失将上述定义的流匹配目标应用于每个步长目标,其中 w_k 表示第 k 个未来视频​​块目标的损失权重。

重要的是,IFP模块并非直接以人类视频提示h为条件。它们获取任务信息的唯一途径是通过φi+1,该函数是在主机器人视频Transformer与上下文中的人类视频交互后提取的。如果IFP模块直接以h为条件,辅助分支就可以学习一个独立的、以人类视频为条件的未来预测器,而无需强制主机器人视频Transformer对上下文中的任务信息进行编码;由于IFP模块在推理阶段被移除,因此部署的策略将无法从辅助监督中获益。因此,我们仅以φi+1为条件来约束IFP,从而使未来损失能够监督主分支生成的当前机器人视频表示。多个未来片段以时间步长并行预测,这增加了预测难度,同时在训练过程中不会引入未来片段预测之间的时间依赖性。

3 训练与推理

训练数据混合。用任务多样化的 VA 数据集和 HumanGen 数据集的混合数据来训练 Zero-WAM 模型:任务多样化的 VA 数据集提供多样化的机器人领域视频动作动态,而 HumanGen 数据集提供基于可执行机器人动作的人类视频任务规范。这两个数据集的抽取采用采样权重,而非与原始数据集大小成比例。

对于动作片段预测,在动作空间中使用类似的流匹配目标函数。对于 HumanGen 样本,视频预测以 c = {h, l} 为条件,并结合上下文未来片段预测 (IFP) 进行增强。动作损失仍然以 l 为条件,因为动作 Transformer 并不直接关注人类视频。

推理。在测试阶段,IFP模块被移除,Zero-WAM支持两种任务规范模式。在仅语言模式下,模型基于文本指令进行判断,即c = l。在ICL模式下,人类视频被编码一次,其token被缓存为前缀内存,因此模型基于c = {h, l}进行判断,其中语言指令l是可选的。在两种模式下,模型首先生成下一个机器人视频块,然后解码对齐的动作块。


1 实现

实现细节。参照 LingBot-VA [11],从 Wan-2.2-TI2V-5B [36] 中实例化 Zero-WAM,并将图像到视频的生成骨干网络转换为因果视频-动作模型。视频 Transformer 遵循 Wan-2.2 骨干网络,隐藏维度为 d_v = 3072,包含 30 个 Transformer 层。动作 Transformer 使用隐藏维度 d_a = 3072,参数从视频分支初始化,并通过 MoT 架构与视频 Transformer 连接。两个视频流均使用 RoPE 位置编码,ICL 人类视频的高度轴 RoPE 偏移量设置为 ∆H = 32。用 Wan-2.2 VAE 将机器人视频和人类视频编码为潜表示。语言指令使用 T5 [38] 进行编码。 IFP 模块预测 K = 4 个未来机器人视频片段,时间步长 s = 2。相应的未来预测损失权重为 (w_1, …, w_4) = (0.5, 0.25, 0.15, 0.15)。

训练细节。用定义的流匹配视频损失、动作损失和 IFP 损失来训练 Zero-WAM 模型。用 AdamW 优化器 [39],峰值学习率为 1 × 10⁻⁴,权重衰减为 0.01。在预训练期间,以 1:5 的采样比例抽取任务多样化的 VA 数据和 HumanGen 数据。对于非 ICL 样本,以 0.1 的概率丢弃语言指令。对于 ICL 样本,以 0.1 的概率丢弃 ICL 人类视频潜信息,并将语言指令的 dropout 值从 Wan-2.2 的默认值 0.1 提高到 0.4,从而降低模型从人类视频指令中学习时对语言的依赖性。在预训练期间,机器人视频块大小从 1 到 4 随机采样。预训练耗时 15,360 个 GPU 小时。与 LingBot-VA 类似,每个 GPU 将不同 token 长度的样本打包成一个序列,并使用注意力掩码来隔离不同的样本,这在将每个 GPU 的最大 token 长度控制在 160K 以内的同时,提高了训练吞吐量。

推理细节。预训练的 Zero-WAM 支持两种推理模式。在仅语言模式下,模型仅基于语言指令进行学习,不依赖 ICL 人类视频,视频 CFG 的尺度设置为 5。在 ICL 模式下,模型基于 ICL 人类视频进行学习,并禁用语言指令。用尺度为 5 的 ICL 无分类器引导 [40]。对于这两种模式,推理块大小固定为 2,动作 CFG 缩放比例设置为 1.0。

2 仿真实验

设置。在 RoboTwin 2.0 仿真 [22] 的干净设置下评估零样本跨任务泛化能力。RoboTwin 2.0 包含 50 个双手操作任务,每个任务有 50 条机器人轨迹。对于每条轨迹,使用提出的上下文人类视频生成流程生成相应的人类视频指令,从而构成 HumanGen 数据集的仿真 ICL 子集。为了评估跨任务泛化能力,将 RoboTwin 2.0 按任务级别划分:43 个任务用于训练后训练,7 个任务作为未见任务保留用于评估,因此这些评估任务在训练期间不会作为机器人演示出现。未见任务包括:将物体放在秤上、盖章、打开微波炉、将订书机移动到垫子上、将面包放入篮子、放置空杯子和堆叠三个积木。如图 3 所示,这些任务涵盖了对未知物体和目标容器的抓取和放置任务、对未知关节物体的操作以及对未知长距离物体的操作。
请添加图片描述

训练。在 RoboTwin 2.0 上,用基于 Task-diverse VA 数据和 HumanGen 上下文数据预训练的检查点初始化 Zero-WAM 模型。用 64 个 GPU 进行 4000 个训练后步骤的训练。在训练后阶段,以 2∶10∶3 的比例联合采样 Task-diverse VA、HumanGen 和 RoboTwin 数据。与预训练一样,每个 GPU 打包多个样本,最多可达 16 万个 token。

基线。在相同的跨任务协议下,将训练结果与两个视频动作基线进行比较。由于 Zero-WAM 是从 Wan-2.2 初始化的,构建一个直接基于 Wan 的基线模型,该模型从 Wan-2.2-TI2V-5B 初始化,采用相同的 MoT 因果视频动作框架,并且仅在已观测的 43 个 RoboTwin 任务上进行训练。将此基线模型称为 WAN-Action。还将其与领先的视频动作模型 LingBot-VA 进行比较,使用其已发布的预训练检查点,并在相同的已观测任务上进行后训练。两个基线模型在后训练期间均仅使用已观测任务的机器人视频动作轨迹,遵循标准的跨任务设置 [41]。

评估。所有实验均在三个随机种子上进行评估。对于每个种子,在仿真中对每个未观测的任务运行 100 次闭环展开,并计算任务成功率。最终结果报告三个种子上的平均值和标准差。对于人机视频条件化的变体,任务由生成的人类视频指令指定;对于仅语言的变体,任务仅由文本指定。

3 真实世界实验

在一台真实的双臂 Franka 机器人上验证 Zero-WAM 的有效性。评估三类任务:物体到容器的放置、三个物体的顺序操作以及双桌腿插入。对于每类任务,收集一小部分已见过的机器人任务演示,以使策略适应真实机器人的运动学特性,同时保留待评估的任务配置。在测试阶段,Zero-WAM 仅基于人类视频指令进行训练,不包含任何语言指令,并在真实机器人上执行未见过的任务配置;而 LingBot-VA 基线则配备了详细的文本任务描述。

物体到容器的放置。机器人必须抓取一个物体,并使用单臂操作或双臂协调将其放入目标容器中。从 30 种物体-容器组合的训练中收集了 120 个已见过的任务演示,以使策略适应 Franka 机器人。保留一部分物体和容器用于评估,因此每个测试配置都包含至少一个在机器人训练演示中未出现的物体或容器。Zero-WAM 的成功率达到 53.3%,而语言条件化的 LingBot-VA 的成功率为 43.3%。

三物体顺序操作。此任务评估策略是否能够遵循指定长时域操作顺序的人类视频。场景包含多个物体和容器,每个测试片段会根据人类视频指令随机选择三个物体。从 16 种训练任务组合中收集 96 个演示,并收集相应的人类视频指令。在测试时,人类视频会以任意顺序操作三个物体,包括未出现的物体和容器;Zero-WAM 的成功率达到 33.3%,显著优于 LingBot-VA 的 10.0% 成功率。

双桌腿插入任务。此任务测试精细的人机视频任务指令。任务要求将两条桌腿插入桌面底座上的指定孔中,视频中会明确指出哪条桌腿的颜色应该插入哪个目标孔。仅收集36个针对此精确插入设置的演示视频。测试时,视频中会明确指出两条桌腿的目标孔,机器人必须按照视频中的指示完成插入。尽管精确物理插入的难度限制了绝对成功率,但Zero-WAM在未见过的插入配置上均能成功,而LingBot-VA则完全失败。机器人能够成功地将任务指令定性地迁移到具有未见过颜色和类型的桌腿和桌面底座上,这进一步表明,与仅依靠语言相比,机器人能够更可靠地遵循人机视频指令中精细的任务指令。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐