《WAM 系列》Zero-WAM | 人类视频上下文学习 | 未来片段预测 | 零样本跨任务泛化
机器人面对一个训练中从未出现的任务时,真正缺少的往往不是一句更长的语言指令,而是一份能展示目标对象、操作过程和执行顺序的任务说明。Zero-WAM 把人类示范视频当作部署时的上下文提示:模型不更新参数,也不要求为新任务采集机器人演示,而是先根据人类视频生成下一段机器人视频,再把预测的视觉变化解码为可执行动作。
- 任务接口:同一个因果视频-动作模型支持语言指令和人类视频指令;人类视频可直接说明对象实例、交互方式与长时序顺序。
- 数据规模:HumanGen 包含 7.42 万个人类-机器人上下文学习对,覆盖 8600 个任务和 45 种以上机器人本体;配套 Task-diverse VA 每个训练 epoch 采样约 40 万条机器人轨迹。
- 核心模型:以 Wan-2.2-TI2V-5B 为基础,视频 Transformer 预测未来机器人视频,动作 Transformer 将未来视频与历史解码为时间对齐的连续动作。
- 关键训练目标:IFP 并行预测 4 个跨步未来视频 chunk,迫使主视频分支从人类视频中吸收任务演化信息;该辅助模块在推理时移除。
- 主要结果:RoboTwin 2.0 的 7 个未见任务平均成功率为 46.95%,比 LingBot-VA 高 29.50 个百分点;真机三类未见配置分别达到 53.3%、33.3% 和 16.7%。
论文:Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
项目主页:Zero-WAM Project
官方仓库:robbyant-research/Zero-WAM
开源状态:官方仓库当前仅包含 README、许可证与网页素材;代码、模型和数据计划在 2026-09-15 前发布。

图 1 的读图重点是中间的闭环:语言或人类视频先给出任务条件,视频模型根据当前观测预测下一段机器人视频,动作模型再预测与该视频对应的动作。执行后的新观测进入下一轮自回归预测。左侧两类训练数据解决任务覆盖和人类-机器人配对问题,右侧则展示多物体、长时序、精细插入和仿真任务。
1、Zero-WAM 要解决什么问题
1.1、零样本跨任务泛化不是换一个物体
论文中的 zero-shot cross-task generalization 有严格含义:测试任务在机器人训练数据中没有出现,部署时也不为它收集新机器人演示或更新模型参数。它比同一任务内更换背景、视角或物体实例更进一步,因为模型需要推断一种未练习过的状态变化和动作过程。
语言在这种设置下有两个短板:
- 对象实例难以指明,例如多个外观相近包装中哪一个才是目标。
- 空间约束、交互细节和长时序顺序难以完整表达,例如三个物体必须按人类示范中的特定次序分别放入不同容器。
人类视频提供的是视觉化任务规范,而不是机器人动作标签。视频展示想要发生什么,但人手和机器人在本体、视角、背景、对象位置上可能完全不同。因此模型不能照抄人的运动轨迹,而必须学习跨本体的任务语义对应,再用机器人自身动力学执行。
1.2、为什么称为 In-Context World-Action Modeling
| 概念 | Zero-WAM 中的含义 | 推理时是否存在 |
|---|---|---|
| In-context task specification | 人类视频作为新任务的部署时上下文 | 是,编码一次并缓存 |
| World modeling | 自回归预测下一段机器人视频 | 是,显式生成未来视觉 chunk |
| Action modeling | 从机器人历史与未来视频解码动作 chunk | 是 |
| IFP | 从当前主干表示预测多个跨步未来 chunk | 否,只是训练辅助目标 |
Zero-WAM 确实属于 World-Action Model:未来机器人视频不仅用于辅助监督,而且在测试时生成并进入动作解码条件。IFP 则不同,它只负责训练主干学会利用人类视频,部署时不会额外预测那 4 个远期目标。
2、数据是方法的一半:Task-diverse VA 与 HumanGen

这项工作的第一个关键判断是:机器人轨迹数量多,不等于任务覆盖广。公开数据集通常包含同一个任务的大量重复遥操作轨迹,如果按原始频率训练,少数高频任务会压过长尾任务。
2.1、Task-diverse VA:按任务采样
作者从 AgiBot、InternData-A1、Open-X-Embodiment、RoboCOIN 和 RoboMIND 五个公开视频-动作数据源出发,以操作类型和对象的组合定义任务,再按任务而不是按轨迹频率采样。最终覆盖 6000 多个机器人任务,每个 epoch 约 40 万条轨迹。
这个重采样不引入人类视频,作用是让基础 WAM 更均衡地看到机器人世界中的任务和动作动态。消融显示,即使遮掉 ICL 人类视频,仅采用任务均衡预训练,7 个未见任务平均成功率也达到 39.44%,比 LingBot-VA 的 17.45% 高 21.99 个百分点。
2.2、HumanGen:自动构建人类-机器人配对
HumanGen 的每个样本由两部分组成:一段人类视频负责说明任务,一条语义对应的机器人轨迹保留未来视频和可执行动作。生成流水线按以下步骤工作:
- 从任务均衡后的机器人数据中抽取一条轨迹。
- VLM 解析任务名称、初始对象状态、状态变化和最终状态,同时生成首帧编辑提示。
- 图像编辑模型把机器人首帧改造成第一或第三人称人类操作场景,并有意识地改变背景、视角、对象实例或位置。
- VLM 根据编辑后的首帧和对象状态生成视频提示,视频生成模型合成人手执行同一任务的过程。
- VLM 对任务语义保持和物理合理性分别打分,合格视频与原机器人轨迹组成 ICL pair。
流水线使用的模型包括 Gemini 3.1 Pro、Qwen3.6-Plus、Nano Banana 2、Qwen-Image-2.0、Wan 2.7 和 Kling AI 3.0。关键点不是让人类视频与机器人视频逐像素对齐,而是保留任务语义,同时主动制造视觉差异,迫使模型学习任务层对应。
2.3、HumanGen 的组成与规模

| 子集 | 任务数 | ICL pair 数 | 用途 |
|---|---|---|---|
| Pre-train ICL (External) | 5062 | 41188 | 覆盖五个公开数据源与 45 种以上机器人本体 |
| Pre-train ICL (In-house) | 3522 | 30247 | 补充双臂 Franka、Galaxea R1 Pro 等本体与任务 |
| Simulation ICL | 50 | 2500 | RoboTwin 任务后训练与跨任务评测 |
| Real-world ICL | 3 类任务 | 252 | 适配双臂 Franka 的运动学与控制接口 |
External 子集刻意增加背景、视角、场景、对象实例和对象位置差异;In-house 子集视觉对齐更强。两类数据结合,让模型既能学习跨域任务对应,又有相对容易的人类-机器人配对作为学习锚点。
表 1 的比较需要谨慎理解。HumanGen 的人类视频由生成模型自动产生,而 MIME、BC-Z、RH20T 等数据主要依赖人工采集;因此 7.42 万不是 7.42 万条真实人类录像。但自动生成让任务数扩展到 8600,远高于表中其他数据集,正好服务于论文关注的跨任务泛化。
3、模型架构:先预测机器人世界,再解码动作
3.1、因果视频-动作分解
机器人轨迹被切成 N N N 个时间对齐的 chunk:
τ = { ( x i , a i ) } i = 1 N \tau=\{(x^i,a^i)\}_{i=1}^{N} τ={(xi,ai)}i=1N
其中 x i x^i xi 是第 i i i 段机器人视频, a i a^i ai 是同一时间段的动作。给定任务条件 c c c 与历史,模型联合预测下一段视频和动作:
p θ ( x i + 1 , a i + 1 ∣ x ≤ i , a ≤ i , c ) p_\theta(x^{i+1},a^{i+1}\mid x^{\le i},a^{\le i},c) pθ(xi+1,ai+1∣x≤i,a≤i,c)
Zero-WAM 把联合分布拆成两步:
p θ v i d ( x i + 1 ∣ x ≤ i , a ≤ i , c ) ⋅ p θ a c t ( a i + 1 ∣ x ≤ i , a ≤ i , x i + 1 , c ) p_\theta^{\mathrm{vid}}(x^{i+1}\mid x^{\le i},a^{\le i},c) \cdot p_\theta^{\mathrm{act}}(a^{i+1}\mid x^{\le i},a^{\le i},x^{i+1},c) pθvid(xi+1∣x≤i,a≤i,c)⋅pθact(ai+1∣x≤i,a≤i,xi+1,c)
| 符号 | 含义 | 在模型中的作用 |
|---|---|---|
| i i i | 当前 chunk 索引 | 表示机器人真实执行进度 |
| x ≤ i x^{\le i} x≤i | 当前及此前机器人视频 chunk | 提供可观测历史 |
| a ≤ i a^{\le i} a≤i | 已执行动作 chunk | 提供动作历史 |
| c c c | 任务条件 | 语言模式为 ℓ \ell ℓ;ICL 模式为人类视频 h h h 与可选语言 |
| p θ v i d p_\theta^{\mathrm{vid}} pθvid | 视频生成分支 | 预测下一段机器人视觉状态 |
| p θ a c t p_\theta^{\mathrm{act}} pθact | 动作分支 | 作为逆动力学模型,从未来视觉解码动作 |
因子分解决定了未来视频的地位:它不是用于展示的旁路输出,而是动作分支的显式条件。训练时动作分支看到真实下一段机器人视频,也就是 teacher forcing;推理时该位置替换为视频 Transformer 生成的 x i + 1 x^{i+1} xi+1。因此世界模型预测误差会直接传递到动作解码。
3.2、Mixture-of-Transformers
Zero-WAM 从双向文生/图生视频模型 Wan-2.2-TI2V-5B 初始化,并转换成因果视频-动作策略。视频 Transformer 和动作 Transformer 采用 Mixture-of-Transformers 设计:
- 视频与动作各自拥有 QKV 投影、FFN 和输出头。
- 两种 token 保留在同一序列中,通过共享 attention 层交互。
- 动作表示排在未来视频表示之后,因此动作 token 可以读取已预测的未来视频。
- 视频分支沿用 30 层、隐藏维度 3072;动作分支隐藏维度同为 3072,并从视频分支参数初始化。
- 人类视频和机器人视频共用 Wan-2.2 VAE,语言由 T5 编码。
这种设计既保留视频生成和动作控制的模态专用参数,又让两者在一个因果序列里通信。它与两个完全隔离的模型串联不同,动作分支能够直接通过共享注意力读取视频表示。
4、人类视频如何成为 prefix memory
4.1、训练时的注意力路径
对于 HumanGen 样本,生成的人类视频 h h h 放在机器人轨迹之前。视频分支预测下一段机器人视频时使用:
C v i d , i = [ [ h , x ≤ i ] , a ≤ i , ℓ ] C^{\mathrm{vid},i}=[[h,x^{\le i}],a^{\le i},\ell] Cvid,i=[[h,x≤i],a≤i,ℓ]
p θ v i d ( x i + 1 ∣ C v i d , i ) p_\theta^{\mathrm{vid}}(x^{i+1}\mid C^{\mathrm{vid},i}) pθvid(xi+1∣Cvid,i)
h h h 是同任务人类视频, ℓ \ell ℓ 是语言指令,双层方括号表示人类视频与机器人视频在视觉上下文中组成前缀。视频 Transformer 直接读取 h h h,把人类展示的状态变化迁移成机器人域的下一段视觉状态。
动作分支的条件则是:
C a c t , i = [ x ≤ i , a ≤ i , x i + 1 , ℓ ] C^{\mathrm{act},i}=[x^{\le i},a^{\le i},x^{i+1},\ell] Cact,i=[x≤i,a≤i,xi+1,ℓ]
动作 Transformer 不直接注意人类视频。人类视频中的任务语义先被视频分支吸收到 x i + 1 x^{i+1} xi+1,动作分支再做标准逆动力学。这一隔离减少了让动作网络直接解释人类本体运动的负担。
4.2、用 RoPE offset 区分两个视觉域
人类视频和多视角机器人视频共用同一 VAE 潜空间,如果位置坐标完全相同,模型可能混淆两类视觉 token。论文沿高度轴平移人类视频的 RoPE 坐标:
p o s r o b o t ( q , y , x ) = ( q , y , x ) \mathrm{pos}_{\mathrm{robot}}(q,y,x)=(q,y,x) posrobot(q,y,x)=(q,y,x)
p o s h u m a n ( q , y , x ) = ( q , y + Δ H , x ) , Δ H > H m v \mathrm{pos}_{\mathrm{human}}(q,y,x)=(q,y+\Delta_H,x),\qquad \Delta_H>H_{\mathrm{mv}} poshuman(q,y,x)=(q,y+ΔH,x),ΔH>Hmv
| 符号 | 含义 | 作用 |
|---|---|---|
| q q q | 视频潜变量的时间坐标 | 保留 chunk 内时间顺序 |
| y , x y,x y,x | 垂直和水平坐标 | 表示视频潜特征的空间位置 |
| H m v H_{\mathrm{mv}} Hmv | 多视角机器人潜布局的总高度 | 界定机器人视频坐标范围 |
| Δ H \Delta_H ΔH | 人类视频高度轴偏移,实验设为 32 | 把人类视频放到机器人坐标范围之外 |
这个偏移没有改变人类视频内容,只是在共享序列中添加来源标识。它比增加一种完全不同的 VAE 更轻量,同时保留两类视频在同一视觉潜空间里的可比较性。
5、IFP:让模型真的去看人类视频
Teacher forcing 容易形成捷径:对训练中熟悉的任务,模型只根据最近几段机器人历史和文本,就可能预测下一小段视频,从而在损失下降的同时忽略人类视频。到了未见任务,局部历史不能说明完整目标,模型才暴露出没有学会使用上下文提示。
5.1、跨步未来目标
IFP 不只预测紧邻的下一段,而是从当前主干表示并行预测更远的未来 chunk。第 k k k 个目标索引为:
j k = ( i + 1 ) + 1 + ( k − 1 ) s , k = 1 , … , K j_k=(i+1)+1+(k-1)s,\qquad k=1,\ldots,K jk=(i+1)+1+(k−1)s,k=1,…,K
i + 1 i+1 i+1 是主分支正在预测的下一段,额外的 1 1 1 跳过相邻 chunk, s s s 是时间 stride, K K K 是目标数量。实验使用 K = 4 K=4 K=4、 s = 2 s=2 s=2,因此辅助头关注多个间隔更远的机器人状态,而不是继续做局部外推。
主视频 Transformer 从 M M M 个中间层收集当前目标 x t i + 1 x_t^{i+1} xti+1 的隐藏表示,拼接并压回单层维度:
ϕ i + 1 = P f u s e ( C o n c a t ( { r m i + 1 } m = 1 M ) ) \phi^{i+1}=P_{\mathrm{fuse}}(\mathrm{Concat}(\{r_m^{i+1}\}_{m=1}^{M})) ϕi+1=Pfuse(Concat({rmi+1}m=1M))
r m i + 1 r_m^{i+1} rmi+1 是第 m m m 个中间层对当前加噪视频 chunk 的表示, P f u s e P_{\mathrm{fuse}} Pfuse 是轻量 MLP, ϕ i + 1 \phi^{i+1} ϕi+1 是 IFP 唯一能够获得人类视频任务信息的入口。
5.2、为什么 IFP 不直接读取人类视频
第 k k k 个 IFP 模块根据 ϕ i + 1 \phi^{i+1} ϕi+1、机器人历史和语言预测 x j k x^{j_k} xjk:
p θ , k i f p ( x j k ∣ ϕ i + 1 , x ≤ i , a ≤ i , ℓ ) p_{\theta,k}^{\mathrm{ifp}}(x^{j_k}\mid\phi^{i+1},x^{\le i},a^{\le i},\ell) pθ,kifp(xjk∣ϕi+1,x≤i,a≤i,ℓ)
L i f p = ∑ k = 1 K w k L f m ( x j k ; ϕ i + 1 , x ≤ i , a ≤ i , ℓ ) \mathcal{L}_{\mathrm{ifp}}=\sum_{k=1}^{K}w_k\mathcal{L}_{\mathrm{fm}}(x^{j_k};\phi^{i+1},x^{\le i},a^{\le i},\ell) Lifp=k=1∑KwkLfm(xjk;ϕi+1,x≤i,a≤i,ℓ)
若辅助头可以直接注意 h h h,它自己学会人类视频条件预测即可,主视频分支仍可能忽略人类视频;而辅助头推理时会被删除,训练收益也就无法进入部署策略。Zero-WAM 刻意切断这条捷径,让 IFP 只能通过主分支产生的 ϕ i + 1 \phi^{i+1} ϕi+1 获得人类视频信息,于是远期预测损失反过来监督主分支编码任务演化。
权重为 ( w 1 , w 2 , w 3 , w 4 ) = ( 0.5 , 0.25 , 0.15 , 0.15 ) (w_1,w_2,w_3,w_4)=(0.5,0.25,0.15,0.15) (w1,w2,w3,w4)=(0.5,0.25,0.15,0.15)。四个 IFP 模块并行工作,每个结构等同于视频分支的一层 Transformer,并从最后一层视频 Transformer 初始化。
6、训练目标与推理流程
6.1、视频与动作都使用 flow matching
给定干净视频 x 0 x_0 x0、高斯噪声 ϵ \epsilon ϵ 和流时间 t ∈ [ 0 , 1 ] t\in[0,1] t∈[0,1]:
x t = ( 1 − t ) x 0 + t ϵ , v t ∗ = ϵ − x 0 x_t=(1-t)x_0+t\epsilon,\qquad v_t^*=\epsilon-x_0 xt=(1−t)x0+tϵ,vt∗=ϵ−x0
L f m = E x 0 , ϵ , t [ ∥ v θ ( x t , t , c ) − v t ∗ ∥ 2 2 ] \mathcal{L}_{\mathrm{fm}}=\mathbb{E}_{x_0,\epsilon,t}\left[\left\|v_\theta(x_t,t,c)-v_t^*\right\|_2^2\right] Lfm=Ex0,ϵ,t[∥vθ(xt,t,c)−vt∗∥22]
t t t 是生成模型内部的流时间,不是机器人执行时间; x t x_t xt 是噪声与真实视频的线性插值; v t ∗ v_t^* vt∗ 是目标速度场。推理从噪声开始,沿模型预测速度场积分回 t = 0 t=0 t=0,得到视频 chunk。
动作分支在动作空间使用同类目标:
a r i + 1 = ( 1 − r ) a i + 1 + r ϵ a i + 1 , u r ∗ , i + 1 = ϵ a i + 1 − a i + 1 a_r^{i+1}=(1-r)a^{i+1}+r\epsilon_a^{i+1},\qquad u_r^{*,i+1}=\epsilon_a^{i+1}-a^{i+1} ari+1=(1−r)ai+1+rϵai+1,ur∗,i+1=ϵai+1−ai+1
这里 r r r 是动作 flow time,独立于视频流时间 t t t; a i + 1 a^{i+1} ai+1 是真实动作 chunk, a r i + 1 a_r^{i+1} ari+1 是加噪动作, u r ∗ , i + 1 u_r^{*,i+1} ur∗,i+1 是动作目标速度场。
6.2、两类样本的损失不同
Task-diverse VA 只有语言条件:
L V A = E [ L f m i + 1 ( ℓ ) + λ a L a i + 1 ( ℓ ) ] \mathcal{L}_{\mathrm{VA}}=\mathbb{E}\left[\mathcal{L}_{\mathrm{fm}}^{i+1}(\ell)+\lambda_a\mathcal{L}_a^{i+1}(\ell)\right] LVA=E[Lfmi+1(ℓ)+λaLai+1(ℓ)]
HumanGen 样本多出人类视频条件和 IFP:
L I C L = E [ L f m i + 1 ( { h , ℓ } ) + λ a L a i + 1 ( ℓ ) + λ i f p L i f p ] \mathcal{L}_{\mathrm{ICL}}=\mathbb{E}\left[\mathcal{L}_{\mathrm{fm}}^{i+1}(\{h,\ell\})+\lambda_a\mathcal{L}_a^{i+1}(\ell)+\lambda_{\mathrm{ifp}}\mathcal{L}_{\mathrm{ifp}}\right] LICL=E[Lfmi+1({h,ℓ})+λaLai+1(ℓ)+λifpLifp]
λ a \lambda_a λa 与 λ i f p \lambda_{\mathrm{ifp}} λifp 分别平衡动作和 IFP 辅助损失。注意动作损失仍只以语言 ℓ \ell ℓ 作为显式任务条件,人类视频通过预测的机器人未来视频间接影响动作分支。
预训练中 Task-diverse VA 与 HumanGen 以 1:5 采样;AdamW 峰值学习率 10 − 4 10^{-4} 10−4、weight decay 0.01。非 ICL 样本以 0.1 概率丢弃语言;ICL 样本以 0.1 概率丢弃人类视频,同时把语言 dropout 提高到 0.4,减少模型对文本捷径的依赖。视频 chunk 长度在 1 到 4 之间随机采样,预训练成本为 15360 GPU hours,每张 GPU 的 packed sequence 最多 16 万 token。
6.3、推理时的数据流
Zero-WAM 支持两种模式:
- Language-only:输入文本指令,不使用人类视频,视频 CFG scale 为 5。
- ICL:人类视频只编码一次并缓存为 prefix memory,关闭语言指令,使用 scale 5 的 ICL CFG。
两种模式的推理 chunk size 都是 2,动作 CFG scale 为 1.0。每轮控制先生成下一段机器人视频,再生成时间对齐的动作;动作执行后获得新观测,继续下一轮。IFP 辅助模块在测试时全部移除,因此不会增加部署分支数量。
6.4、具体任务:三物体顺序操作
以真机 Three-object sequential manipulation 为例,人类视频先展示三个物体应以怎样的顺序放入哪些容器:
- 人类视频被编码并缓存,顺序与目标容器成为视觉任务规范。
- 当前双臂机器人观测与历史进入视频 Transformer,模型结合 prefix memory 生成第一个机器人未来 chunk。
- 动作 Transformer根据未来视频解码第一段连续动作,机器人完成第一个物体操作。
- 新机器人观测进入历史,模型继续生成第二、第三个阶段,直到完成视频所示顺序。
人类视频给出的是结果演化,不要求人手关节和机器人动作一一对应。正是先预测机器人域未来、再解码机器人动作的分解完成了跨本体转换。
7、实验结果怎么读
7.1、RoboTwin 的任务级留出协议

RoboTwin 2.0 有 50 个双臂任务,每个任务 50 条机器人轨迹。论文按任务划分:43 个任务用于后训练,7 个任务完全留作测试,包括未见对象或容器、关节物体、双臂和长时序操作。每个方法使用 3 个随机种子,每个种子在每个未见任务上运行 100 次闭环 rollout,报告成功率均值与标准差。
后训练使用 64 张 GPU、4000 step,Task-diverse VA、HumanGen 与 RoboTwin 的采样比例为 2:10:3。WAN-Action 与 Zero-WAM 同样从 Wan-2.2 出发,但只在 43 个已见 RoboTwin 任务上训练;LingBot-VA 使用其机器人视频-动作预训练 checkpoint,再在相同已见任务上后训练。三者预训练信息并不完全相同,因此表 2 同时衡量了数据构建、视频提示和训练目标的综合作用,不能把 29.50 点增益单独归因于某一个模块。
7.2、仿真与真机主结果

| RoboTwin 未见任务 | WAN-Action | LingBot-VA | Zero-WAM |
|---|---|---|---|
| Place object on scale | 3.00 ± 2.16 | 6.17 ± 4.87 | 24.67 ± 2.05 |
| Stamp seal | 7.33 ± 1.25 | 3.67 ± 2.49 | 47.00 ± 4.55 |
| Open microwave | 2.26 ± 1.60 | 29.33 ± 10.66 | 59.00 ± 2.83 |
| Move stapler to pad | 10.67 ± 1.70 | 23.33 ± 8.22 | 69.14 ± 2.93 |
| Place bread in basket | 15.26 ± 2.55 | 17.33 ± 6.18 | 35.00 ± 3.74 |
| Place empty cup | 38.33 ± 2.05 | 42.33 ± 7.85 | 84.87 ± 0.18 |
| Stack blocks three | 0.00 ± 0.00 | 0.00 ± 0.00 | 9.00 ± 2.16 |
| 宏平均 | 10.98 ± 1.07 | 17.45 ± 1.40 | 46.95 ± 0.72 |
Zero-WAM 在所有 7 个任务上都超过两个基线,但难度差异仍很明显:空杯放置达到 84.87%,三块堆叠只有 9.00%。平均成功率的提升说明跨任务能力显著增强,不代表复杂长时序任务已经解决。
真机评测使用双臂 Franka,每个任务族 30 次测试:
| 真机任务族 | 已见训练配置 | 训练演示 | LingBot-VA | Zero-WAM |
|---|---|---|---|---|
| 对象到容器放置 | 30 | 120 | 43.3% | 53.3% |
| 三物体顺序操作 | 16 | 96 | 10.0% | 33.3% |
| 双桌腿插入 | 未报告组合数 | 36 | 0.0% | 16.7% |
这里是未见配置,不是完全没有真机后训练。作者用少量已见配置演示让模型适配 Franka 运动学,再把新的对象、容器、顺序和插孔组合留作测试。另一个比较边界是 LingBot-VA 使用详细语言描述,而 Zero-WAM 使用人类视频提示,因此结果比较的是两套任务接口和预训练方案的整体效果。

图 6 展示了复杂场景取放、三物体长时序、双桌腿插孔与未见灯泡插入。上方是人类示范状态序列,下方是机器人执行过程。最值得注意的是双桌腿任务:人类视频不仅说明先后顺序,还指定绿色和蓝色桌腿分别对应哪个孔,这类几何关系用短文本很难稳定表达。
7.3、人类视频提示是否真的有效

图 7 为了隔离 ICL 信号,所有对比都只在 43 个已见 RoboTwin 任务上训练。相同 Wan-2.2 初始化下,WAN-Action 使用文本得到 10.98%,加入人类视频但不做大规模任务多样预训练的 Zero-WAM w/o pretrain 达到 36.36%。这说明视频提示本身带来了文本以外的任务信息。
但三个小规模变体在三块堆叠上仍全部为 0,完整 Zero-WAM 才达到 9%。因此结论不是少量人类视频能够替代预训练,而是人类视频接口需要大规模任务多样数据才能在最难的未见任务上发挥作用。
7.4、IFP 与任务均衡预训练

| 消融因素 | 对照 | 完整或增强版本 | 平均提升 |
|---|---|---|---|
| IFP | Zero-WAM w/o IFP 28.55% | Zero-WAM 46.95% | +18.40 点 |
| 任务均衡机器人预训练 | LingBot-VA 17.45% | text-only Zero-WAM 39.44% | +21.99 点 |
| 小规模视频 ICL | WAN-Action 10.98% | Zero-WAM w/o pretrain 36.36% | +25.38 点 |
IFP 在 Open microwave 和 Stamp seal 上增益明显,并让 Stack blocks three 从 0 提升到 9%。这与设计动机吻合:更远的跨步未来目标要求当前表示理解整体任务演化,单靠最近历史难以完成。
任务均衡消融则说明,提升不全来自人类视频。text-only Zero-WAM 遮掉 ICL 视频后仍显著高于 LingBot-VA,表明按任务重新分区和采样本身就是强基线。工程上如果只增加轨迹数却不控制任务频率,模型仍可能被高重复任务主导。
8、方法价值、局限与工程判断
Zero-WAM 最有价值的设计,是把新任务说明和机器人控制解耦成两次跨域转换:人类视频先被翻译成机器人未来视觉,再由机器人未来视觉解码动作。这样,人类视频不必附带机器人动作,也不必与机器人视角和本体严格对齐。
适合的场景包括:
- 语言难以精确指定目标实例或空间配置;
- 操作方式由陌生物体结构决定;
- 多物体任务需要严格顺序;
- 新任务可以用现场演示或互联网视频提供视觉规范;
- 机器人本体已有基础适配数据,但具体测试配置不可穷举。
局限同样清楚:
- HumanGen 大量使用生成视频,语义评分和物理合理性过滤不能完全消除视觉伪影、错误接触或不真实运动。
- 训练使用 teacher forcing 的真实未来机器人视频,推理使用模型生成视频,视频预测误差可能在自回归控制中累积。
- 15360 GPU hours、5B 视频生成骨干和每卡最多 16 万 token 表明训练成本很高;论文没有报告推理延迟、显存与控制频率,不能判断实时部署余量。
- RoboTwin 只有 7 个留出任务,最难任务成功率仍为 9%;开放式任务泛化的范围不能从单一仿真基准无限外推。
- 真机每类只有 30 次试验,并且先用已见配置适配 Franka 运动学;结果证明的是未见任务配置迁移,不是对新机器人本体的零样本控制。
- ICL 模式在实验中关闭语言指令,尚未展示语言与视频同时提供且互相冲突时如何仲裁。
- 代码、模型和数据尚未发布,数据清洗细节、动作格式、采样器、推理步数和完整复现配置目前无法独立核查。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)