摘要

本文解读 RSS 2025 论文《Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets》。该论文提出统一世界模型(UWM),通过融合动作扩散未来观测视频扩散独立扩散时间步设计,让同一个扩散 Transformer 同时充当策略、前向动力学、逆动力学与视频预测四种模型,其特别之处在于用噪声水平统一了 conditioning 与 marginalization,使无动作标注的视频数据可以直接参与预训练。实验表明UWM 在 5 个真机任务上全面超越 Diffusion Policy 超过 20%,并在 LIBERO-100 仿真基准上以平均 79% 成功率取得 SOTA,为机器人预训练与视频世界模型的统一提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
标题(中文) 统一世界模型:耦合视频与动作扩散的机器人预训练
作者 Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, Abhishek Gupta
机构 University of Washington、Toyota Research Institute
会议 RSS 2025
arXiv arXiv:2504.02792
项目网站 weirdlabuw.github.io/uwm

背景与动机

机器人模仿学习(BC)依赖高质量动作标注数据:Diffusion Policy、ACT、π0、OpenVLA 等方法都要求人工采集的专家轨迹,成本高、跨场景泛化弱;而互联网上存在海量无动作标注的视频数据,蕴含丰富的物理世界动态,却始终没有被直接用于策略学习。

既有的替代路线各有短板:视频世界模型(UniSim、Genie、Cosmos)能学习 dynamics,但输出不直接改进 policy;联合视频-动作扩散的代表工作 PAD 使用共享时间步,只能建模动作与观测的联合分布,无法表达二者之间的条件关系(实验中因此性能崩溃,多个任务成功率 0%);GR-1 采用确定性回归预测动作与图像,并非扩散生成。而在图文生成领域,UniDiffuser(NeurIPS 2023)首次提出独立扩散时间步统一多模态扩散——UWM 正是把这一思想迁移到机器人领域:从 UniDiffuser(2023,图文)→ UWM(2025,机器人),完成了从生成模型到具身决策的技术迁移,后续又被 World Pilot 等工作延续(附录 F 历史视角)。

团队来自 UW WEIRD Lab(一作 Chuning Zhu,通讯作者 Abhishek Gupta,2025 IEEE RAS Early Academic Career Award 得主)与 Toyota Research Institute(Siyuan Feng、Benjamin Burchfiel、Paarth Shah),构成学术界 + 工业界的互补组合。

这项工作之所以重要(附录 E 创新模式分析):它揭示了扩散时间步与 masking 的本质联系(P3 隐藏结构)——t=T 即 marginalization、t=0 即 conditioning,仅靠独立控制两个时间步就实现四种推理模式的统一,消融实验证明共享时间步(PAD)性能崩溃(0%–42% vs UWM 60%–92%);同时提供了可复用基础设施(P7)——policy / dynamics / inverse model / video prediction 共享同一 DiT backbone,已被 Embodied Data Pyramid、FoundModels Comprehensive Review 等综述归类为 World-Action Model(WAM)代表工作。

研究主线:从问题到结论

UWM 统一世界模型研究主线 Mermaid 流程图:从模仿学习依赖动作标注的问题,到独立扩散时间步设计、统一扩散 DiT 方法与 DROID 预训练实验,再到 policy 与 world model 统一的结论

图 5:UWM 研究主线:问题 → 动机 → 设计 → 方法 → 实验 → 结论(Mermaid 流程图,已自动重排为网格布局)

基准/方法设计

UWM 的核心设计是一个联合噪声预测网络 $s_\theta(o, a_{t_a}, o_{t_{o'}}, t_a, t_{o'})$:同时预测动作噪声 $\epsilon_a$ 与未来观测噪声 $\epsilon_{o'}$,其中 $t_a$ 与 $t_{o'}$ 是独立采样的扩散时间步。训练时 $t_a, t_{o'} \sim U(0,T)$ 独立采样,让模型暴露所有噪声组合;推理时通过设置不同的时间步组合切换四种模式:

  • 设 $t_{o'}=T$(全噪声)→ marginalize 掉 $o'$ → 策略 $p(a|o)$
  • 设 $t_a=0$(干净动作)→ condition on $a$ → 前向动力学 $p(o'|o,a)$
  • 设 $t_a=T$ 且 $t_{o'}$ 取中间值 → 逆动力学 $p(a|o,o')$ 与视频预测 $p(o'|o)$

视频 co-training 因此变得自然:无动作标注的视频数据固定 $t_a=T$,用随机噪声填充 action,仅优化图像重建 loss——噪声水平本身就是 masking 机制。这与 PAD 的共享时间步形成关键差异:独立时间步使模型能捕获动作与观测之间的因果依赖关系(conditioning via $t=0$,marginalization via $t=T$),而非单纯拟合联合分布。

UWM 统一世界模型框架总览:独立时间步控制动作与图像扩散,同一模型支持 policy、dynamics、inverse model、video prediction 四种推理模式

图 1:UWM 框架总览:独立时间步控制动作与图像扩散,同一模型支持 policy、dynamics、inverse model、video prediction 四种推理模式

分类全景

UWM 统一世界模型分类全景 Mermaid 树状图:模仿学习、视频世界模型、联合视频-动作扩散三个方向,以及 UWM 的四种推理模式(策略、前向动力学、逆动力学、视频预测)

图 6:机器人视觉-动作学习方法分类全景:UWM 独立扩散时间步统一四种推理模式(Mermaid 树状图)

方法细节

UWM 采用扩散 Transformer(DiT)主干,四个核心设计要素:

  • DiT + AdaLN:时间步通过 Adaptive LayerNorm 注入,提供全局条件调制,优于 cross-attention 的逐 token 调制(消融中 78%→88%)
  • Register Tokens:在 transformer 序列中插入可学习的冗余 token,作为动作与图像两种异质模态信息交换的"中间介质"(8 个 registers 最佳:Book-Caddy 88% / Soup-Cheese 90%,无 register 降至 81%/85%)
  • Latent Diffusion for Images:冻结 SDXL VAE,在 (28,28,4) 潜空间进行图像扩散,大幅降低图像模态的计算开销
  • Frame-stacked Observations:h_o 帧历史观测 + h_a chunk 动作预测,捕获时序上下文、提升动作一致性

训练范式一句话概括:独立扩散时间步是核心创新——t=0 = conditioning,t=T = marginalization,一个训练范式覆盖所有条件/边缘分布。这种设计还迫使模型区分"给定动作后观测如何变化"与"给定观测后该做什么",习得的是因果理解而非单纯的相关性拟合。

UWM 训练与推理流程:左侧为预训练(含视频 co-training),右侧为 policy 与 inverse dynamics 推理模式

图 2:UWM 训练与推理流程:左:预训练(含视频 co-training);右:policy 与 inverse dynamics 推理模式

实验设计与结果

评测协议:在 DROID 数据集 2000 条 Franka 机器人轨迹上预训练 100K steps,然后任务微调;视频 co-training 使用额外 2000 条去除动作标注的 DROID 轨迹。真机评估覆盖 5 个任务:Stack-Bowls(叠碗)、Block-Cabinet(开柜放积木)、Paper-Towel(取纸巾)、Hang-Towel(挂毛巾·可变形)、Rice-Cooker(倒米入锅·长时序),并在 ID(in-distribution)与 OOD(视觉干扰、光照变化、杂乱背景)条件下评估;仿真基准为 LIBERO-100(90 train + 10 eval,含 OOD 泛化测试)。基线:Diffusion Policy (DP)、PAD、GR-1。

真机任务设置:五行分别为初始状态、成功完成、OOD 配置(视觉干扰)

图 3:真机任务设置:五行分别为初始状态、成功完成、OOD 配置(视觉干扰)

真机主表(成功率,Pre = 仅预训练,Co = 预训练 + 视频 co-training):

方法(预训练 / 协同训练) Stack-Bowls Block-Cabinet Paper-Towel Hang-Towel Rice-Cooker
UWM (Pre / Co) 0.86 / 0.92 0.76 / 0.84 0.78 / 0.86 0.82 / 0.86 0.60 / 0.65
DP 0.48 / -- 0.60 / -- 0.52 / -- 0.64 / -- 0.35 / --
PAD 0.08 / 0.20 0.00 / 0.00 0.42 / 0.42 0.52 / 0.54 0.00 / 0.00
GR-1 0.66 / 0.62 0.66 / 0.74 0.60 / 0.46 0.66 / 0.66 0.40 / 0.25

UWM 在全部 5 个任务上 ID 成功率全面领先,co-training 视频后进一步平均提升 >5%;DP 无法利用像素信息,PAD 因共享时间步限制性能严重不足(多个任务为 0.00)。

OOD 与 LIBERO 结果:co-trained 模型在 30 次 OOD 试验中成功 21/30,显著优于 DP 的 12/30;视频 co-training 在 OOD 场景增益尤为明显——Block-Cabinet OOD 从 0.60→0.72,Hang-Towel OOD 从 0.64→0.76。LIBERO-100 上 UWM 平均 79%,对比 DP 71% / PAD 57% / GR-1 58%。从零训练时 UWM 与 DP 持平,但 UWM 从预训练中获益远超 DP,证明其架构对大规模数据的利用效率。

真机任务平均成功率:UWM 全面领先,co-training 视频进一步提升

图 4:真机任务平均成功率:UWM 全面领先,co-training 视频进一步提升

附录 A —— 逆动力学轨迹追踪:给定参考轨迹并重置到初始状态,用 ground-truth o' 输入逆动力学模式生成动作,逆模型比 policy 更精准:Book-Caddy 65% vs policy 47%,Soup-Cheese 55% vs policy 26%;policy 给予更多时间(1000 steps)也能完成任务,但逆模型更"忠实"于参考轨迹,适合轨迹回放、skill 复用等需要精确复现的场景。

附录 B —— 消融实验:设计选择上,8 个 register tokens 最佳(Book-Caddy 88% / Soup-Cheese 90%),无 register 降至 81%/85%;AdaLN 全面优于 cross-attention(78%→88%)。学习目标上,未来帧重建(UWM)在 Stack-Bowls / Block-Cabinet 达 86% / 76%,当前帧重建仅 70% / 66%,无重建(DP 监督)仅 48% / 60%——证明 UWM 的增益来自 dynamics prediction,而非单纯的 image reconstruction:

学习目标(Stack-Bowls / Block-Cabinet) 成功率
未来帧重建(UWM) 86% / 76%
当前帧重建 70% / 66%
无重建(DP) 48% / 60%

附录 C —— 互联网视频 co-training:混合 Kinetics-400 + Something-Something-v2 人类活动视频后,同域机器人视频 co-training 达 0.92 / 0.84,互联网视频 co-training 为 0.88 / 0.80——有正迁移但弱于同域视频;仅机器人数据为 0.86 / 0.76。跨 embodiment gap 的视频预训练是未来方向:

Co-training 数据来源(Stack-Bowls / Block-Cabinet) 成功率
机器人视频(同域) 0.92 / 0.84
互联网视频(Kinetics-400 + SSv2) 0.88 / 0.80
仅机器人数据(无 co-training) 0.86 / 0.76

附录 D —— OOD 分场景详细结果(每场景 5 次试验):

OOD 场景 Stack-Bowls (Co) Stack-Bowls (Pre) Stack-Bowls (DP) Block-Cabinet (Co) Block-Cabinet (Pre) Block-Cabinet (DP)
光照 L1(静态) 4/5 4/5 2/5 5/5 5/5 3/5
光照 L2(Disco) 3/5 2/5 2/5 4/5 0/5 0/5
背景 B1 4/5 3/5 3/5 4/5 3/5 2/5
背景 B2 3/5 1/5 2/5 1/5 0/5 0/5
杂乱 C1 3/5 2/5 2/5 0/5 0/5 0/5
杂乱 C2 4/5 3/5 2/5 1/5 0/5 0/5
合计 21/30 15/30 12/30 15/30 8/30 6/30

Co-trained UWM 在全部 12 个 OOD 子场景中均为最优或并列最优,Disco 光照和杂乱背景下优势尤为显著。

结果对比总结

UWM 统一世界模型结果对比 Mermaid 图:LIBERO 平均成功率 79% vs DP 71% / PAD 57% / GR-1 58%,真机 ID 超 DP 20%+,OOD co-training 21/30 vs 12/30

图 7:结果对比总结:UWM 在 LIBERO-100 与真机 OOD 场景全面领先(Mermaid 结果图,带数字)

关键发现

  1. 独立扩散时间步 = 统一接口:$t_a$、$t_{o'}$ 独立控制动作与观测的噪声水平,$t=0$ = conditioning,$t=T$ = marginalization,无需额外模块即可从同一模型采样 policy、dynamics、inverse model、video prediction 四种推理模式。
  2. 真机全面领先:UWM 在 5 个真机任务上 ID 成功率 0.60–0.86,全面超越 DP(0.35–0.64)超过 20%。
  3. 视频 co-training 增益:真机平均再提升 >5%,OOD 场景更明显——Block-Cabinet OOD 从 0.60→0.72,Hang-Towel OOD 从 0.64→0.76。
  4. LIBERO-100 SOTA:平均成功率 79%,对比 DP 71% / PAD 57% / GR-1 58%。
  5. OOD 鲁棒性:co-trained 模型 30 次试验成功 21/30(DP 仅 12/30),12 个 OOD 子场景全部最优或并列最优;Disco 光照下 Block-Cabinet 4/5 vs DP 0/5。
  6. 增益来自 dynamics 而非重建:未来帧重建 86%/76% vs 当前帧重建 70%/66% vs 无重建 48%/60%;互联网视频 co-training 也有正迁移(0.88/0.80 vs 仅机器人 0.86/0.76)。

局限性

  • 未利用大规模人类视频:当前仅使用机器人视频(DROID),未能跨越 embodiment gap 利用互联网规模的人类活动视频(ImageNet/Kinetics 级别)。
  • 前向动力学重建伪影:图像生成质量在细节上仍有不足,可能影响基于 world model 的 planning。
  • 视频预测密度不足:仅预测下一帧,未利用更密集的时序监督信号。
  • 未见多任务泛化:当前微调为单任务,预训练模型的多任务 zero-shot 能力未充分探索。
  • 作者展望:融合最新生成模型进展提升 visual quality;利用 planning 能力在测试时进一步改进 policy;扩展至互联网视频。

常见问题(FAQ)

UWM 与 Diffusion Policy 的核心区别是什么?

Diffusion Policy 只建模动作条件分布 p(a|o);UWM 同时建模动作与未来观测,并用独立扩散时间步让同一个模型支持策略、前向动力学、逆动力学、视频预测四种推理模式,还能直接用无动作标注的视频数据 co-training。

什么是独立扩散时间步?

动作与观测各自独立采样噪声水平 $t_a$ 与 $t_{o'}$:$t=0$ 表示干净信号(conditioning),$t=T$ 表示全噪声(marginalization)。控制噪声水平即控制 masking,一个训练范式覆盖所有条件/边缘分布。

视频 co-training 是怎么工作的?

对无动作标注的数据固定 t_a=T,用随机噪声填充 action,只优化图像重建 loss——缺失的动作被"mask"掉,模型照样能从视频中学习视觉动态与表征。

为什么 UWM 在 OOD 场景下更强?

未来帧重建迫使模型学习真实的 dynamics 与视觉表征,co-training 进一步覆盖分布外的视觉变化。OOD 试验中 co-trained 模型 21/30 vs DP 12/30,Disco 光照与杂乱背景下优势最大。

逆动力学模式有什么用?

给定目标/参考轨迹 o' 生成动作 a,适合轨迹回放与 skill 复用:Book-Caddy 追踪成功率 65%(policy 仅 47%),Soup-Cheese 55%(policy 26%)。

图像扩散为什么在潜空间做?

使用冻结的 SDXL VAE 在 (28,28,4) 潜空间扩散,把高分辨率像素重建的计算开销降低两个数量级,是图像模态能与其他模态联合训练的关键工程选择。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐