引言

在具身智能迈向开放世界的道路上,世界模型 已成为提升智能体想象、规划与泛化能力的关键组件。我根据Datawhale 的 every-embodied 项目所解读的三篇前言工作的内容编写如下博客:《RAW-Dream:任务无关世界模型强化 VLA》、《WoG:条件空间世界模型导读》和《WALL-WM:事件级世界动作模型导读》。它们分别从数据增强、结构化推理和分层抽象三个角度,重新定义了世界模型的边界。本文将对这三项工作展开横向对比,并结合各博客中的核心图示,帮助读者厘清技术脉络。

对应的文章链接放置在文章末尾


1. RAW-Dream:用任务无关的想象喂饱 VLA

核心思想
RAW-Dream 提出一种 任务无关 的扩散世界模型,能够根据历史观测与动作生成高保真的未来帧预测。它不关心具体任务是什么,只专注于“世界会如何变化”。这些生成的想象轨迹被当作额外的训练数据,直接注入 VLA(视觉-语言-动作)策略的训练流程,极大缓解了真实机器人数据的稀缺问题。

关键设计

  • 扩散世界模型:基于像素级视频预测,学习通用环境动态。
  • 任务无关性:模型输入只有图像和动作,不含任务指令,因此一次训练可服务于无数下游任务。
  • 策略增强:冻结世界模型,大量生成想象轨迹(附带奖励信号),用于强化学习训练 VLA 策略,显著提升跨任务泛化能力。

在这里插入图片描述

关键图示解读
原文中的方法框架图清晰展示了 RAW-Dream 的双阶段流程:

  • 左半部分(世界模型训练):历史观测帧与动作序列输入一个以扩散 Transformer 为核心的预测器,通过迭代去噪生成未来图像。图中用虚线框标出“任务无关”约束,强调输入中不包含任务指令。
  • 右半部分(VLA 增强):冻结的世界模型充当“想象引擎”,在给定初始状态和随机动作后,滚动生成完整的想象轨迹(图像序列 + 奖励)。这些合成数据与真实数据混合,送入 VLA 策略进行行为克隆或强化学习微调。
  • 该图示直观地说明了“世界模型为策略提供无限训练数据”这一核心理念。

一句话总结:把世界模型变成一个“无限数据生成器”,让 VLA 策略在想象中千锤百炼。


简单解释

你可以把 RAW-Dream 想象成机器人专属的 “白日梦生成器” 。无论机器人以后要做什么任务(端水、擦桌子、开柜子),它都能先闭上眼,根据当前看到的画面和可能的动作,生成一连串逼真的“想象视频”。这些白日梦里,有时候会成功,有时候会搞砸,但没关系——VLA 策略可以像看录像一样从这些想象中学习经验,练得多了自然就变聪明了。这就好比一个飞行员在模拟器中飞了无数个小时,真实上机时自然更从容。

2. WoG:在条件空间中解构世界

核心思想
WoG 倡导一种结构化、可解耦的世界模型。它将复杂场景分解为多个独立的“条件变量”(如物体位置、背景纹理、光照),并学习在条件空间中进行状态转移预测。这种设计让模型不但能预测未来,还能回答反事实问题:“如果我只移动这个物体,画面会变成怎样?”

在这里插入图片描述

关键设计

  • 条件空间建模:用 VQ-VAE 将场景编码为离散潜变量,再用条件 Transformer 学习变量间的动态交互。
  • 干预与解耦:可单独控制某个条件因子,实现目标导向的“想象实验”。
  • 模型规划:在条件空间中搜索最优动作序列,天然支持基于模型的规划与操控。

在这里插入图片描述

关键图示解读
WoG 博客中的核心示意图分为三个模块:

  • 编码器模块:展示了如何将原始图像通过 VQ-VAE 压缩为一组离散的条件令牌(Condition Tokens),每个令牌对应场景的某个独立因子(如物体形状、位置、颜色),并用不同颜色的圆圈区分。
  • 动态预测模块:条件 Transformer 接收历史条件令牌序列和动作,预测下一时刻的条件令牌分布。图中用箭头清晰标示了注意力机制在多个条件变量间的交互。
  • 干预与解码模块:用户可以手动修改某一个条件令牌(如移动物体),经过 Transformer 传播影响其他变量后,再由解码器重建出符合新场景的图像。该图直接体现了“外科手术式解耦操控”的能力。

一句话总结:WoG 让世界模型拥有了“外科手术刀”般的可解释操控力。


小白阅读

对场景内容进行拆解
想象你面前有一张桌子的照片,WoG 不是简单地记住这张图,而是像侦探一样把场景拆成一块块 “可调节的积木” :比如碗的左右位置、背景的明暗、桌子的颜色……每个积木都是一个独立的旋钮。你可以单独转动“移动碗”的旋钮,就能看到碗从左边滑到右边,而背景不变。这种解耦能力让机器人能够做“如果我只改变这一个东西,会怎么样”的思考实验,比单纯看视频灵活得多。

3. WALL-WM:将动作和世界同时提升到事件层级

核心思想
WALL-WM 不再沉溺于底层的像素或控制指令,而是将世界模型和动作空间都抽象到事件级别。什么是事件?“拿起杯子”、“打开抽屉”这类语义行为。世界模型预测的是事件执行后的场景状态变化,而动作本身也被定义为一个事件标签。这种设计大幅缩短了规划视界,天然适合长程任务。

关键设计

  • 事件级状态跃迁:从视频中自动发现事件边界,构建事件图。
  • 语义动作空间:动作不再是关节角度,而是事件原语,可直接与 LLM 交互。
  • 层次化想象:高层由 LLM 分解任务为事件序列,低层由世界模型想象事件后果并校验可行性。

在这里插入图片描述

关键图示解读
WALL-WM 的架构图突出层次化抽象:

  • 事件发现与图构建:左侧流程展示如何利用视频预测模型的变化检测自动切分事件边界,并将每个事件片段编码为一个状态节点;节点之间的有向边表示事件的先后关系,形成事件图。
  • 双层级规划:上层 LLM 将“整理桌面”这类长程任务分解为(拿起杯子→放入洗碗机→擦桌子)等事件序列;下层世界模型根据当前状态和候选事件,预测执行后的状态嵌入,并评估可行性。
  • 端到端执行:图中用虚线连接的事件原语与底层策略库,表示最终通过检索或生成将事件映射为可执行的动作轨迹。该图完美诠释了"以事件为单位思考"的抽象层次。

一句话总结:WALL-WM 像人类一样“以事件为单位思考”,让长程规划不再遥不可及。


简单理解

想象你在看一段“做早餐”的视频,你不会一帧一帧记住每个关节角度,而是会自然总结成:“拿鸡蛋 → 打蛋 → 煎蛋 → 装盘” 这几个大步骤。WALL-WM 就是让机器人也学会这种“划重点”的本事。它把复杂的连续动作压缩成一个“事件清单”,机器人只要按清单执行(比如“拿起杯子”、“打开抽屉”),而不需要操心每一毫秒电机转多少圈。这样在做“整理房间”这种超长任务时,机器人可以先像项目经理一样列个大纲,再一步步落实,效率高多了。

4. 横向对比:三种世界模型范式

维度 RAW-Dream WoG WALL-WM
世界建模粒度 像素级未来帧预测 条件结构化潜在空间 事件级状态跃迁
任务相关性 任务无关(通用想象力) 任务相关(可干预推理) 任务相关(长程子任务)
动作表示 原始控制指令 底层操控/条件干预 语义事件原语
核心预测形式 扩散模型生成图像 Transformer 预测离散编码 事件转移图 + 状态嵌入
规划能力 无显式规划,用于策略训练 条件空间搜索 (MPC) 事件图搜索 + LLM 分解
主要优势 无限想象数据,提升 VLA 泛化 解耦干预,长期预测稳定 抽象视界,天然适配语言与长程
代表场景 多任务机器人操作 复杂动态场景下的操控 厨房、家居整理等长序列任务
关键图示特点 双阶段流程:训练世界模型→增强VLA 三模块:编码→动态预测→干预解码 事件图 + 双层级规划

5. 总结与展望

RAW-Dream 走的是以量取胜的数据增强路线,将世界模型定位为“硅基想象力”的源头;
WoG 追求结构化理解,让世界模型不仅能预测,还能被解释和干预;
WALL-WM 则向人类认知抽象靠拢,用事件来压缩时空,让长程任务成为可能。

从各自博客中的图示也能看出这种递进关系:RAW-Dream 关注数据生成闭环,WoG 关注可解构图结构,WALL-WM 关注时空抽象层次。三条路径高度互补,未来的具身世界模型很可能融合任务无关的泛化想象、结构化条件解耦以及多层级的抽象动作空间,从而在开放世界中真正实现“看见、理解并行动”。


本文基于 Datawhale every-embodied 专题博文,并结合原文关键图示进行解读:

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐