用于机器人学习与控制的世界-动作模型:综述
26年9月来自阿联酋 MBZUAI 、加州理工、亚马逊公司FAR、维吉尼亚大学、乔治亚理工、纽约大学和加州伯克利分校的论文“World-Action Models for Robot Learning and Control: A Survey”。
这篇论文的核心观点是:机器人不仅需要知道“下一步做什么”,还需要预测“这样做会带来什么后果”,并将这种预测转化为可执行、可纠错的动作。 世界-动作模型(World-Action Models,WAMs)正是围绕这一连接展开。
论文的主要价值是建立了一套较完整的技术分类框架;主要不足是概念边界仍有摇摆、缺少统一的实证比较,而且存在可直接核对的引用错误。下面先概述论文,再提炼要点,最后分别讨论领域挑战与综述自身的问题。
一、论文试图回答什么问题?
论文从机器人在开放环境中的困难出发:观测不完整、物理交互复杂、任务持续时间长,而且局部正确的动作可能破坏后续目标。
例如,机器人要把杯子放进柜子,直接生成“抓取杯子”的动作还不够。它需要考虑抓取姿态是否妨碍放入、柜门是否挡住路径,以及杯子被遮挡后如何继续判断状态。
作者认为,现有研究分别解决了这个问题的一部分:

因此,论文真正关注的是:
未来预测如何参与动作学习和决策,并最终改善机器人实际执行?
这比“机器人能否生成未来视频”更接近整篇综述的研究对象。(第1—3页)
如图 1 是世界动作模型的演化:

二、论文的详细内容与技术框架
- 概念基础:从单独预测或控制,走向联合建模
论文以部分可观测马尔可夫决策过程作为背景,并区分三种基本映射:
世界模型:当前状态与动作 → 下一状态。
VLA:历史观测与语言指令 → 动作序列。
WAM:历史观测与语言指令 → 未来观测与动作序列。
为便于理解,可以将其统一写为:
p(O_future, A_future |h, e)
其中,h是交互历史,e是语言指令。
这里的“未来”不必是完整视频,也可以是潜在特征、三维结构、目标状态或其他与控制有关的表示。
论文进一步提炼出四项能力:

这是全文最有用的概念框架之一:不同方法的差异,可以理解为重点学习了其中哪些能力,以及这些能力如何连接。(第3—4页)
如图 2 所示世界模型(WAM)背后四个基础思路的概念概述:(a)世界模型通过预测当前状态和动作来学习潜动态;(b)视频生成模型根据视觉历史和语言指令预测未来的视觉观察结果;(c)潜动作预训练从连续帧中推断潜动作,并用它们来建模潜转换;(d)视频生成模型(VLA)直接从状态和语言指令生成未来动作序列。(第三行插图改编自各思路中引用的相应论文。)

- 两种核心路线:联合预测与先规划后行动
第一种是联合预测:在共享的建模过程中生成未来观测和动作。
论文将 GR-1、GR-2、UWM、WorldVLA 等作为相关例子。其思路是,让动作学习受到未来状态预测的约束,使策略获得与未来变化有关的表示。
优势是能够共享表征、联合训练;难点是视觉与动作的精度要求、数据规模和损失函数不同,可能相互干扰。
第二种是逆向动力学路线:先预测希望出现的未来,再推断如何到达它。
可以理解为:
当前观测与任务 --〉未来状态或目标 --〉执行动作
论文讨论了 Seer、DreamZero、Act2Goal 等相关方法,并指出 Fast-WAM、GigaWorld-Policy 等设计可以在训练时利用预测结构,而在部署时直接解码动作。
其优势是便于利用没有机器人动作标签的视频;难点是预测出来的未来可能不可达,或者仅凭视觉变化无法确定可靠的执行动作。
如图 3 所示“世界-动作模型”(World-Action Models)的组件级分类架构。该架构可从四个功能模块的角度进行理解:提供任务条件设定的语言接口、定义预测状态的视觉编码器、承载动力学特性的预测主干网络,以及将预测的未来状态转化为可执行控制指令的动作解码器。

作者没有认定其中一种路线普遍更优,而是强调不同的数据条件与推理成本会影响选择。(第6页)
- 模型由哪些模块组成?
论文将架构拆成四个功能模块:

其中有两个重要的设计取舍。
一是预测像素还是预测控制相关的表示。像素和视频直观、可利用大规模视频预训练;潜在特征和三维结构可能更紧凑,也更接近规划需要,但需要证明没有丢失关键物理信息。
二是动作表示是否依赖具体机器人。关节角、末端位姿等容易执行,却与硬件相关;潜在动作有助于跨机器人迁移,但最终仍需要与具体控制接口对齐。(第5—6页)
如图 4 所示转移建模范式。联合预测将未来的观测与动作生成耦合在同一过程中,而逆向动力学范式则将这一转移过程进行分解:先构想未来状态,再推断可执行的动作。

- 架构结构:统一主干与双系统
论文将模型结构进一步分成两类:
统一主干:语言、视觉和动作在同一主干中处理,强调共享表示和联合学习。
双系统:世界建模模块与动作模块相对独立,通过共享注意力、交叉注意力或中间特征连接,强调模块化与适配能力。
这与前面的“联合预测/逆向动力学”是两个不同的分类维度。
模块是否分开,与生成过程是否先预测后行动,并不是同一个问题。 一个具有两个专家模块的模型,也可以联合生成视觉与动作。
图5把这两个维度放在一起,是阅读架构章节时最值得关注的图。(第7页)

- 训练流程:先学习世界变化,再与机器人动作对齐
论文将训练分为预训练和后训练。
预训练主要学习三件事:
时空表示:物体如何运动、场景如何演化、交互如何发生。
动作表示:将控制信号编码成 token,或从视频变化中推断潜在动作。
视频—动作对齐:使预测的变化与机器人能执行的动作建立对应关系。
后训练包括:
策略微调:适配目标机器人的传感器、动作空间和任务。
数据增强:改变背景、外观等视觉条件,或者生成轨迹并补充伪动作标签。
强化学习:在传统仿真、真实环境或学习到的世界模型中优化策略。
世界模型在这里还可以充当“训练环境”:策略提出动作,模型预测结果,再根据奖励改进策略。但策略也可能利用模型的错误,在想象环境中表现很好,实际执行却失败。(第7—9页)
如图 6所示WAMs 的策略训练流程:(a) 预训练阶段利用互联网规模的视频数据学习时空与动作表征,并实现视频与动作的对齐;(b) 后训练阶段通过策略微调、数据增强和强化学习,对预训练模型进行适配。

- 数据逻辑:海量视频提供先验,机器人轨迹提供动作依据
论文用“数据金字塔”解释三种数据的分工:

关键是:视觉知识的规模,与动作监督的精确程度,是两个不同的维度。
因此,大规模视频预训练并不能自动替代机器人数据。模型仍需学习“看到的变化”与“该机器人如何造成这种变化”之间的关系。
论文还讨论了多视角、三维几何、触觉、声音和本体状态。其中,触觉与声音的重要性在于,它们能补充视觉难以判断的接触、材料状态和交互事件。(第9—10页)
如图 7 所示世界-动作模型的数据模态与规模化结构:

- 三类应用:相同框架,不同瓶颈

操作章节区分视频—动作策略、结构化状态模型和基于想象的策略优化;导航强调前瞻规划与潜在状态;驾驶强调视觉生成、三维占据与统一决策。
贯穿这些应用的判断标准是:预测是否改善了动作选择、策略训练或实际执行,而非是否生成了逼真的画面。(第10—11页)
- 评测:预测质量与控制效果必须同时看
论文把数据集、任务基准和仿真环境区分开来,并整理了三张重要表格:
表 I:代表方法、范式、主干与评测场景。
表 II:常用指标及定义。
表 III:数据集、仿真器和基准资源。
其评测思想可以归纳成四层:

作者特别指出:任务成功率本身,也不能证明提升来自世界预测,因为更强的预训练、模仿先验或任务训练都可能带来提升。(第11—14页)
三、六个要点
WAM 的核心是预测与控制的连接。 是否生成视频只是实现选择之一,不能作为唯一识别标准。
“动作对齐”是从视频学习走向机器人控制的关键。 模型知道一个动作看起来如何发生,并不等于知道具体机器人该发送什么控制信号。
联合预测与逆向动力学代表两种组织方式。 前者强调共享生成,后者强调将未来目标转成动作;两者都面临可执行性约束。
训练时预测与执行时预测需要分开讨论。 一些方法通过预测任务改善表征,但部署时不必显式生成未来视频。
预测的用途有多种。 它可以用于表征学习、在线规划、合成数据,也可以作为强化学习环境。比较方法前,应先明确用途。
最终评判标准是闭环收益。 更好的预测指标,必须进一步转化为任务成功、鲁棒性、安全性或数据效率,才能说明对机器人有用。
四、域难题
以下是作者讨论的研究问题,不等同于综述写作上的缺陷。(第14—15页)

这些问题彼此关联。例如,更长的预测可能有助于规划,却增加误差和延迟;更大的视频模型可能拥有更丰富的先验,却更难满足快速接触控制。
五、存在什么问题?
- WAM 的定义与实际覆盖范围不完全一致
第2—4页主要把 WAM 描述为联合预测未来与动作,或通过逆向动力学连接二者的模型。
但第11页表 I 又纳入:
由外部规划器使用预测结果的 WM-Plan;
在世界模型中训练策略的 WM-RL;
多种几何或感知动力学模型。
这扩大了综述的覆盖面,却也使读者难以判断:WAM 究竟是有特定结构的新模型类别,还是“世界模型参与机器人控制”的总称?
更清晰的做法是明确区分“狭义 WAM”“世界模型辅助控制系统”与“基础技术”,并给出可操作的纳入条件。
- 分类维度丰富,但具体标签不够统一
第7页明确提出“架构结构”和“转移建模”是正交维度,这是优点。
然而,表 I 的类别混合了不同层面的属性:
VAM、Uni 描述模型形式;
WM-Plan 描述预测的使用方式;
RL 描述学习方式;
3D 描述状态表示。
这些类别天然可以重叠。例如,一个模型完全可以同时具有三维表示、联合生成和强化学习训练。
此外,Cosmos Policy 在正文中被用来说明联合建模,却在表 I 标为 VAM;Fast-WAM、GigaWorld-Policy 被讨论为隐式 IDM,而相关描述又涉及联合训练。
这不必然是方法归类错误,但缺少“训练结构—推理结构—预测用途”的逐项标注,会让分类难以复用。
- “联合预测/逆向动力学”的数学区分还不够严格
从概率角度,联合分布本来就可以分解为:
p(O, A |h, e) = p(O| h, e) p(A| O, h, e)
所以,二者的实质差异应更多体现在网络依赖、训练目标、生成顺序,以及执行时是否真的使用未来状态。
文中式(15)、(17)把规划分布与逆动力学分布相乘。若它表示联合生成过程,可以理解;若将其直接作为动作策略,则需要说明如何对未来状态积分,或如何采样未来计划。
此外,逆动力学项省略语言条件,也隐含了未来状态足以承载相关任务信息的假设。论文没有充分讨论这一假设在部分可观测、目标存在歧义时是否成立。(第4、6页)
- 没有充分区分“观察到相关性”与“学到动作后果”
论文强调动作条件预测和反事实推理,但核心形式化主要仍是观测与动作的统计联合建模。
从演示中学到“某动作通常伴随某结果”,不等于已经证明模型能回答:
在相同初始条件下,如果采取不同动作,会产生什么结果?
这是一个关键缺口。综述可以进一步区分:模仿演示分布、预测已见动作结果,以及评估未见候选动作的反事实能力。
同样,视频中的未来“看起来可能发生”,与该机器人在当前约束下“能够实现”,也需要单独评测。
- 缺少足够的量化综合,难以支持路线选择
表 I 主要提供方法索引,没有系统比较:
相同任务和数据预算下的成功率;
模型规模与训练成本;
推理延迟和实际控制频率;
真机测试次数、方差和失败分布;
是否需要部署时生成未来。
例如,第8页引用 DreamZero 约30分钟真机数据的迁移结果,但没有在该处展开任务范围、先验数据条件及比较基线。
因此,本文适合回答“有哪些路线”,对“在我的预算和任务下应选哪条路线”帮助有限。问题不在于综述没有自己做实验,而在于对已有实验证据的综合仍偏定性。
- 评测批评准确,但尚未形成可直接执行的验证方案
作者正确指出,视觉质量和任务成功率都不能单独解释预测的贡献,但没有进一步给出统一的对照设计。
一个更有说服力的评测框架,应要求在相近数据与计算预算下比较:
有无未来预测训练目标;
有无部署时前瞻预测;
正常预测与打乱、替换预测;
不同预测时长与延迟下的任务表现。
这样才能判断收益来自预测本身、额外训练信号,还是单纯更大的模型。
论文没有系统提出这套协议。
- 数据“扩展”讨论多,真正的扩展规律证据少
论文涉及数据规模、混合和“scaling laws”,但主要阐述互联网视频、人类演示和机器人轨迹的互补性。
它没有形成明确的定量结论,例如:
增加多少无动作视频,能节省多少机器人数据?
数据质量与规模如何权衡?
人类视频和机器人数据的混合比例如何选择?
不同规模下,联合预测与 IDM 的优势是否改变?
因此,这部分更准确地说是数据来源与扩展策略的概述,尚不足以称为对扩展规律的深入总结。
- 安全、不确定性与物理可执行性的讨论不够深入
论文提到安全和不确定性,但没有将其展开成完整的技术分类。
仍缺少系统回答的问题包括:预测何时不可信、如何识别分布外状态、何时应重新观测,以及如何对动作施加碰撞、力、速度和可达性约束。
对一篇强调“可靠、可部署机器人”的综述而言,这些内容应与视频生成和模型架构同样重要。
- 缺少透明的文献检索与筛选过程
全文未见清晰的检索数据库、关键词、时间截止点、纳入排除规则,以及对预印本和已发表工作的区分方法。
这不妨碍它成为一篇有用的叙述性综述,但使读者难以判断覆盖是否完整,也难以复现文献选择过程。
- 存在明确的引用与编辑问题
至少两处可以仅通过本文内部交叉核对确认:

此外,第1页存在连续重复句;页眉仍保留“JOURNAL OF LATEX CLASS FILES … AUGUST 2021”的模板文字。模板文字不能用于判断发表状态,但说明版本整理尚不充分。
这些问题并不推翻整篇论文的框架价值,但说明其数据表、引用和个别归类不宜未经核对就直接转引。
总体评价是:它是一份覆盖广、组织清楚的 WAM 入门,但还不是一份证据充分、分类严格、能够直接支撑技术选型的比较综述。 最值得保留的是“预测如何服务控制”的主线;阅读时最需要追问的是:每种方法究竟在哪里使用预测,以及有什么实验证据证明预测带来了收益。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)