【具身智能】WAM综述论文随笔
本文是在阅读《World Action Models: The Next Frontier in Embodied AI》时记录的笔记,带有很强个人主观性,仅供参考。
前言
论文主要从WAM的具体定义和架构,不同WAM之间的分类,数据生态等,进行综述。
本文将围绕这三个点进行。
VLA的能力是被肯定的。
但是它没有自己的想象能力。这在现实世界中可抽象描述为基本上是一种动作条件反射,即仅从看到的,听到的,直接作出反应。
为了能够让模型能够有更强的大脑,即增加内部世界构想,WAM(World Action Models)发展。
相比于VLA,WAM拥有了一个自己构想的内部世界。即在预测动作的基础上,对环境的未来状态也进行预测。(当然不能这么说,动作和环境没有绝对的先后之分😜)
即建模 p ( o ′ , a ∣ o , l ) p(o',a ~ \mathbf{|} ~ o,l) p(o′,a ∣ o,l)。
世界模型
首先想说的,是构建层面的分类。
我想从一种特殊的角度进行整理。(这代表了我在阅读论文时各种概念之间的混乱到重组的过程)
RNN系列
如果不想啃原论文的话,这里建议可以参考一下我的另一篇博客:
但是里面有比较不清晰的描述,我的混乱也来源于此,建议看完后继续阅读接下的文本
至于为什么说是RNN系列,后续的发展基本都在RNN的基础上进行的。
RNN
循环神经网络,一种最基本的构建世界模型的方式。
这是基本骨架。
具体的:
h
t
=
f
(
h
t
−
1
,
Z
t
−
1
,
a
t
−
1
)
h_t=f(h_{t-1},Z_{t-1},a_{t-1})
ht=f(ht−1,Zt−1,at−1)
其中,
h
t
h_t
ht为状态序列,
Z
t
Z_t
Zt为观测,
a
t
a_t
at为动作
MDN-RNN
即在RNN基础上,将确定性预测转为概率分布建模:
p ( h t ∣ h t − 1 , Z t − 1 , a t − 1 ) p(h_t ~ \mathbf{|} ~ h_{t-1},Z_{t-1},a_{t-1}) p(ht ∣ ht−1,Zt−1,at−1)
基本所有世界模型都以此为基础演化发展,例如Generative RNN。
RSSM
将 Z Z Z,变为了 z z z
倒也不能这么说。我想说的是,环境确定性观测
Z
t
Z_t
Zt,变成了模型可以预测的东西
z
t
z_t
zt。
(这里写法和另一篇文章不同哟)
这带来了两个好处:
- 随机性的增加。自主建模环境观测,带来的随机性可以带来一系列好处。
- 对未来的预测能力。由于可以自主预测环境观测,具备模型以“幻想”未来多部状态的能力。
这种转变被称为“状态空间”,即SSM。
PlaNet,Dreamer系列等,以此发展。
Transformer系列(TSSM)
即以Transformer骨架作为序列处理和预测。
TransDreamer,作为主要代表。
接下来是其它的一些分类。
生成分类
- 显式生成:图像,视频生成等,采用扩散模型或卷积生成等。
- 隐式生成:只进行潜在向量预测,不将此转化为显示。
作用分类
- 模仿学习:用于模仿专家动作,生成海量数据等。
- 强化学习:在潜在空间中模拟,结合各种信息(幻想状态,奖励等),减小现实训练复杂性。
- 评估模型:用于评估模型。
设计策略架构分类
这是综述论文里的总分类方式。
- 级联式-WAM:先状态后动作
- 联合式-WAM:状态动作同时
级联式-WAM
首先预测下一个状态,再预测动作。
现在我们有了什么:
前一个状态,和后一个状态。
通过这两个状态来得到动作。
于是又有两种表面分类:
- 显示-动作预测
- 隐式-动作预测
显示-动作预测
即将状态先全部转化为真实可观测的信息,再交由其它模型进行动作提取。
- 直接提取:直接喂“画面”给模型,让它完成动作提取全部工作。
(UniPi,AVDC) - 几何提取:先将画面中真正变化的物理几何信息提取出来,再交由模型提取动作。
(3DFlowAction,Dream2Flow)
隐式-动作预测
即直接将潜在状态向量交由模型提取动作。
(VPP,OmniVTA)
联合式-WAM
即同时预测下一状态和动作。
这里又可以分为两种预测方式,即两种预测架构:自回归形式和扩散形式。
自回归生成式
使用RNN,Transformer等处理序列的结构来预测下一状态和动作。
这里又可以有三种生成方式(关注多模态时):
- 显式生成:各自模态各自头进行分离
(GR-1,GR-2,GR-MG) - 统一生成:多模态统一到其中的一个Token空间
(CoT-VLA,WorldVLA / F1) - 潜在生成:统一到一个潜在空间(和统一生成相似,但不同)
(LA-JEPA,V-JEPA 2)
扩散生成式
即通过去噪方式生成状态和动作。
于是又有两种方向:
统一流:状态和动作由统一的去噪网络
- 显式生成:生成图像,动作等显式信息。
(DreamZero,Cosmos Policy,GigaWorld-Policy,X-WAM) - 隐式生成:生成潜在表示。
(FLARE,FRAPPE)
多流:不同流之间交互信息
- 交叉注意力:不同流之间通过交叉注意力查询进行信息传递。
(DUST,UD-VLA,CoVAR,Motus) - 隐状态传递:从同一的隐状态(通常是状态生成)中将信息传递到多流。
(LingBot-VA,Fast-WAM,DiT4DiT,MotuBrain) - 共享表示:先由统一的编码器处理初始表示,再交由各自流处理。
(UVA,PhysGen)
题外话:(自己的想法🤔)
级联和联合式,抽象在现实中,可视为“三思而后行”与“肌肉记忆”。
对于人,综合这两种行动方案,便于获得更好的行动力。
对于模型,这也许会成为一种不错的选择。
现在已有模型在研究这方面了——DIAL模型(虽然是VLA😆)
数据生态
完全机器人数据
质量高,成本大
两种发展方向:
- 开放世界:进入真实世界中
- 深化感知:多种模态深入
人类+机器数据
机器人数据收集工具由人类来操纵
保留了一定的高质量,同时节约了成本
仿真数据
即通过各种方式生成仿真数据
量大,成本低,质量由成本和生成决定
人类数据
即人类自身世界数据(通常需要处理后才能给机器人用)
量大且基本无成本,质量考虑多种因素
数据混合
将数据集构建为多种数据模式混合,与模型训练的各个模块对号入座。
评估
关于评估,我通过AI生成了一张结构导图,方便查询。(绝对不是我在这方面阅读的真的很困难😂)

挑战
架构设计
- 多样化策略:级联流水线、联合扩散骨干网、离散分词方案、隐式表示对齐等多种结构策略
- 耦合机制:世界预测与动作生成耦合
- 多模态发展
- 多级WAM,VLA构建
评估维度
不仅关注视觉真实感,更强调物理意义、强关联性和可执行性。
- 视觉和动作:视觉评估与动作评估关注不同,无法关联
- 状态与动作:世界构建与动作之间因果无法评估
系统性基准
尽管架构多样,但缺乏在同协议下的系统性对比研究。
数据生态
- 非机器人数据:引入人类数据来提升性能
- 知识迁移:人类数据在物理理解、动力学和任务规划中的具体意义
- 无关数据过滤
长程推理
对于跨长时程任务的持续推理能力尚且不足。
预测与构建误差随时间累积,缺乏纠错重规划机制。
算力约束
世界预测带来了严重的延迟,难以满毫秒级响应,导致高质量物理预测与低延迟推理之间的平衡仍然存在问题。
可能可以通过算力分配解决。
安全性
- 监控:将对未来不确定性作为监控指标
- 验证:利用世界预测能力与现实进行验证
还是附上地址吧(综述的地址🤔):这里👋
~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)