具身智能(Embodied AI)技术演进与前沿报告:从 VLA 到 WAM 的范式跃迁
具身智能(Embodied AI)技术演进与前沿报告:从 VLA 到 WAM 的范式跃迁
目录
在具身智能(Embodied AI)与机器人学习领域,技术路线正经历一次从VLA(Vision-Language-Action)向WAM(World Action Model)的重大范式演进。
简而言之:VLA 侧重于“看图听话做动作”(反应式映射),而 WAM 则侧重于“预测未来物理演化,再衍生出精准动作”(预测与因果驱动)。
一、 核心概念定义
1. VLA (Vision-Language-Action Models)
- 定位:以预训练视觉语言大模型(VLM)为 Backbone 的通用机器人策略模型。
- 工作机制:将机器人摄像头图像观测 o t o_t ot 和自然语言指令 l l l 转化为输入 Token,直接输出离散或连续的机器人动作序列 a t a_t at。
- 典型代表:RT-2、OpenVLA、Octo、以及采用 Flow Matching 生成连续动作块的 π 0 \pi_0 π0。
2. WAM (World Action Model)
- 定位:融合“视频/世界模型”与“动作解码”的新一代具身基础模型。
- 工作机制:利用大规模互联网视频预训练获得的时空物理先验(视频生成大模型/视频 Backbone),显式预测环境在交互下的未来演化(视觉帧或 Latent 隐空间),并将其与动作生成绑定在一起。
- 典型代表:NVIDIA Dream Zero、智平方 WAM 0.5、UC Berkeley/加州大学团队提出的 FACT 等。
二、 演进背景:为什么行业正从 VLA 转向 WAM?
VLA 的瓶颈——“接地鸿沟(Grounding Gap)”
传统的 VLA 模型直接拟合 p ( a t ∣ o ≤ t , l ) p(a_t \vert{} o_{\le t}, l) p(at∣o≤t,l),属于反应式策略(Reactive Policy)。它虽然继承了互联网海量图文的语义理解能力,但缺乏对物理世界运行规律(重力、流体、形变、碰撞、摩擦力)的显式建模。模型不知道“动作做完后世界会变成什么样”,导致泛化和精细操作受限。
WAM 的破局思路(先想象,后行动):
- 预训练学习物理物理直觉:视频模型在海量互联网视频中已经学会了重力、反射、浮力与物体交互的时空演化规律(如 Video Backbone)。
- 动作即解释:将动作 a a a 视为“引发未来视觉状态变化的因果解构”。机器人通过预测未来状态 o t + k o_{t+k} ot+k,反推或协同生成最合理的动作序列 a t : t + k a_{t:t+k} at:t+k。
三、 WAM 的主流架构分类 (Taxonomy)
当前 WAM 的最新研究(如 arXiv 2026 最新综述《World Action Models: The Next Frontier in Embodied AI》)将 WAM 划分为两大技术路线:
┌── 级联型 WAM (Cascaded WAM) ──► 先生成未来状态/视频,再解码动作 (Inverse Dynamics)
世界-动作模型 (WAM) ─┤
└── 联合型 WAM (Joint WAM) ──► 建模联合分布 p(o_future, a | o, l),在同一模型内流式生成
- 级联型 WAM (Cascaded WAM):
- 原理:将任务显式拆解为两步 p ( a ∣ o , o future , l ) ⋅ p ( o future ∣ o , l ) p(a\vert{}o, o_{\text{future}}, l) \cdot p(o_{\text{future}}\vert{}o, l) p(a∣o,ofuture,l)⋅p(ofuture∣o,l)。
- 流程:世界模型先根据当前观测与指令生成“未来的视觉画面/隐状态轨迹”,随后策略网络(Policy)基于“当前+未来”的状态对比解算动作(逆动力学 Inverse Dynamics)。
- 联合型 WAM (Joint WAM):
- 原理:紧耦合架构,对未来的环境状态与动作进行联合概率分布建模 p ( o future , a ∣ o , l ) p(o_{\text{future}}, a \vert{} o, l) p(ofuture,a∣o,l)。
- 流程:采用 Autoregressive 或 Diffusion/Flow-matching 多流/单流 Backbone,同时输出图像预测 Token 和连续控制 Action Token,让未来物理约束直接指导动作解码。
四、 VLA vs WAM 核心差异对比
| 维度 | VLA (Vision-Language-Action) | WAM (World Action Model) |
|---|---|---|
| 本质范式 | 语义驱动的反应式策略 ( o → a o \to a o→a) | 物理直觉驱动的预测与控制联合模型 ( o → o future + a o \to o_{\text{future}} + a o→ofuture+a) |
| 主要预训练 Backbones | VLM(如 PaLM, Llama, Qwen-VL 等图文大模型) | Video Foundation Models / 世界模型 (如 Sora 架构、Video DiT) |
| 物理推理能力 | 隐式泛化,易在未见过的复杂物理场景中失效 | 显式预测物理演化,具备常识物理规划与抗干扰“想象”能力 |
| 数据需求侧重 | 极度依赖真机 Teleoperation 遥操作轨迹数据 | 结合人类第一视角视频、无动作视频及神经营养模拟环境 |
| 部署与计算时延 | 推理路径较短,适合端侧高频控制 | 生成未来图像/Latent 带来额外开销,常配合快慢双系统架构部署 |
五、 2026 前沿行业趋势
- 快慢系统结合(Fast-Slow VLA/WAM):慢系统(WAM/VLM)高层理解指令并预演未来状态(如 1–5 Hz),快系统(微型 Control Head / Diffusion Policy)以高频(50–500 Hz)流式生成底层平滑动作。
- “梦境”神经网络仿真 (DreamDojo / Neural Simulator):将视频世界模型直接转化为物理可交互的“神经营养仿真器”,让机器人在虚拟“梦境”中自主试错与进化(如 NVIDIA Dream Zero 路线)。
- 更低成本的数据采集(DexUMI / Egocentric Video):利用人类第一视角外骨骼和随身视频设备采集纯视觉交互数据,填补具身机器人数据缺口。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)