世界模型之Faster-WAM详解:不让机器人“忘掉未来”——怎样把世界表征留在推理期,又把延迟降到一半以下
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
World Action Model(WAM)希望机器人在出动作前,不只看见当下,还能利用“物体接下来可能怎样变化”的内部表征。困难在于:若每一步动作去噪都与未来视频分支联合更新,鲁棒性可能更好,但推理成本很高;若部署时彻底删掉未来分支,速度上来了,面对光照、相机、背景等分布变化时又容易失去时间线索。
Faster-WAM 的立场很明确:未来表征不应只作为训练损失,它在推理期仍是鲁棒控制的条件信息。 它不再逐步生成完整未来视频,而是在高噪声未来 latent 上让视频专家只跑一次,缓存各层的 K/V 表征;动作专家在 10 步 flow matching 积分中复用这份缓存,并只在少数层读取它。
两项实现支撑这个折中:SparseMoT 把跨分支注意力限制在间隔层;Interval KV-Fusion 将一个间隔内多层视频 K/V 融合成同长度的一对 K/V,不拉长注意力序列。论文在 LIBERO-Plus 上报告 73.57% OOD 成功率,相比 Fast-WAM 的 49.14% 高出 24.43 个百分点;在 NVIDIA L20 的受控延迟测量里为 252.95 ms,是 Joint-WAM 的 2.21 倍加速。论文原文
猫先生认为,Faster-WAM 的价值不在于“再生成一段视频”,而在于把视频模型中已经包含的未来感知 K/V 当作可复用的控制记忆:保留它,但严格控制它被读取的频率。
- 论文标题:Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models
- 论文地址:https://arxiv.org/abs/2608.04404
原文脉络
文章依次完成四件事:先用同一实现下的 Joint-WAM 与 Fast-WAM 对比说明,推理期删除未来条件会显著伤害 OOD;随后回顾 VLA 与 WAM 的两条路线;方法部分提出一次性未来条件、SparseMoT、Interval KV-Fusion 与联合 flow matching;实验则覆盖 LIBERO、RoboTwin 2.0、LIBERO-Plus、真实双臂任务、延迟分解和消融。
1-2. 背景与相关工作:未来视觉到底该不该留到部署时
常规 VLA 主要把当前图像、语言和本体状态映射为动作。WAM 额外建模交互后的视觉演化,因此动作分支可以借助时间结构。现有路线在部署时形成了两端:Joint-WAM 在每一次去噪里联合更新未来视频与动作,信息最充分,却反复支付视频计算与跨分支注意力;Fast-WAM 则将未来建模留在训练期,部署时不再放入未来 temporal slots,延迟更低。
论文的 Figure 1 不是装饰性的总览,而是整篇文章的出发证据。在标准分布内,三种模型差距很小;到分布外,去掉未来条件的 Fast-WAM 明显下滑。Faster-WAM 由此选择第三条路:未来表征仍在场,但不再以“每步都重新联合去噪”的形式在场。

图 1:标准分布内、分布外成功率和推理延迟的并列对比。Fast-WAM 用删除未来条件换取效率,却在 OOD 上损失明显;来源:论文 Figure 1。
这份对比支持的是一个受控结论:在作者统一的视频骨干、数据、tokenization 和动作采样设定中,未来条件的保留与 OOD 鲁棒性相关。它并不证明任何未来生成都必然有用,更不等于已建立所有 WAM 的普适因果结论。
3. 方法:一次视频前向,供多步动作去噪反复读取
3.1 整体框架:把联合生成改成可缓存的条件接口
在控制时刻 t t t,策略输入图像 o t o_t ot、语言 l l l、本体状态 s t s_t st,输出长度为 H H H 的动作块 A t A_t At。视频专家来自 Wan2.2-5B 的 Video DiT,动作专家是 30 层、隐藏维度 1024 的 Transformer;语言和本体状态同时作为两边条件。视觉序列有 9 帧,动作块有 32 个动作。
关键约束是非对称信息流:未来视频 slot 可以读取当前帧锚点和其他未来 slot;当前帧锚点不能读取未来 slot。动作 query 可读取视频特征,视频 query 不读取动作 token。于是视频侧的层级 K/V 与不断变化的动作轨迹无关,可以在动作积分前构造一次。

图 2:左侧为视频专家、Interval KV-Fusion 与动作专家组成的 Faster-WAM;右侧对比 Joint-WAM 的 N N N 次密集联合更新,以及 Faster-WAM 的一次 K/V 缓存加 N N N 次稀疏条件动作更新;来源:论文 Figure 2。
在部署时,作者把未来视频 slot 初始化为高斯噪声,在视频 flow 时间 τ v = 1 \tau_v=1 τv=1 仅执行一次视频专家,收集每层注意力 K/V;之后不再更新、更不解码这些未来视频 latent。它们被压成动作可读的未来条件接口 C ^ t , 1 v \hat C^v_{t,1} C^t,1v。
猫先生认为,这套设计有一个很实用的判断:控制不一定需要像素级未来视频,可能只需要生成器在“推断未来”时形成的中间状态。 这也解释了为什么缓存对象选 K/V,而不是将预测帧再编码回动作网络。
3.2 SparseMoT:让所有动作层工作,但只让少数层跨分支通信
普通 Mixture-of-Transformers(MoT)会在 L L L 个对齐的视频—动作层全部做跨分支注意力。Faster-WAM 选择一个交互集合:
J = { j 1 , … , j M } ⊆ { 1 , … , L } 。 \mathcal{J}=\{j_1,\ldots,j_M\}\subseteq\{1,\ldots,L\}。 J={j1,…,jM}⊆{1,…,L}。
只有 j m ∈ J j_m\in\mathcal{J} jm∈J 的动作层读取融合后的未来 K/V;其余层保留动作 self-attention、残差和前馈更新,用动作状态传递先前注入的未来信息。论文采用 30 层动作网络、每 4 层交互一次,即 M = 8 M=8 M=8,而非让 30 层都做跨分支读取。
这一点很容易被误读成“跳过了动作层”。实际被稀疏化的是昂贵的video-action interaction,不是动作专家的深度计算。所有动作层仍参与去噪,只是中间层做较轻的 action-only refinement。
3.3 Interval KV-Fusion:不增加注意力长度地保留多深度未来信息
如果稀疏交互层只读取自己同深度的视频 K/V,中间视频层的信息会丢失;若直接串接一个间隔的所有 K/V,又会把 action attention 的上下文加长。Interval KV-Fusion 对每个交互层分配前一个深度区间 I m I_m Im,以 softmax 归一化权重将该区间 K/V 加权为一对同形状 K/V:
( K ˉ j m v , V ˉ j m v ) = ∑ j ∈ I m W m , j fuse ( K j v , V j v ) 。 (\bar K^v_{j_m},\bar V^v_{j_m})= \sum_{j\in I_m}W^{\text{fuse}}_{m,j}(K^v_j,V^v_j)。 (Kˉjmv,Vˉjmv)=j∈Im∑Wm,jfuse(Kjv,Vjv)。
融合后,动作层读取的 token 长度仍等于一个视频层的长度,却获得了多个深度阶段的摘要。SparseMoT 决定“何时读”,KV-Fusion 决定“每次读到哪个深度区间的内容”,两者针对的是不同的效率损失。
3.4 联合训练与推理:两个 flow 时间独立采样
视频 latent 和动作都采用 flow matching。训练时分别采样视频和动作时间 τ v , τ a \tau_v,\tau_a τv,τa:
Z t , τ v = ( 1 − τ v ) Z t + τ v ϵ t v , A t , τ a = ( 1 − τ a ) A t + τ a ϵ t a 。 Z_{t,\tau_v}=(1-\tau_v)Z_t+\tau_v\epsilon_t^v, \qquad A_{t,\tau_a}=(1-\tau_a)A_t+\tau_a\epsilon_t^a。 Zt,τv=(1−τv)Zt+τvϵtv,At,τa=(1−τa)At+τaϵta。
总损失是视频与动作两个、带时间权重的 MSE flow loss 之和。两个时间独立采样,使动作网络在各种“视频噪声程度 × 动作噪声程度”的组合下学习使用未来条件。测试阶段用 10 次积分和 guidance scale 1.0;缓存只构造一次,随后供每个动作 flow step 重用。
4. 实验:把“更快”拆成鲁棒性与延迟两项证据
4.1 标准基准:LIBERO 与 RoboTwin 2.0
LIBERO 四个任务族上,Faster-WAM 平均成功率为 99.0%,高于受控的 Joint-WAM(98.5%)和 Fast-WAM(97.6%)。RoboTwin 2.0 的 clean / randomized 平均为 92.6%,也略高于 Fast-WAM 的 91.9%。这些分数接近饱和,因而更重要的问题转到分布变化时是否仍能保持优势。
LIBERO-Plus 直接对在 LIBERO 训练的策略施加 7 类未见变化:相机、机器人初始状态、语言、光照、背景、传感器噪声和布局。Faster-WAM 的均值为 73.57%;Joint-WAM 为 66.27%,Fast-WAM 为 49.14%。作者还训练了结构相同、但不含显式 future temporal slots 的 C-O Faster-WAM,均值仅 51.00%。这组消融比“Faster-WAM 比 Fast-WAM 高”更有针对性:它将未来条件的贡献从架构差异中部分剥离出来。
4.2 真实双臂任务:常规成功率与 OOD 变化
真实平台使用两台 Piper 6-DoF 机械臂,覆盖 Pick Strawberries、Build Tower、Store Boxes、Stack Plates,每个任务 400 条示范。常规条件下 Faster-WAM 四项平均成功率为 95.8%,高于 Joint-WAM 的 90.8% 和 Fast-WAM 的 88.3%。

图 3:四个真实双臂操作任务的成功率;绿色 Faster-WAM 在四项任务均最高;来源:论文 Figure 3。
Pick Strawberries 的 OOD 设置进一步更换背景、改变光照、加入未见干扰物。Fast-WAM 从标准条件的 96.7% 降到三种未见条件平均 45.6%;Joint-WAM 为 55.6%;Faster-WAM 达到 71.1%。这与 LIBERO-Plus 的方向一致,但样本规模、置信区间与显著性检验没有在论文中展开,不能仅凭柱图将差距外推到所有真实操作场景。

图 4:同一抓草莓任务在标准、背景变化、光照变化和未见干扰物下的成功率;来源:论文 Figure 4。
4.3 延迟与组件消融:稀疏不是越少越好
作者在 NVIDIA L20、224×448 输入、10 步去噪下报告:Joint-WAM 总延迟 559.84 ms,Fast-WAM 320.97 ms,Faster-WAM 252.95 ms。Faster-WAM 的一次视觉上下文构建确实更慢(43.04 ms 对 27.67 ms),但动作去噪部分从 276.56 ms 降到 192.11 ms,抵消了前者。
消融也排除了一个直觉误区:不是交互越稀疏越好。密集交互(stride 1)在 LIBERO-Plus 为 69.78%,stride 2 为 71.65%,stride 4 为 73.57%,再稀疏到 stride 7 / 14 又分别降至 71.05% / 70.05%。因此论文更准确的结论是:未来上下文需要被多次注入,但频率存在任务与架构相关的甜点区。
5. 讨论、局限与可复现性
Faster-WAM 依赖一个很大的视频生成先验(Wan2.2-5B)以及 30 层动作专家。论文报告了端到端延迟,却没有给出显存、吞吐、能耗、不同 GPU 或不同动作积分步数下的完整成本曲线;“更快”应理解为给定 L20 与 10 步设定下对两种受控基线的结果。
此外,作者在真实机器人上展示了四个任务和若干变化条件,证据很有价值,但覆盖面仍有限。SparseMoT 的交互层位置由固定 stride 决定,论文也把“学习式选择交互层”列为后续方向。公开的 arXiv v1 页面仅标注 hustvl/FasterWAM 为 Code & Models,未给出可核验的公开仓库链接;复现实验前仍需等待代码、模型权重及完整训练配置。
总结:未来条件该保留,但不必逐帧生成
Faster-WAM 把 WAM 的工程矛盾转成了接口设计:
- 未来表征留在推理期,以应对分布变化时当前观测难以解释的时序不确定性;
- 一次视频前向形成可复用 K/V 缓存,避免每个动作去噪步都重跑视频分支;
- SparseMoT 与 Interval KV-Fusion 分别控制读取频率和读取内容,在 OOD 成功率与延迟之间找到中等稀疏度的折中。
如果只记住一句话:世界模型对控制的作用未必是输出一段可观看的未来视频;更可能是向动作模型提供一份在推理期仍可访问、且能被高效复用的未来上下文。
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)