摘要

本文解读 CVPR 2026 论文《Motus: A Unified Latent Action World Model》。该论文提出统一潜在动作世界模型 Motus,通过融合三专家 Mixture-of-Transformers 架构光流潜在动作表示UniDiffuser 式模态时间步调度,让一个网络同时覆盖 VLA、世界模型、IDM、VGM 与联合视频动作预测五种模式,其特别之处在于以共享注意力连接专长模型、以统一运动表示连接异构数据。实验表明在 RoboTwin 2.0 上平均成功率 88.66%(Clean)/ 87.02%(Randomized),相比 X-VLA 提升约 16 个百分点、相比 $\pi_{0.5}$ 提升约 45 个百分点,并在 AC-One 与 Agilex-Aloha-2 双真实平台验证了跨本体泛化,为具身智能的统一世界模型与跨本体学习提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Motus: A Unified Latent Action World Model
标题(中文) 统一潜在动作世界模型:一个模型贯通理解、预测与控制
作者 Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, et al.
机构 清华大学、北京大学、地平线机器人
会议 CVPR 2026
arXiv https://arxiv.org/abs/2512.13030
项目网站 https://motus-robotics.github.io/motus

背景与动机:为什么具身智能需要统一模型?

具身智能的完整决策闭环包含五步:理解场景(对象、空间关系与状态)、解释指令(语言目标落到视觉情境)、预测后果(给定动作推演世界变化)、想象未来(生成可能的任务进程)与输出动作(生成精确连续控制块)。传统做法为每一类能力训练独立模型,其代价在于:独立模型难以共享跨模态先验,也无法闭合感知–行动循环。

Motus 面对两个统一挑战。其一是模型不兼容:VLM、VGM、动作专家结构各不相同,从零训练会丢失互联网规模预训练的通用先验;其二是数据异构:动作空间随机器人本体变化,而海量第一视角视频没有动作标签。相关工作各有缺口:UWM 耦合视频与动作扩散,但从零训练且预训练先验有限;$\mathcal F_1$ 连接 VLA 与 IDM,却未覆盖 WM 与 VGM;Video policy / VLA 分别强调未来视觉或静态视觉–动作映射;Latent action 用重构运动缓解标签稀缺,但 RGB 目标容易混入外观干扰。

从历史脉络看(附录 9.5),这条线从 2018–2019 年 Rybkin、Edwards 等用 IDM + FDM 学习 latent policy 起步;2024 年 Genie 用 latent action 驱动生成式交互环境,LAPO、Moto 推进无动作视频策略预训练;2025 年 LAPA、UniVLA、CoMo 把任务中心或连续运动表示用于机器人学习,也暴露了 RGB 外观干扰与跨本体对齐难题。Motus 的定位是:复用强 VGM/VLM,以光流压缩运动,再由统一调度器切换任务。

统一训练还带来了跨基准泛化收益(附录 D 基准对比表):

基准 $\pi_{0.5}$ X-VLA Motus
LIBERO-Long 97.6 97.6
VLABench ID 0.43 0.48
VLABench Cross-Category 0.22 0.25
AC-One 方块入盘 OOD 28.125 75.0

统一训练保持了跨基准的策略质量,并支持类别迁移与真实 OOD 对象,说明“统一 + 预训练”的路线不牺牲专项能力。

研究主线:从问题到结论

Motus 研究主线流程图:问题、动机、设计、方法、实验到结论

图 10:Motus 研究主线流程图:从五套割裂模型到统一世界模型的完整推理链条(Mermaid 流程图)。

基准/方法设计:三专家 MoT 与统一条件生成

Motus 的核心设计是三专家 Mixture-of-Transformers(MoT):生成专家采用 Wan 2.2 5B,提供视频动态与物理交互先验;理解专家取 Qwen3-VL-2B 最后一层 token,提供 3D grounding、空间理解与目标定位;动作专家与 Wan 同深度,每层含 AdaLN、FFN 与共享注意力。Tri-model Joint Attention 让各专家保留独立 Transformer/FFN,仅把多头注意力上下文拼接,实现跨模态信息交换而不抹平专长——复用强预训练权重,而非从零训练互联网规模统一模型。

Motus 三专家统一架构:生成、动作、理解三专家通过 Tri-model Joint Attention 连接

图 1:Motus 完整架构:生成、动作、理解三专家通过 Tri-model Joint Attention 连接。

五种生成分布共享同一个 Rectified-Flow 目标:

模式 目标分布 作用
VLA $p(a'\mid o,\ell)$ 由视觉语言生成动作
WM $p(o'\mid o,a')$ 预测动作后果
IDM $p(a'\mid o,o')$ 从变化反推动作
VGM $p(o'\mid o,\ell)$ 想象任务未来
Joint $p(o',a'\mid o,\ell)$ 联合生成视频动作

训练目标统一为 $ \mathcal L^\theta = \mathbb E\lVert v_a^\theta - (\epsilon_a - a')\rVert_2^2 + \mathbb E\lVert v_o^\theta - (\epsilon_o - o')\rVert_2^2$,其中时间步 $\tau_a,\tau_o \sim \mathcal U(0,T_\tau)$——视频与动作共享网络,却拥有独立时间步与噪声尺度,这是统一的关键。

分类全景:一个网络的五种模式

Motus 五种推理模式分类树:VLA、WM、IDM、VGM 与 Joint

图 11:Motus 五种推理模式分类树:同一条件生成框架下的 VLA、WM、IDM、VGM 与 Joint(Mermaid 结构图)。

方法细节:模态时间步调度与光流潜在动作

UniDiffuser 式调度把“模式切换”转化为“模态时间步配置”问题:干净模态作为条件,持续噪声模态被边缘化,逐步去噪模态成为输出。五种推理模式只需设置视频时间步 $\tau_o$ 与动作时间步 $\tau_a$(附录 A 完整配置表):

模式 视频 $\tau_o$ 动作 $\tau_a$ 输出
VGM $T\rightarrow0$ 固定 $T$ 视频
WM $T\rightarrow0$ 固定 $0$ 视频
IDM 固定 $0$ $T\rightarrow0$ 动作
VLA 固定 $T$ $T\rightarrow0$ 动作
Joint $T\rightarrow0$ $T\rightarrow0$ 视频+动作

推理时视频与动作采用不同的采样密度:Action-Dense Video-Sparse 配置下,视频 8 帧@5 Hz,动作 48 步@30 Hz。

Action-Dense Video-Sparse 采样配置:视频 8 帧@5 Hz,动作 48 步@30 Hz

图 2:Action-Dense Video-Sparse:视频 8 帧@5 Hz,动作 48 步@30 Hz。

光流作为像素级 Delta Action 是连接无标签运动与可执行控制的桥梁。为何不直接重构 RGB?因为 RGB 同时包含外观、背景与运动,低容量 latent 仍可能编码任务无关纹理。Motus 的做法是:DPFlow 计算相邻帧光流并编码为 RGB flow image;DC-AE 重构像素位移,只保留运动;再用少量真实动作与 task-agnostic 动作把视觉运动空间锚定到控制分布。训练损失为 $ \mathcal L = \mathcal L_{\rm recon} + \lambda_a\lVert a_{\rm real} - a_{\rm pred}\rVert_2^2 + \beta\mathcal L_{\rm KL}$。光流不依赖关节定义,却保留物体与机械臂共享的运动结构,因此天然是跨本体桥梁

潜在动作 VAE:完整光流重构与动作对齐路径

图 3:潜在动作 VAE:完整光流重构与动作对齐路径。

表示路径上,光流经 DC-AE 得到 $4\times512$ 个 token,再由轻量编码器压成 14D 潜在动作。数据配比上约 90% 无标签 + 10% 有标签:自监督重构吸收具身相关视频运动,机器人示范和 task-agnostic 交互提供弱动作监督。三阶段训练(附录 A 训练计算表)依次为:Stage 1 用多机器人轨迹与人类视频继续预训练 VGM;Stage 2 冻结 VLM,以视频、语言、潜在动作联合训练;Stage 3 在目标机器人真实动作本体上微调。规模上总参数约 8B:VGM 5.00B、VLM 2.13B、动作专家 641.5M、理解专家 253.5M,Flow Matching 推理 10 步:

阶段 Batch Learning rate GPU hours
Stage 1 256 $8\times10^{-5}$ $\sim8000$
Stage 2 256 $5\times10^{-5}$ $\sim10000$
Stage 3 256 $1!\sim!5\times10^{-5}$ $\sim400$

数据侧,六层数据金字塔从 Web 数据、第一视角、仿真、task-agnostic、多机器人直到目标机器人数据逐层收窄,让预训练先验逐步落到目标本体分布。

六层数据金字塔:Web、第一视角、仿真、task-agnostic、多机器人与目标机器人数据

图 4:六层数据金字塔:Web、第一视角、仿真、task-agnostic、多机器人与目标机器人数据。

设计原则上(附录 9.4),P5 强调统一跨模态表示:三专家 MoT 对齐视频、语言、动作,时间步配置让同一参数化表达边缘、条件与联合分布;P7 强调自监督信号:光流潜在动作把 90% 无标签具身视频转为运动监督,10% 标注轨迹对齐控制,VGM/VLM 复用 Web 预训练先验。

实验设计与结果:仿真、真实平台与跨基准评测

RoboTwin 2.0 评测协议:50 个代表性任务,Clean 2,500 条示范、Randomized 25,000 条示范;Clean 每任务 50 条,Randomized 每任务 500 条并含背景、杂物、桌高、光照扰动;所有模型从各自 checkpoint 出发,仅允许 40k 次微调;每任务执行 100 次,分别报告 Clean / Randomized 成功率,采用单模型、多任务联合训练,直接考察预训练与分布偏移泛化。

AC-One 与 Agilex-Aloha-2 真实任务:空间理解、柔性操作、液体控制、视觉理解与长程规划

图 5:AC-One 与 Agilex-Aloha-2:空间理解、柔性操作、液体控制、视觉理解与长程规划;按 Partial Success Rate 评测。

仿真结果(50 任务平均成功率)

方法 Clean(%) Randomized(%)
$\pi_{0.5}$ 42.98 43.84
X-VLA 72.80 72.84
Motus 88.66 87.02

精确表值显示 Motus 在 Clean 提升 +15.86、Randomized 提升 +14.18(均相对 X-VLA),相对 $\pi_{0.5}$ 的 Randomized 提升 +43.18;论文正文使用约 $+15/+45$ 个百分点的概括,且随机化优势接近 Clean。

真实机器人(双平台 Partial Success Rate)

平台 $\pi_{0.5}$ w/o Pretrain Motus
AC-One(9 任务) 14.79 25.86 63.22
Agilex-Aloha-2(5 任务) 48.60 26.60 59.30

细项上,AC-One 方块入盘 100、磨咖啡豆 92、OOD 方块入盘 75;Aloha-2 饮水机取水 96、按指定键 80,每任务 100 条训练轨迹。平均分双平台领先,但 Aloha-2“面包入烤箱”34,低于 $\pi_{0.5}$ 的 36。长程任务按完成子目标计分,完整成功得满分。

五模式各自的证据(一个网络确实服务五种模式):

模式 证据 结论
VGM 双平台条件视频 想象未来
WM FID/FVD/SSIM 等 预测动作后果
IDM 动作 MSE 0.014 优于专训 IDM
VLA Randomized 83.90 直接控制
Joint Randomized 87.02 联合预测增益

Joint 模式(87.02)高于单独 VLA 模式(83.90),说明联合预测带来真实增益(附录 9.4 执行支撑:RoboTwin Randomized 87.02、LIBERO-Long 97.6、真实 OOD 75.0,且 Stage 2 消融优于无预训练与仅视频预训练)。

消融验证预训练配方:完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1。

RoboTwin Randomized 消融:完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1

图 6:RoboTwin Randomized 消融:完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1。

定性案例:九项真实任务执行序列覆盖两类双臂机器人;VGM 模式还能在 Agilex-Aloha-2 上生成与指令一致的条件未来视频,IDM 反推动作 MSE 低至 0.014。

两类双臂机器人九项真实任务执行序列

图 7:两类双臂机器人九项真实任务执行序列;完整保留全部时间步与面板。

VGM 模式在 Agilex-Aloha-2 上的条件视频生成

图 8:VGM 模式在 Agilex-Aloha-2 上的条件视频生成;完整保留输入、语言与全部未来帧。

IDM MSE 与 RoboTwin VLA/Joint 成功率

图 9:IDM MSE 0.014;RoboTwin Randomized 上 VLA / Joint 成功率 83.90 / 87.02。

世界模型质量(附录 D,双平台平均):

指标 数值
FID $\downarrow$ 11.209
FVD $\downarrow$ 61.20865
SSIM $\uparrow$ 0.8661
LPIPS $\downarrow$ 0.063645
PSNR $\uparrow$ 25.0700

结果对比总结

Motus 仿真与真实平台结果对比:π0.5、X-VLA 到 Motus 的成功率提升

图 12:仿真与真实平台结果对比总结:从 π0.5 到 Motus 的成功率提升路径(Mermaid 流程图)。

关键发现

  • 一个网络贯通五模式:RoboTwin 2.0 上 Motus 平均成功率 88.66%(Clean)/ 87.02%(Randomized),比 X-VLA 高 15.86 / 14.18 个百分点,比 $\pi_{0.5}$ 高 43.18 个百分点(Randomized)。
  • 双真实平台验证跨本体泛化:AC-One(9 任务)Partial Success Rate 63.22,远超无预训练基线的 25.86 与 $\pi_{0.5}$ 的 14.79;Aloha-2(5 任务)59.30,超过 $\pi_{0.5}$ 的 48.60。
  • 联合预测带来真实增益:Joint 模式 Randomized 成功率 87.02,高于单独 VLA 模式的 83.90;IDM 动作 MSE 仅 0.014,优于专训 IDM。
  • 90% 无标签数据被转化为运动监督:光流潜在动作 + 三阶段训练中,完整 Stage 2 预训练优于无预训练与仅 Stage 1 视频预训练。
  • 跨基准与 OOD 泛化:LIBERO-Long 97.6、VLABench ID 0.48(对比 $\pi_{0.5}$ 0.43)、真实 OOD 方块入盘 75.0(对比 28.125)。
  • 世界模型质量扎实:双平台 FID 11.209、FVD 61.21、PSNR 25.07,配合 8B 参数与 10 步 Flow Matching 推理,验证生成先验在统一架构中没有被削弱。

局限性

论文陈述的边界包括:结论未列显式失败案例;未来工作反向指出三方面仍有限——互联网规模潜在动作(从通用视频学习,当前尚未完成)、更普适运动先验(覆盖更复杂接触与更大本体差异)、更强统一架构(提升跨专家协同并降低功能干扰)。此外,同网可用不等于所有模式都达到专用模型的全域最优,Aloha-2“面包入烤箱”34 分低于 $\pi_{0.5}$ 的 36 分即是实例。总体判断:Motus 证明“统一 + 预训练”可行,尚需扩展为互联网规模的跨本体基础设施。

常见问题(FAQ)

Motus 是什么?

Motus 是 CVPR 2026 提出的统一潜在动作世界模型:一个三专家 MoT 网络同时覆盖 VLA、世界模型(WM)、逆向动态模型(IDM)、视频生成模型(VGM)与视频–动作联合预测五种模式,总参数约 8B。

一个网络如何切换五种模式?

通过 UniDiffuser 式独立模态时间步调度:视频时间步 $\tau_o$ 与动作时间步 $\tau_a$ 的不同配置($T\rightarrow0$ 去噪、固定 $T$ 保持、固定 $0$ 条件)决定输出是视频、动作还是联合结果,模式切换被转化为模态时间步配置问题。

光流潜在动作解决了什么问题?

它把相邻帧光流经 DC-AE 压缩为 14D 潜在动作,只保留运动、剔除外观干扰,从而把约 90% 无标签具身视频转化为运动监督,并用少量真实动作把视觉运动空间锚定到控制分布,成为跨本体桥梁。

Motus 在 RoboTwin 2.0 上表现如何?

50 任务平均成功率 88.66%(Clean)/ 87.02%(Randomized),相比 X-VLA 提升约 16 个百分点、相比 $\pi_{0.5}$ 提升约 45 个百分点,且仅允许 40k 次微调。

真实机器人上的表现如何?

AC-One(9 任务)Partial Success Rate 63.22、Agilex-Aloha-2(5 任务)59.30,均领先 $\pi_{0.5}$ 与无预训练基线;长程任务按完成子目标计分。

Motus 与 UWM、$\mathcal F_1$ 的区别?

UWM 耦合视频与动作扩散但从零训练、预训练先验有限,$\mathcal F_1$ 未覆盖 WM 与 VGM;Motus 复用强 VGM/VLM 预训练权重,以光流作为跨本体运动表示,并通过统一调度器覆盖全部五种生成分布。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐