【CVPR 2026】Motus:一个模型贯通理解、预测与控制|从统一世界模型架构视角
摘要
本文解读 CVPR 2026 论文《Motus: A Unified Latent Action World Model》。该论文提出统一潜在动作世界模型 Motus,通过融合三专家 Mixture-of-Transformers 架构、光流潜在动作表示与UniDiffuser 式模态时间步调度,让一个网络同时覆盖 VLA、世界模型、IDM、VGM 与联合视频动作预测五种模式,其特别之处在于以共享注意力连接专长模型、以统一运动表示连接异构数据。实验表明在 RoboTwin 2.0 上平均成功率 88.66%(Clean)/ 87.02%(Randomized),相比 X-VLA 提升约 16 个百分点、相比 $\pi_{0.5}$ 提升约 45 个百分点,并在 AC-One 与 Agilex-Aloha-2 双真实平台验证了跨本体泛化,为具身智能的统一世界模型与跨本体学习提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Motus: A Unified Latent Action World Model |
| 标题(中文) | 统一潜在动作世界模型:一个模型贯通理解、预测与控制 |
| 作者 | Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, et al. |
| 机构 | 清华大学、北京大学、地平线机器人 |
| 会议 | CVPR 2026 |
| arXiv | https://arxiv.org/abs/2512.13030 |
| 项目网站 | https://motus-robotics.github.io/motus |
背景与动机:为什么具身智能需要统一模型?
具身智能的完整决策闭环包含五步:理解场景(对象、空间关系与状态)、解释指令(语言目标落到视觉情境)、预测后果(给定动作推演世界变化)、想象未来(生成可能的任务进程)与输出动作(生成精确连续控制块)。传统做法为每一类能力训练独立模型,其代价在于:独立模型难以共享跨模态先验,也无法闭合感知–行动循环。
Motus 面对两个统一挑战。其一是模型不兼容:VLM、VGM、动作专家结构各不相同,从零训练会丢失互联网规模预训练的通用先验;其二是数据异构:动作空间随机器人本体变化,而海量第一视角视频没有动作标签。相关工作各有缺口:UWM 耦合视频与动作扩散,但从零训练且预训练先验有限;$\mathcal F_1$ 连接 VLA 与 IDM,却未覆盖 WM 与 VGM;Video policy / VLA 分别强调未来视觉或静态视觉–动作映射;Latent action 用重构运动缓解标签稀缺,但 RGB 目标容易混入外观干扰。
从历史脉络看(附录 9.5),这条线从 2018–2019 年 Rybkin、Edwards 等用 IDM + FDM 学习 latent policy 起步;2024 年 Genie 用 latent action 驱动生成式交互环境,LAPO、Moto 推进无动作视频策略预训练;2025 年 LAPA、UniVLA、CoMo 把任务中心或连续运动表示用于机器人学习,也暴露了 RGB 外观干扰与跨本体对齐难题。Motus 的定位是:复用强 VGM/VLM,以光流压缩运动,再由统一调度器切换任务。
统一训练还带来了跨基准泛化收益(附录 D 基准对比表):
| 基准 | $\pi_{0.5}$ | X-VLA | Motus |
|---|---|---|---|
| LIBERO-Long | — | 97.6 | 97.6 |
| VLABench ID | 0.43 | — | 0.48 |
| VLABench Cross-Category | 0.22 | — | 0.25 |
| AC-One 方块入盘 OOD | 28.125 | — | 75.0 |
统一训练保持了跨基准的策略质量,并支持类别迁移与真实 OOD 对象,说明“统一 + 预训练”的路线不牺牲专项能力。
研究主线:从问题到结论

图 10:Motus 研究主线流程图:从五套割裂模型到统一世界模型的完整推理链条(Mermaid 流程图)。
基准/方法设计:三专家 MoT 与统一条件生成
Motus 的核心设计是三专家 Mixture-of-Transformers(MoT):生成专家采用 Wan 2.2 5B,提供视频动态与物理交互先验;理解专家取 Qwen3-VL-2B 最后一层 token,提供 3D grounding、空间理解与目标定位;动作专家与 Wan 同深度,每层含 AdaLN、FFN 与共享注意力。Tri-model Joint Attention 让各专家保留独立 Transformer/FFN,仅把多头注意力上下文拼接,实现跨模态信息交换而不抹平专长——复用强预训练权重,而非从零训练互联网规模统一模型。

图 1:Motus 完整架构:生成、动作、理解三专家通过 Tri-model Joint Attention 连接。
五种生成分布共享同一个 Rectified-Flow 目标:
| 模式 | 目标分布 | 作用 |
|---|---|---|
| VLA | $p(a'\mid o,\ell)$ | 由视觉语言生成动作 |
| WM | $p(o'\mid o,a')$ | 预测动作后果 |
| IDM | $p(a'\mid o,o')$ | 从变化反推动作 |
| VGM | $p(o'\mid o,\ell)$ | 想象任务未来 |
| Joint | $p(o',a'\mid o,\ell)$ | 联合生成视频动作 |
训练目标统一为 $ \mathcal L^\theta = \mathbb E\lVert v_a^\theta - (\epsilon_a - a')\rVert_2^2 + \mathbb E\lVert v_o^\theta - (\epsilon_o - o')\rVert_2^2$,其中时间步 $\tau_a,\tau_o \sim \mathcal U(0,T_\tau)$——视频与动作共享网络,却拥有独立时间步与噪声尺度,这是统一的关键。
分类全景:一个网络的五种模式

图 11:Motus 五种推理模式分类树:同一条件生成框架下的 VLA、WM、IDM、VGM 与 Joint(Mermaid 结构图)。
方法细节:模态时间步调度与光流潜在动作
UniDiffuser 式调度把“模式切换”转化为“模态时间步配置”问题:干净模态作为条件,持续噪声模态被边缘化,逐步去噪模态成为输出。五种推理模式只需设置视频时间步 $\tau_o$ 与动作时间步 $\tau_a$(附录 A 完整配置表):
| 模式 | 视频 $\tau_o$ | 动作 $\tau_a$ | 输出 |
|---|---|---|---|
| VGM | $T\rightarrow0$ | 固定 $T$ | 视频 |
| WM | $T\rightarrow0$ | 固定 $0$ | 视频 |
| IDM | 固定 $0$ | $T\rightarrow0$ | 动作 |
| VLA | 固定 $T$ | $T\rightarrow0$ | 动作 |
| Joint | $T\rightarrow0$ | $T\rightarrow0$ | 视频+动作 |
推理时视频与动作采用不同的采样密度:Action-Dense Video-Sparse 配置下,视频 8 帧@5 Hz,动作 48 步@30 Hz。

图 2:Action-Dense Video-Sparse:视频 8 帧@5 Hz,动作 48 步@30 Hz。
光流作为像素级 Delta Action 是连接无标签运动与可执行控制的桥梁。为何不直接重构 RGB?因为 RGB 同时包含外观、背景与运动,低容量 latent 仍可能编码任务无关纹理。Motus 的做法是:DPFlow 计算相邻帧光流并编码为 RGB flow image;DC-AE 重构像素位移,只保留运动;再用少量真实动作与 task-agnostic 动作把视觉运动空间锚定到控制分布。训练损失为 $ \mathcal L = \mathcal L_{\rm recon} + \lambda_a\lVert a_{\rm real} - a_{\rm pred}\rVert_2^2 + \beta\mathcal L_{\rm KL}$。光流不依赖关节定义,却保留物体与机械臂共享的运动结构,因此天然是跨本体桥梁。

图 3:潜在动作 VAE:完整光流重构与动作对齐路径。
表示路径上,光流经 DC-AE 得到 $4\times512$ 个 token,再由轻量编码器压成 14D 潜在动作。数据配比上约 90% 无标签 + 10% 有标签:自监督重构吸收具身相关视频运动,机器人示范和 task-agnostic 交互提供弱动作监督。三阶段训练(附录 A 训练计算表)依次为:Stage 1 用多机器人轨迹与人类视频继续预训练 VGM;Stage 2 冻结 VLM,以视频、语言、潜在动作联合训练;Stage 3 在目标机器人真实动作本体上微调。规模上总参数约 8B:VGM 5.00B、VLM 2.13B、动作专家 641.5M、理解专家 253.5M,Flow Matching 推理 10 步:
| 阶段 | Batch | Learning rate | GPU hours |
|---|---|---|---|
| Stage 1 | 256 | $8\times10^{-5}$ | $\sim8000$ |
| Stage 2 | 256 | $5\times10^{-5}$ | $\sim10000$ |
| Stage 3 | 256 | $1!\sim!5\times10^{-5}$ | $\sim400$ |
数据侧,六层数据金字塔从 Web 数据、第一视角、仿真、task-agnostic、多机器人直到目标机器人数据逐层收窄,让预训练先验逐步落到目标本体分布。

图 4:六层数据金字塔:Web、第一视角、仿真、task-agnostic、多机器人与目标机器人数据。
设计原则上(附录 9.4),P5 强调统一跨模态表示:三专家 MoT 对齐视频、语言、动作,时间步配置让同一参数化表达边缘、条件与联合分布;P7 强调自监督信号:光流潜在动作把 90% 无标签具身视频转为运动监督,10% 标注轨迹对齐控制,VGM/VLM 复用 Web 预训练先验。
实验设计与结果:仿真、真实平台与跨基准评测
RoboTwin 2.0 评测协议:50 个代表性任务,Clean 2,500 条示范、Randomized 25,000 条示范;Clean 每任务 50 条,Randomized 每任务 500 条并含背景、杂物、桌高、光照扰动;所有模型从各自 checkpoint 出发,仅允许 40k 次微调;每任务执行 100 次,分别报告 Clean / Randomized 成功率,采用单模型、多任务联合训练,直接考察预训练与分布偏移泛化。

图 5:AC-One 与 Agilex-Aloha-2:空间理解、柔性操作、液体控制、视觉理解与长程规划;按 Partial Success Rate 评测。
仿真结果(50 任务平均成功率):
| 方法 | Clean(%) | Randomized(%) |
|---|---|---|
| $\pi_{0.5}$ | 42.98 | 43.84 |
| X-VLA | 72.80 | 72.84 |
| Motus | 88.66 | 87.02 |
精确表值显示 Motus 在 Clean 提升 +15.86、Randomized 提升 +14.18(均相对 X-VLA),相对 $\pi_{0.5}$ 的 Randomized 提升 +43.18;论文正文使用约 $+15/+45$ 个百分点的概括,且随机化优势接近 Clean。
真实机器人(双平台 Partial Success Rate):
| 平台 | $\pi_{0.5}$ | w/o Pretrain | Motus |
|---|---|---|---|
| AC-One(9 任务) | 14.79 | 25.86 | 63.22 |
| Agilex-Aloha-2(5 任务) | 48.60 | 26.60 | 59.30 |
细项上,AC-One 方块入盘 100、磨咖啡豆 92、OOD 方块入盘 75;Aloha-2 饮水机取水 96、按指定键 80,每任务 100 条训练轨迹。平均分双平台领先,但 Aloha-2“面包入烤箱”34,低于 $\pi_{0.5}$ 的 36。长程任务按完成子目标计分,完整成功得满分。
五模式各自的证据(一个网络确实服务五种模式):
| 模式 | 证据 | 结论 |
|---|---|---|
| VGM | 双平台条件视频 | 想象未来 |
| WM | FID/FVD/SSIM 等 | 预测动作后果 |
| IDM | 动作 MSE 0.014 | 优于专训 IDM |
| VLA | Randomized 83.90 | 直接控制 |
| Joint | Randomized 87.02 | 联合预测增益 |
Joint 模式(87.02)高于单独 VLA 模式(83.90),说明联合预测带来真实增益(附录 9.4 执行支撑:RoboTwin Randomized 87.02、LIBERO-Long 97.6、真实 OOD 75.0,且 Stage 2 消融优于无预训练与仅视频预训练)。
消融验证预训练配方:完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1。

图 6:RoboTwin Randomized 消融:完整 Stage 2 潜在动作预训练优于无预训练与仅 Stage 1。
定性案例:九项真实任务执行序列覆盖两类双臂机器人;VGM 模式还能在 Agilex-Aloha-2 上生成与指令一致的条件未来视频,IDM 反推动作 MSE 低至 0.014。

图 7:两类双臂机器人九项真实任务执行序列;完整保留全部时间步与面板。

图 8:VGM 模式在 Agilex-Aloha-2 上的条件视频生成;完整保留输入、语言与全部未来帧。

图 9:IDM MSE 0.014;RoboTwin Randomized 上 VLA / Joint 成功率 83.90 / 87.02。
世界模型质量(附录 D,双平台平均):
| 指标 | 数值 |
|---|---|
| FID $\downarrow$ | 11.209 |
| FVD $\downarrow$ | 61.20865 |
| SSIM $\uparrow$ | 0.8661 |
| LPIPS $\downarrow$ | 0.063645 |
| PSNR $\uparrow$ | 25.0700 |
结果对比总结

图 12:仿真与真实平台结果对比总结:从 π0.5 到 Motus 的成功率提升路径(Mermaid 流程图)。
关键发现
- 一个网络贯通五模式:RoboTwin 2.0 上 Motus 平均成功率 88.66%(Clean)/ 87.02%(Randomized),比 X-VLA 高 15.86 / 14.18 个百分点,比 $\pi_{0.5}$ 高 43.18 个百分点(Randomized)。
- 双真实平台验证跨本体泛化:AC-One(9 任务)Partial Success Rate 63.22,远超无预训练基线的 25.86 与 $\pi_{0.5}$ 的 14.79;Aloha-2(5 任务)59.30,超过 $\pi_{0.5}$ 的 48.60。
- 联合预测带来真实增益:Joint 模式 Randomized 成功率 87.02,高于单独 VLA 模式的 83.90;IDM 动作 MSE 仅 0.014,优于专训 IDM。
- 90% 无标签数据被转化为运动监督:光流潜在动作 + 三阶段训练中,完整 Stage 2 预训练优于无预训练与仅 Stage 1 视频预训练。
- 跨基准与 OOD 泛化:LIBERO-Long 97.6、VLABench ID 0.48(对比 $\pi_{0.5}$ 0.43)、真实 OOD 方块入盘 75.0(对比 28.125)。
- 世界模型质量扎实:双平台 FID 11.209、FVD 61.21、PSNR 25.07,配合 8B 参数与 10 步 Flow Matching 推理,验证生成先验在统一架构中没有被削弱。
局限性
论文陈述的边界包括:结论未列显式失败案例;未来工作反向指出三方面仍有限——互联网规模潜在动作(从通用视频学习,当前尚未完成)、更普适运动先验(覆盖更复杂接触与更大本体差异)、更强统一架构(提升跨专家协同并降低功能干扰)。此外,同网可用不等于所有模式都达到专用模型的全域最优,Aloha-2“面包入烤箱”34 分低于 $\pi_{0.5}$ 的 36 分即是实例。总体判断:Motus 证明“统一 + 预训练”可行,尚需扩展为互联网规模的跨本体基础设施。
常见问题(FAQ)
Motus 是什么?
Motus 是 CVPR 2026 提出的统一潜在动作世界模型:一个三专家 MoT 网络同时覆盖 VLA、世界模型(WM)、逆向动态模型(IDM)、视频生成模型(VGM)与视频–动作联合预测五种模式,总参数约 8B。
一个网络如何切换五种模式?
通过 UniDiffuser 式独立模态时间步调度:视频时间步 $\tau_o$ 与动作时间步 $\tau_a$ 的不同配置($T\rightarrow0$ 去噪、固定 $T$ 保持、固定 $0$ 条件)决定输出是视频、动作还是联合结果,模式切换被转化为模态时间步配置问题。
光流潜在动作解决了什么问题?
它把相邻帧光流经 DC-AE 压缩为 14D 潜在动作,只保留运动、剔除外观干扰,从而把约 90% 无标签具身视频转化为运动监督,并用少量真实动作把视觉运动空间锚定到控制分布,成为跨本体桥梁。
Motus 在 RoboTwin 2.0 上表现如何?
50 任务平均成功率 88.66%(Clean)/ 87.02%(Randomized),相比 X-VLA 提升约 16 个百分点、相比 $\pi_{0.5}$ 提升约 45 个百分点,且仅允许 40k 次微调。
真实机器人上的表现如何?
AC-One(9 任务)Partial Success Rate 63.22、Agilex-Aloha-2(5 任务)59.30,均领先 $\pi_{0.5}$ 与无预训练基线;长程任务按完成子目标计分。
Motus 与 UWM、$\mathcal F_1$ 的区别?
UWM 耦合视频与动作扩散但从零训练、预训练先验有限,$\mathcal F_1$ 未覆盖 WM 与 VGM;Motus 复用强 VGM/VLM 预训练权重,以光流作为跨本体运动表示,并通过统一调度器覆盖全部五种生成分布。
参考链接
- Motus arXiv 论文(arXiv: 2512.13030)
- Motus 项目主页
- Motus 代码仓库(thu-ml)
- $\pi_{0.5}$: Open-World Generalization(CoRL 2025)
- Genie: Generative Interactive Environments(ICML 2024)
- Unified World Models: Coupling Video and Action Diffusion
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)