摘要

本文解读 arXiv 2025 论文《Vidar: Embodied Video Diffusion Model for Generalist Manipulation》。该论文提出 Vidar,一个解耦视频生成与动作预测的通用双臂操作框架,通过融合大规模视频扩散预训练统一观测空间掩码逆动力学模型 (MIDM),用互联网与多平台具身视频建立可迁移先验,其特别之处在于仅需目标平台约 20 分钟人类演示(约为典型数据量的 1%)即可实现跨平台通用双臂操作。实验表明 Vidar 在真实世界超越 VPP 达 58 个百分点、超越 UniPi 达 40 个百分点,并在 RoboTwin 多任务基准上取得 SOTA(标准数据 65.8%、低数据 60.0%),为「一个先验、多种具身」的数据高效机器人学习提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Vidar: Embodied Video Diffusion Model for Generalist Manipulation
标题(中文) Vidar:视频扩散先验驱动的数据高效双臂操作
作者 Yao Feng*, Hengkai Tan*(共同一作), Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu
机构 清华大学计算机系 TSAIL Group、BNRist、生数科技(Shengshu Tech)
会议 arXiv 2025 (cs.LG)
arXiv https://arxiv.org/abs/2507.12898
项目网站 https://embodiedfoundation.github.io/vidar_anypos

背景与动机

通用操作要扩展到新机器人平台,面临两大核心挑战:数据稀缺具身异构。每个平台通常需要大规模、同质的演示数据(VLA 路线如 RT-2、OpenVLA、Octo、Pi0、RDT-1B 大多依赖任务专属人类演示);而端到端 pixel-to-action 管线在背景、视角变化下容易退化,不同机器人平台的观测形态与动作空间差异又阻碍了知识共享。

现有工作各有局限:耦合视频生成与动作合成的路线(VPP、UVA、VidMan)把视频模型与动作策略端到端耦合训练,限制了视频模型的灵活升级;视频生成用于具身 AI 的路线(UniPi、RoboDreamer、Gen2Act、SuSIE)虽验证了「视频生成 + 逆动力学」范式,但 UniPi 仅覆盖单臂、单视角,未利用异构具身数据做大规模预训练。Vidar 的关键差异在于:它是首个把大规模多平台具身视频预训练 + 统一观测空间 + 隐式掩码逆动力学结合起来的工作,实现仅 20 分钟演示的跨平台迁移。

从历史视角看(附录 D),视频扩散与机器人的结合经历了清晰演进:2023 年 UniPi 首个将 text-to-video 扩散模型用于机器人策略学习;2024 年 Vidu/Wan/Sora 等互联网规模视频扩散模型走向成熟;2024–2025 年 VPP、Gen2Act、VidMan 探索视频-动作联合建模;2025 年 Vidar 首次完成大规模多平台具身视频预训练(750K)+ 解耦架构。视频扩散对具身智能至关重要的原因有三:数据丰度(互联网视频远多于机器人演示数据,相差数千倍)、时序一致性(视频扩散模型天然学习运动连续性与接触动力学)、跨平台迁移(视频空间与动作空间解耦,具身异构不再阻碍知识共享)。

这项工作还命中了顶会审稿中认可的三大创新模式(附录 C):P3 解耦与模块化设计($\Delta_{\text{OR}}=+2.1$pp)——将视频生成与动作预测彻底解耦,替换 Vidu 2.0 为 Wan2.2/HunyuanVideo 无需重训 MIDM;P8 跨领域知识迁移($\Delta_{\text{OR}}=+2.7$pp)——通过统一观测空间把多平台具身视频知识压缩为可迁移先验,仅 20 分钟演示即可在新平台达到 68.2%/66.7%/55.6% 成功率;P12 隐式监督替代显式标注——MIDM 通过动作预测损失隐式学习掩码,训练/测试准确率差距从 ResNet 的 75.6pp 降至 MIDM 的 50.9pp。就贡献定位而言(附录 C2),Vidar 更偏向 PC(结构性洞察与验证):解耦架构 + 逐组件消融 + 物理机器人实测,同时为社区提供了「可插拔视频模型 + 独立 MIDM」的可复用工程范式。

研究主线:从问题到结论

Vidar 研究主线流程图:问题到动机到设计到方法到实验到结论

图 5:Vidar 研究主线 Mermaid 流程图(问题 → 动机 → 设计 → 方法 → 实验 → 结论)

基准/方法设计

Vidar 的核心设计思想是:把大部分表征负担转移到视频生成模型,只留下一个轻量逆动力学模型做平台适配。具体包含四个要素:

  • 解耦架构:将策略分解为视频生成模型 $G$ 与逆动力学模型 $I$ 的复合——视频生成 $G$ 学习可迁移的交互先验,逆动力学 $I$ 仅需少量平台数据即可完成动作解码。
  • 统一观测空间:聚合 $V$ 个多视角图像与机器人/相机/任务文本标记,形成一致的观测张量形态,从根本上消除具身异构。
  • 三阶段训练管道:(1) 互联网规模视频预训练(可复用现成 checkpoint);(2) 具身域预训练——约 750K 条多平台双臂视频(Agibot-World + RoboMind + RDT,3 个机器人平台);(3) 目标平台微调——仅 20 分钟人类演示,全参数 SFT。
  • 测试时扩展 (TTS):$K=3$ 个候选轨迹并行采样,用 GPT-4o 择优,提升视频质量与物理合理性。

Vidar 总体流程:多源视频到统一观测空间到视频扩散预训练再到 MIDM 动作解码的通用双臂操作框架

图 1:Vidar 总体流程:多源视频 → 统一观测空间 → 视频扩散预训练 → MIDM 动作解码

分类全景

机器人策略方法分类树:VLA 端到端、耦合视频生成与动作、视频生成加逆动力学三条路线

图 6:视频与语言驱动的机器人策略分类全景 Mermaid 图(VLA / 耦合视频-动作 / 视频生成+逆动力学三条路线)

方法细节

统一观测空间是消除具身异构的枢纽:把 $V$ 个多视角图像与机器人、相机、任务文本标记拼接成固定形态的张量,使得不同平台、不同视角的数据可以在同一个视频扩散模型上继续预训练。视频扩散模型采用 rectified flow 架构,先做互联网视频预训练,再用 750K 条多视角双臂轨迹做具身域连续预训练,最后在目标平台用 20 分钟演示全参数 SFT——这保证了「一个先验」的通用性。

掩码逆动力学模型 (MIDM) 是动作解码的关键:它先用 U-Net 预测动作相关掩码 $m = U(x)$,再对掩码取整并与观测做逐元素相乘 $R(\text{Round}(m) \odot x)$ 后回归动作 $\hat{a}$,训练损失为 $L_I = \ell(\hat{a} - a) + \lambda|m|_1$,其中 $\lambda$ 控制掩码的稀疏程度。由于掩码经过取整操作不可导,MIDM 使用直通估计器(straight-through estimator)训练,全程无需任何分割标签——掩码完全由动作预测信号隐式驱动,这与依赖显式分割的 RoboEngine 路线形成鲜明对比(详见实验部分)。MIDM 的另一个价值是它天然成为平台适配器:替换视频 backbone(如 Vidu 2.0 → Wan2.2/HunyuanVideo)时无需重训 MIDM。

测试时扩展 (TTS):推理时用不同随机种子并行生成 $K=3$ 条候选视频轨迹,再用预训练评估器(GPT-4o/VLM)按视频质量与任务相关性择优,类似拒绝采样,对齐视频分布与任务意图。

Vidar 系统框图:统一观测空间到视频扩散模型到 MIDM 动作解码的完整系统架构

图 2:Vidar 系统框图:统一观测空间 → 视频扩散模型 → MIDM 动作解码

实验设计与结果

评测协议:仿真使用 RoboTwin 2.0 基准的 50 个双臂操作任务,含低数据(20 eps/task)与标准数据(50 eps/task)两种设置,multi-task 训练,成功率在 100 trials/task 上评估;真实世界使用 Aloha 双臂平台,共 81 个任务、232 个 episodes,覆盖三类场景:seen task+bg、unseen task(5 个)、unseen bg(6 个,含反光表面),每个任务约 3 次试验。基线方面,仿真对比 Pi0.5,真实世界对比 UniPi 与 VPP,均基于 Vidu 2.0/Wan2.2 视频模型。

主结果如下表:

设置 指标 VPP UniPi Pi0.5 Vidar 相对提升
真实 Seen 成功率 4.5% 36.4% 68.2% 超越 VPP 58pp / UniPi 40pp
真实 Unseen Task 成功率 13.3% 6.7% 66.7% 超越 VPP 53pp
真实 Unseen BG 成功率 0.0% 22.2% 55.6% 超越 VPP 56pp / UniPi 33pp
RoboTwin Low Clean Avg 25.0% 60.0% +35.0pp
RoboTwin Std Clean Avg 44.8% 65.8% +21.0pp
RoboTwin Std Rand Avg 14.2% 17.5% +3.3pp

Vidar 在真实世界超越 VPP 58pp、UniPi 40pp,在 RoboTwin 多任务设置下达到 SOTA,且对未见任务(66.7%)、未见背景(55.6%)都有很强的泛化。

Vidar 在未见任务和未见背景下的预测视频与实际执行对比:左列为预测视频帧,右列为真实机器人执行

图 3:Vidar 在未见任务和未见背景下的预测视频(左)与实际执行(右)对比

分析与消融(主文 6.2):预训练有效性——具身预训练把 VBench Subject Consistency 从 0.565 提升至 0.855,Background Consistency 从 0.800 提升至 0.909;MIDM 贡献——MIDM 与 ResNet 基线训练准确率同为 99.9%,但测试准确率从 24.3% 提升至 49.0%,测试 $l_1$ 误差从 0.0430 降至 0.0308;TTS 贡献——去掉 TTS 后 seen 从 68.2% 降至 45.5%,unseen task 从 66.7% 降至 33.3%;跨 backbone 鲁棒性——Wan2.2 上 Vidar 超越 Pi0.5 平均 35–54pp,HunyuanVideo 上 6 任务平均 58.3%。

附录 A:MIDM 消融与 $\lambda$ 分析。掩码稀疏正则系数 $\lambda$ 对泛化影响显著:

$\lambda$ 训练准确率 测试准确率 测试 $l_1$ 误差
$10^{-1}$ 99.1% 7.1% 0.0670
$10^{-2}$ 99.8% 39.9% 0.0331
$3\times 10^{-3}$(选用) 99.9% 49.0% 0.0308
$10^{-3}$ 99.9% 40.7% 0.0338
$10^{-4}$ 99.8% 24.4% 0.0461

$\lambda$ 过大($10^{-1}$)导致掩码过稀疏、测试准确率暴跌至 7.1%;$\lambda$ 过小($10^{-4}$)掩码失去选择性,准确率回落到 24.4%;$3\times 10^{-3}$ 是准确率与稀疏性的最佳平衡点。与 RoboEngine 分割方案对比:RoboEngine 常仅识别单臂,无法识别腕部相机中的夹爪,且时序一致性差;MIDM 无需任何分割标签,通过动作信号隐式学习,在反光表面等未见背景下仍能聚焦动作相关区域,泛化更强。

附录 B:真实世界 Seen 任务详细结果

Seen Tasks & Backgrounds UniPi VPP Vidar w/o TTS w/o MIDM
Grasp Tomato (L) 60.0% 0.0% 60.0% 60.0% 80.0%
Grasp Tomato (R) 20.0% 0.0% 80.0% 60.0% 60.0%
Lift Basket (B) 66.7% 0.0% 66.7% 33.3% 33.3%
Flip Dice (L) 0.0% 33.3% 33.3% 0.0% 33.3%
Grab Bottle (L) 0.0% 0.0% 66.7% 33.3% 33.3%
Toast from Toaster (L) 66.7% 0.0% 100.0% 66.7% 100.0%
Average 36.4% 4.5% 68.2% 45.5% 59.1%

逐任务可见:Vidar 在 5/6 个 seen 任务上达到最高成功率,去除 TTS 或 MIDM 后平均成功率分别降至 45.5% 与 59.1%,证明两个组件各自贡献显著。

MIDM 学习到的掩码:在反光表面等未见背景下仍聚焦机械臂关键区域,无需分割标签

图 4:MIDM 学习到的掩码:在反光表面等未见背景下,仍聚焦机械臂关键区域

结果对比总结

Vidar 结果对比图:真实世界超越 VPP 58pp、UniPi 40pp,RoboTwin 超越 Pi0.5 21-35pp

图 7:Vidar 与基线结果对比 Mermaid 图(带具体提升百分点)

关键发现

  • 数据效率惊人:仅 20 分钟人类演示(约典型数据量的 1%)即可在新机器人平台达到 68.2% 的 seen 成功率,超越 VPP 58pp、UniPi 40pp。
  • 强泛化能力:未见任务成功率 66.7%(VPP 仅 13.3%)、未见背景成功率 55.6%(VPP 为 0.0%),含反光表面等干扰场景。
  • RoboTwin 多任务 SOTA:标准数据 Clean Avg 65.8%(+21.0pp vs Pi0.5)、低数据 Clean Avg 60.0%(+35.0pp vs Pi0.5)。
  • 具身预训练质量:750K 多平台视频预训练把 VBench Subject Consistency 从 0.565 提升到 0.855,Background Consistency 从 0.800 提升到 0.909。
  • MIDM 隐式掩码有效:测试准确率 24.3% → 49.0%,测试 $l_1$ 误差 0.0430 → 0.0308,训练/测试差距从 75.6pp 收窄至 50.9pp,且完全无需分割标签。
  • TTS 择优显著:去掉 TTS 后 seen 成功率从 68.2% 跌至 45.5%,unseen task 从 66.7% 跌至 33.3%。

局限性

  • 推理延迟:单次视频生成约需 25 秒(8 张 A100),无法实时部署;蒸馏或量化可缓解,但超出本文范围。
  • 多视角假设:方法假设多视角观测足以支撑动作预测,需要调整相机位置确保双臂完整可见,部分商用平台难以满足。
  • 计算成本:大规模视频扩散模型的训练/微调/部署成本高,影响可及性与可复现性(Vidu 2.0 非开源)。
  • 开环控制:仅采用开环控制,无闭环反馈修正,长程任务中误差会累积。
  • 作者展望:通过高效生成骨干(蒸馏、量化)降低延迟,探索更通用的观测配置,向实时闭环的通用操作迈进。

常见问题(FAQ)

Vidar 与 UniPi 的本质区别是什么?

UniPi 是单臂、单视角、未利用异构具身数据预训练;Vidar 首次实现大规模多平台具身视频预训练(约 750K 条轨迹)+ 统一观测空间 + 隐式掩码逆动力学,把视频先验扩展到跨平台双臂通用操作,数据需求从大规模演示降到 20 分钟。

MIDM 的掩码是如何隐式学习的?为什么不需要分割标签?

MIDM 用 U-Net 预测动作相关掩码,经取整后与观测逐元素相乘再回归动作,损失为 $L_I = \ell(\hat{a} - a) + \lambda|m|_1$,通过直通估计器端到端训练。掩码完全由「预测动作准不准」这个信号驱动,因此不需要任何人工分割标注,且在未见背景下仍能聚焦机械臂关键区域。

为什么仅需 20 分钟演示就能迁移到新平台?

因为视频生成模型 $G$ 已经在互联网与 750K 条多平台具身视频上学到了可迁移的交互先验(动作、接触、时序),平台差异被统一观测空间吸收;剩下的「视频 → 动作」映射由轻量 MIDM 负责,只需少量平台数据即可适配。这正好是「一个先验,多种具身」的数据效率来源。

测试时扩展(TTS)是什么?带来多少提升?

TTS 即推理时并行采样 $K=3$ 条候选视频轨迹,用 GPT-4o 按质量与任务相关性择优。消融显示去掉 TTS 后 seen 成功率从 68.2% 跌至 45.5%,unseen task 从 66.7% 跌至 33.3%,贡献十分显著。

Vidar 的视频扩散 backbone 可以替换吗?

可以。得益于解耦架构,替换 Vidu 2.0 为 Wan2.2 或 HunyuanVideo 无需重训 MIDM:Wan2.2 上 Vidar 超越 Pi0.5 平均 35–54pp,HunyuanVideo 上 6 任务平均 58.3%,验证了跨 backbone 的鲁棒性。

Vidar 当前的主要瓶颈是什么?

主要是推理延迟(单视频生成约 25 秒)、多视角相机假设、大规模视频模型的高计算成本(Vidu 2.0 未开源)以及开环控制缺乏反馈修正。作者展望通过蒸馏、量化与更通用的观测配置向实时闭环迈进。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐