【arXiv 2025】[PC] Vidar — 视频扩散先验驱动的数据高效双臂操作 — 仅需20分钟演示|从视频先验跨具身迁移视角
摘要
本文解读 arXiv 2025 论文《Vidar: Embodied Video Diffusion Model for Generalist Manipulation》。该论文提出 Vidar,一个解耦视频生成与动作预测的通用双臂操作框架,通过融合大规模视频扩散预训练、统一观测空间与掩码逆动力学模型 (MIDM),用互联网与多平台具身视频建立可迁移先验,其特别之处在于仅需目标平台约 20 分钟人类演示(约为典型数据量的 1%)即可实现跨平台通用双臂操作。实验表明 Vidar 在真实世界超越 VPP 达 58 个百分点、超越 UniPi 达 40 个百分点,并在 RoboTwin 多任务基准上取得 SOTA(标准数据 65.8%、低数据 60.0%),为「一个先验、多种具身」的数据高效机器人学习提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Vidar: Embodied Video Diffusion Model for Generalist Manipulation |
| 标题(中文) | Vidar:视频扩散先验驱动的数据高效双臂操作 |
| 作者 | Yao Feng*, Hengkai Tan*(共同一作), Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu |
| 机构 | 清华大学计算机系 TSAIL Group、BNRist、生数科技(Shengshu Tech) |
| 会议 | arXiv 2025 (cs.LG) |
| arXiv | https://arxiv.org/abs/2507.12898 |
| 项目网站 | https://embodiedfoundation.github.io/vidar_anypos |
背景与动机
通用操作要扩展到新机器人平台,面临两大核心挑战:数据稀缺与具身异构。每个平台通常需要大规模、同质的演示数据(VLA 路线如 RT-2、OpenVLA、Octo、Pi0、RDT-1B 大多依赖任务专属人类演示);而端到端 pixel-to-action 管线在背景、视角变化下容易退化,不同机器人平台的观测形态与动作空间差异又阻碍了知识共享。
现有工作各有局限:耦合视频生成与动作合成的路线(VPP、UVA、VidMan)把视频模型与动作策略端到端耦合训练,限制了视频模型的灵活升级;视频生成用于具身 AI 的路线(UniPi、RoboDreamer、Gen2Act、SuSIE)虽验证了「视频生成 + 逆动力学」范式,但 UniPi 仅覆盖单臂、单视角,未利用异构具身数据做大规模预训练。Vidar 的关键差异在于:它是首个把大规模多平台具身视频预训练 + 统一观测空间 + 隐式掩码逆动力学结合起来的工作,实现仅 20 分钟演示的跨平台迁移。
从历史视角看(附录 D),视频扩散与机器人的结合经历了清晰演进:2023 年 UniPi 首个将 text-to-video 扩散模型用于机器人策略学习;2024 年 Vidu/Wan/Sora 等互联网规模视频扩散模型走向成熟;2024–2025 年 VPP、Gen2Act、VidMan 探索视频-动作联合建模;2025 年 Vidar 首次完成大规模多平台具身视频预训练(750K)+ 解耦架构。视频扩散对具身智能至关重要的原因有三:数据丰度(互联网视频远多于机器人演示数据,相差数千倍)、时序一致性(视频扩散模型天然学习运动连续性与接触动力学)、跨平台迁移(视频空间与动作空间解耦,具身异构不再阻碍知识共享)。
这项工作还命中了顶会审稿中认可的三大创新模式(附录 C):P3 解耦与模块化设计($\Delta_{\text{OR}}=+2.1$pp)——将视频生成与动作预测彻底解耦,替换 Vidu 2.0 为 Wan2.2/HunyuanVideo 无需重训 MIDM;P8 跨领域知识迁移($\Delta_{\text{OR}}=+2.7$pp)——通过统一观测空间把多平台具身视频知识压缩为可迁移先验,仅 20 分钟演示即可在新平台达到 68.2%/66.7%/55.6% 成功率;P12 隐式监督替代显式标注——MIDM 通过动作预测损失隐式学习掩码,训练/测试准确率差距从 ResNet 的 75.6pp 降至 MIDM 的 50.9pp。就贡献定位而言(附录 C2),Vidar 更偏向 PC(结构性洞察与验证):解耦架构 + 逐组件消融 + 物理机器人实测,同时为社区提供了「可插拔视频模型 + 独立 MIDM」的可复用工程范式。
研究主线:从问题到结论

图 5:Vidar 研究主线 Mermaid 流程图(问题 → 动机 → 设计 → 方法 → 实验 → 结论)
基准/方法设计
Vidar 的核心设计思想是:把大部分表征负担转移到视频生成模型,只留下一个轻量逆动力学模型做平台适配。具体包含四个要素:
- 解耦架构:将策略分解为视频生成模型 $G$ 与逆动力学模型 $I$ 的复合——视频生成 $G$ 学习可迁移的交互先验,逆动力学 $I$ 仅需少量平台数据即可完成动作解码。
- 统一观测空间:聚合 $V$ 个多视角图像与机器人/相机/任务文本标记,形成一致的观测张量形态,从根本上消除具身异构。
- 三阶段训练管道:(1) 互联网规模视频预训练(可复用现成 checkpoint);(2) 具身域预训练——约 750K 条多平台双臂视频(Agibot-World + RoboMind + RDT,3 个机器人平台);(3) 目标平台微调——仅 20 分钟人类演示,全参数 SFT。
- 测试时扩展 (TTS):$K=3$ 个候选轨迹并行采样,用 GPT-4o 择优,提升视频质量与物理合理性。

图 1:Vidar 总体流程:多源视频 → 统一观测空间 → 视频扩散预训练 → MIDM 动作解码
分类全景

图 6:视频与语言驱动的机器人策略分类全景 Mermaid 图(VLA / 耦合视频-动作 / 视频生成+逆动力学三条路线)
方法细节
统一观测空间是消除具身异构的枢纽:把 $V$ 个多视角图像与机器人、相机、任务文本标记拼接成固定形态的张量,使得不同平台、不同视角的数据可以在同一个视频扩散模型上继续预训练。视频扩散模型采用 rectified flow 架构,先做互联网视频预训练,再用 750K 条多视角双臂轨迹做具身域连续预训练,最后在目标平台用 20 分钟演示全参数 SFT——这保证了「一个先验」的通用性。
掩码逆动力学模型 (MIDM) 是动作解码的关键:它先用 U-Net 预测动作相关掩码 $m = U(x)$,再对掩码取整并与观测做逐元素相乘 $R(\text{Round}(m) \odot x)$ 后回归动作 $\hat{a}$,训练损失为 $L_I = \ell(\hat{a} - a) + \lambda|m|_1$,其中 $\lambda$ 控制掩码的稀疏程度。由于掩码经过取整操作不可导,MIDM 使用直通估计器(straight-through estimator)训练,全程无需任何分割标签——掩码完全由动作预测信号隐式驱动,这与依赖显式分割的 RoboEngine 路线形成鲜明对比(详见实验部分)。MIDM 的另一个价值是它天然成为平台适配器:替换视频 backbone(如 Vidu 2.0 → Wan2.2/HunyuanVideo)时无需重训 MIDM。
测试时扩展 (TTS):推理时用不同随机种子并行生成 $K=3$ 条候选视频轨迹,再用预训练评估器(GPT-4o/VLM)按视频质量与任务相关性择优,类似拒绝采样,对齐视频分布与任务意图。

图 2:Vidar 系统框图:统一观测空间 → 视频扩散模型 → MIDM 动作解码
实验设计与结果
评测协议:仿真使用 RoboTwin 2.0 基准的 50 个双臂操作任务,含低数据(20 eps/task)与标准数据(50 eps/task)两种设置,multi-task 训练,成功率在 100 trials/task 上评估;真实世界使用 Aloha 双臂平台,共 81 个任务、232 个 episodes,覆盖三类场景:seen task+bg、unseen task(5 个)、unseen bg(6 个,含反光表面),每个任务约 3 次试验。基线方面,仿真对比 Pi0.5,真实世界对比 UniPi 与 VPP,均基于 Vidu 2.0/Wan2.2 视频模型。
主结果如下表:
| 设置 | 指标 | VPP | UniPi | Pi0.5 | Vidar | 相对提升 |
|---|---|---|---|---|---|---|
| 真实 Seen | 成功率 | 4.5% | 36.4% | — | 68.2% | 超越 VPP 58pp / UniPi 40pp |
| 真实 Unseen Task | 成功率 | 13.3% | 6.7% | — | 66.7% | 超越 VPP 53pp |
| 真实 Unseen BG | 成功率 | 0.0% | 22.2% | — | 55.6% | 超越 VPP 56pp / UniPi 33pp |
| RoboTwin Low | Clean Avg | — | — | 25.0% | 60.0% | +35.0pp |
| RoboTwin Std | Clean Avg | — | — | 44.8% | 65.8% | +21.0pp |
| RoboTwin Std | Rand Avg | — | — | 14.2% | 17.5% | +3.3pp |
Vidar 在真实世界超越 VPP 58pp、UniPi 40pp,在 RoboTwin 多任务设置下达到 SOTA,且对未见任务(66.7%)、未见背景(55.6%)都有很强的泛化。

图 3:Vidar 在未见任务和未见背景下的预测视频(左)与实际执行(右)对比
分析与消融(主文 6.2):预训练有效性——具身预训练把 VBench Subject Consistency 从 0.565 提升至 0.855,Background Consistency 从 0.800 提升至 0.909;MIDM 贡献——MIDM 与 ResNet 基线训练准确率同为 99.9%,但测试准确率从 24.3% 提升至 49.0%,测试 $l_1$ 误差从 0.0430 降至 0.0308;TTS 贡献——去掉 TTS 后 seen 从 68.2% 降至 45.5%,unseen task 从 66.7% 降至 33.3%;跨 backbone 鲁棒性——Wan2.2 上 Vidar 超越 Pi0.5 平均 35–54pp,HunyuanVideo 上 6 任务平均 58.3%。
附录 A:MIDM 消融与 $\lambda$ 分析。掩码稀疏正则系数 $\lambda$ 对泛化影响显著:
| $\lambda$ | 训练准确率 | 测试准确率 | 测试 $l_1$ 误差 |
|---|---|---|---|
| $10^{-1}$ | 99.1% | 7.1% | 0.0670 |
| $10^{-2}$ | 99.8% | 39.9% | 0.0331 |
| $3\times 10^{-3}$(选用) | 99.9% | 49.0% | 0.0308 |
| $10^{-3}$ | 99.9% | 40.7% | 0.0338 |
| $10^{-4}$ | 99.8% | 24.4% | 0.0461 |
$\lambda$ 过大($10^{-1}$)导致掩码过稀疏、测试准确率暴跌至 7.1%;$\lambda$ 过小($10^{-4}$)掩码失去选择性,准确率回落到 24.4%;$3\times 10^{-3}$ 是准确率与稀疏性的最佳平衡点。与 RoboEngine 分割方案对比:RoboEngine 常仅识别单臂,无法识别腕部相机中的夹爪,且时序一致性差;MIDM 无需任何分割标签,通过动作信号隐式学习,在反光表面等未见背景下仍能聚焦动作相关区域,泛化更强。
附录 B:真实世界 Seen 任务详细结果:
| Seen Tasks & Backgrounds | UniPi | VPP | Vidar | w/o TTS | w/o MIDM |
|---|---|---|---|---|---|
| Grasp Tomato (L) | 60.0% | 0.0% | 60.0% | 60.0% | 80.0% |
| Grasp Tomato (R) | 20.0% | 0.0% | 80.0% | 60.0% | 60.0% |
| Lift Basket (B) | 66.7% | 0.0% | 66.7% | 33.3% | 33.3% |
| Flip Dice (L) | 0.0% | 33.3% | 33.3% | 0.0% | 33.3% |
| Grab Bottle (L) | 0.0% | 0.0% | 66.7% | 33.3% | 33.3% |
| Toast from Toaster (L) | 66.7% | 0.0% | 100.0% | 66.7% | 100.0% |
| Average | 36.4% | 4.5% | 68.2% | 45.5% | 59.1% |
逐任务可见:Vidar 在 5/6 个 seen 任务上达到最高成功率,去除 TTS 或 MIDM 后平均成功率分别降至 45.5% 与 59.1%,证明两个组件各自贡献显著。

图 4:MIDM 学习到的掩码:在反光表面等未见背景下,仍聚焦机械臂关键区域
结果对比总结

图 7:Vidar 与基线结果对比 Mermaid 图(带具体提升百分点)
关键发现
- 数据效率惊人:仅 20 分钟人类演示(约典型数据量的 1%)即可在新机器人平台达到 68.2% 的 seen 成功率,超越 VPP 58pp、UniPi 40pp。
- 强泛化能力:未见任务成功率 66.7%(VPP 仅 13.3%)、未见背景成功率 55.6%(VPP 为 0.0%),含反光表面等干扰场景。
- RoboTwin 多任务 SOTA:标准数据 Clean Avg 65.8%(+21.0pp vs Pi0.5)、低数据 Clean Avg 60.0%(+35.0pp vs Pi0.5)。
- 具身预训练质量:750K 多平台视频预训练把 VBench Subject Consistency 从 0.565 提升到 0.855,Background Consistency 从 0.800 提升到 0.909。
- MIDM 隐式掩码有效:测试准确率 24.3% → 49.0%,测试 $l_1$ 误差 0.0430 → 0.0308,训练/测试差距从 75.6pp 收窄至 50.9pp,且完全无需分割标签。
- TTS 择优显著:去掉 TTS 后 seen 成功率从 68.2% 跌至 45.5%,unseen task 从 66.7% 跌至 33.3%。
局限性
- 推理延迟:单次视频生成约需 25 秒(8 张 A100),无法实时部署;蒸馏或量化可缓解,但超出本文范围。
- 多视角假设:方法假设多视角观测足以支撑动作预测,需要调整相机位置确保双臂完整可见,部分商用平台难以满足。
- 计算成本:大规模视频扩散模型的训练/微调/部署成本高,影响可及性与可复现性(Vidu 2.0 非开源)。
- 开环控制:仅采用开环控制,无闭环反馈修正,长程任务中误差会累积。
- 作者展望:通过高效生成骨干(蒸馏、量化)降低延迟,探索更通用的观测配置,向实时闭环的通用操作迈进。
常见问题(FAQ)
Vidar 与 UniPi 的本质区别是什么?
UniPi 是单臂、单视角、未利用异构具身数据预训练;Vidar 首次实现大规模多平台具身视频预训练(约 750K 条轨迹)+ 统一观测空间 + 隐式掩码逆动力学,把视频先验扩展到跨平台双臂通用操作,数据需求从大规模演示降到 20 分钟。
MIDM 的掩码是如何隐式学习的?为什么不需要分割标签?
MIDM 用 U-Net 预测动作相关掩码,经取整后与观测逐元素相乘再回归动作,损失为 $L_I = \ell(\hat{a} - a) + \lambda|m|_1$,通过直通估计器端到端训练。掩码完全由「预测动作准不准」这个信号驱动,因此不需要任何人工分割标注,且在未见背景下仍能聚焦机械臂关键区域。
为什么仅需 20 分钟演示就能迁移到新平台?
因为视频生成模型 $G$ 已经在互联网与 750K 条多平台具身视频上学到了可迁移的交互先验(动作、接触、时序),平台差异被统一观测空间吸收;剩下的「视频 → 动作」映射由轻量 MIDM 负责,只需少量平台数据即可适配。这正好是「一个先验,多种具身」的数据效率来源。
测试时扩展(TTS)是什么?带来多少提升?
TTS 即推理时并行采样 $K=3$ 条候选视频轨迹,用 GPT-4o 按质量与任务相关性择优。消融显示去掉 TTS 后 seen 成功率从 68.2% 跌至 45.5%,unseen task 从 66.7% 跌至 33.3%,贡献十分显著。
Vidar 的视频扩散 backbone 可以替换吗?
可以。得益于解耦架构,替换 Vidu 2.0 为 Wan2.2 或 HunyuanVideo 无需重训 MIDM:Wan2.2 上 Vidar 超越 Pi0.5 平均 35–54pp,HunyuanVideo 上 6 任务平均 58.3%,验证了跨 backbone 的鲁棒性。
Vidar 当前的主要瓶颈是什么?
主要是推理延迟(单视频生成约 25 秒)、多视角相机假设、大规模视频模型的高计算成本(Vidu 2.0 未开源)以及开环控制缺乏反馈修正。作者展望通过蒸馏、量化与更通用的观测配置向实时闭环迈进。
参考链接
- arXiv 论文页:Vidar: Embodied Video Diffusion Model for Generalist Manipulation
- 项目网站(Vidar & AnyPos):Embodied Video Foundation Model
- 开源代码:github.com/yaofeng1998/Vidar
- UniPi(NeurIPS 2023):Learning Universal Policies via Text-to-Video Generation
- Vidu:Highly Consistent Dynamic Video Generation
- RDT-1B:A Diffusion Foundation Model for Bimanual Manipulation
- Pi0:A Vision-Language-Action Flow Model for General Robot Control
- OpenVLA(CoRL 2024):An Open-Source Vision-Language-Action Model
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)