摘要

本文解读 CVPR 2025 论文《VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation》。该论文提出 VidBot,一个只依赖野外单目 RGB 人类视频即可零样本驱动机器人操作的框架,通过融合 运动恢复结构(SfM)、度量深度基础模型 与 粗到细条件扩散,把互联网上现成的人类操作视频变成与本体无关的 3D 可供性监督,其特别之处在于测试阶段用可微代价函数在线修正轨迹,从而把机器人形态与场景几何从训练问题降级为推理期约束。实验表明 在 13 个仿真操作任务上零样本取得 88.2% 平均成功率,领先次优方法近 20 个百分点,并在 Hello Robot Stretch 3 与 Boston Dynamics Spot 两台真机上以 55 次试验获得 80.0% 成功率,为机器人模仿学习的数据规模化提供了重要借鉴。

视频讲解:点击观看 B 站视频

论文基本信息

项目内容
标题(英文)VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation
标题(中文)从野外 2D 人类视频学习可泛化 3D 动作
作者Hanzhi Chen, Boyang Sun, Anran Zhang, Marc Pollefeys, Stefan Leutenegger
机构Technical University of Munich · ETH Zürich · Microsoft
会议CVPR 2025
arXivarXiv:2503.07135
项目网站hanzhic.github.io/vidbot-project

背景与动机

机器人模仿学习长期依赖人类专家的遥操作示范:Open X-Embodiment 与 DROID 这类大规模数据集证明了规模化的价值,但采集成本随本体系、任务与环境三者的组合爆炸而失控。论文因此提出一个更激进的问题:能否完全不要机器人示范,只从互联网上已经存在的人类操作视频中学习操作技能?

既有的视频学习路线各有代价。以 R3M、VIP、Masked Visual Pretraining 为代表的视觉表征预训练需要在新环境、新本体上重新采集遥操作数据做微调;VRB 首次用大规模人类视频提取与本体无关的交互轨迹,但把动作简化成了图像平面内的 2D 方向向量,缺乏空间意识,遇到开柜门这类曲线交互就会打滑;GFlow 与 Track2Act 引入流表示获得空间感知,代价是测试时必须提供目标图像或初始接触区域,训练时还依赖真值深度与物体位姿。

论文把这件事拆成两个可验证的子问题:第一,如何从纯 RGB 的野外视频中提取 3D 可执行知识;第二,如何让这些知识以 零样本 方式迁移到新环境与新本体。作者给出的答案是:用几何方法把监督信号"制造"出来,再用测试时约束补上本体差异。这条路线也顺应了可供性学习的历史演进——从 2021 年 Where2Act 在仿真虚拟资产上学方向向量,到 2023 年 VRB 转向人类视频,再到 2025 年 VidBot 把监督拉进度量 3D 空间。

VidBot 研究主线流程图:从遥操作数据成本爆炸走向野外人类视频的零样本机器人操作

图 7:VidBot 研究主线:问题(遥操作成本爆炸)→ 动机(改用野外人类视频)→ 设计(SfM 与度量深度制造 3D 监督)→ 方法(粗到细条件扩散 + 测试时代价引导)→ 结论(零样本跨本体操作)

基准/方法设计

VidBot 的形式化目标是学习一个因子化的可供性模型 $\mathbf{a} = \pi(\tilde{\mathbf{I}}, \tilde{\mathbf{D}}, l)$,输入 RGB-D 帧与语言指令 $l$,输出接触点 $\mathbf{c}$ 与 3D 交互轨迹 $\bm{\tau}$。整个系统分成数据与学习两条主线:

  • 数据侧:先由 SfM 估计相机内参与尺度未知的位姿,由度量深度基础模型预测稠密深度,再联合优化全局尺度与逐帧位姿尺度,把重建拉进度量空间,从而抹掉动态手物运动带来的误差。
  • 学习侧:粗阶段从像素空间预测目标点 $\mathbf{g}$ 与接触点 $\mathbf{c}$,细阶段以它们为条件,用 1D U-Net 做条件扩散生成细粒度轨迹。
  • 输出侧:轨迹的起点与终点被映射成可微代价,可以直接接入下游全身规划。

这套设计的价值在于监督来源与方法解耦:数据提取管线依赖的是通用的 SfM 与深度基础模型,而不是某一种机器人或某一种任务。

VidBot 框架总览图,展示从野外 RGB 人类视频提取可供性并跨机器人本体零样本部署的闭环

图 1:方法总览:从野外 RGB 人类视频提取可供性,学习到的模型可跨机器人本体部署于日常操作任务(论文 Fig. 1)

分类全景

从数据来源看,机器人可供性学习可以分成三条互不相同的技术路线,VidBot 属于第三条并且把表示层次推到了 3D:

机器人可供性学习的三条数据来源路线对比:仿真虚拟资产、遥操作示范与人类视频

图 8:可供性学习的数据来源全景:仿真虚拟资产(Where2Act / GAPartNet)、遥操作示范(Octo)与人类视频(VRB / GFlow / VidBot),本文属于人类视频路线中的度量 3D 轨迹分支

方法细节

第一步是数据准备。 SfM 给出相机内参 $\mathbf{K}$、尺度未知的逐帧位姿与稀疏地标;深度基础模型预测稠密深度;手物检测与分割网络给出静态区域掩码,把动态的手与物体从几何优化中剔除。

第二步是一致位姿优化。 论文先用稀疏地标的重投影残差最小化求全局尺度 $s_g$,把它固定为参考帧的尺度,再联合优化其余帧的位姿与尺度,让跨视图的反投影点对齐。这一步是整套监督信号可靠性的关键——没有它,从视频里恢复出的手部轨迹在时间上不连续、在尺度上不统一,无法作为训练标签。

第三步是可供性抽取。 把逐帧手中心点变换到首帧得到轨迹,对首帧的手点降采样得到接触点,对末帧降采样得到目标点,分别用于监督粗阶段与细阶段。

训练之外,论文最巧的设计是把“多次采样不同目标点”改写成单一去噪过程中的可微代价。多目标代价 $\mathcal{J}_{goal}$ 度量轨迹终点与候选目标集的最近距离,碰撞代价查询预计算的 TSDF 做碰撞规避,法向代价约束接触法向,三者按权重 $\lambda_g$、$\lambda_c$、$\lambda_n$ 加权求和。每一步去噪再用梯度对未加噪预测做重建引导修正,既避免了多次前向传播,又把最终代价当作挑选最优轨迹的启发式。

VidBot 可供性模型总览图,粗阶段预测接触点与目标点,细阶段由代价函数引导生成轨迹

图 2:可供性模型总览:粗阶段解析接触与目标配置,细阶段以其为条件、并由代价函数引导生成细粒度交互轨迹;颜色越深表示代价越低(论文 Fig. 2)

从原始人类视频中提取的 3D 手部轨迹示例

图 3:从原始人类视频中提取的 3D 手部轨迹示例(论文 Fig. 3)

实验设计与结果

仿真部分使用 IsaacGym,环境基于 AG2Manip 构建,从 FrankaKitchen、PartManip、ManiSkill 三个基准中选出 13 个日常家务任务,覆盖开门、关柜、推拉抽屉、微波炉、洗碗机、抓水壶、抓取杂物、掀盖等动作原语。评测协议为每个任务 3 个视角、每视角 5 条轨迹,共 15 次试验,指标是成功率;真机则在 3 个家居环境中用 2 台机器人完成 55 次试验。

方法平均成功率 (%)训练数据来源相对 VidBot
GAPartNet51.1仿真虚拟资产−37.1
Where2Act58.5仿真虚拟资产−29.7
VRB†59.0人类视频(2D 轨迹)−29.2
GFlow61.0人类视频(含真值深度)−27.2
Octo*69.2遥操作 + 本文数据微调−19.0
VidBot(本文)88.2人类视频(仅 RGB)—

13 个任务的完整消融实验进一步说明每个设计点的必要性:

变体平均成功率 (%)相对完整模型
VidBot 完整模型85.6—
去掉粗阶段目标预测 [V1]57.8−27.8
去掉多目标引导 [V2]73.3−12.3
去掉接触法向引导 [V3]76.7−8.9
去掉碰撞规避引导 [V4]77.8−7.8
去掉代价启发式 [V5]74.5−11.1

值得注意的是,去掉碰撞规避引导在抓取可携带物体的 AT06 任务上单任务下降 26.7 个百分点,说明几何约束对涉及空间通道的任务尤其关键。

两台真机上的表现同样具有说服力:Stretch 3 与 Spot 均以机载 RGB-D 感知加语言指令工作,在三个环境中完成推抽屉、开柜门、取纸巾等任务,总体成功率 80.0%。

VRB 与 VidBot 的定性对比,VidBot 直接输出 3D 接触点与轨迹并给出代价最低的五个候选

图 4:与 VRB 的定性对比:同样的 RGB 视频监督,VidBot 直接给出 3D 接触点与轨迹,并展示代价最低的 5 个候选(论文 Fig. 4)

下游机器人学习应用曲线,视觉目标到达与探索任务的成功率对比

图 5:下游机器人学习应用:(a) 视觉目标到达任务平均成功率;(b) 探索任务的偶然成功率(论文 Fig. 5)

真机实验结果与推断出的可供性,Stretch 3 与 Spot 执行家务操作

图 6:真机实验结果与推断出的可供性(上排):Stretch 3 与 Spot 在三个环境中执行家务操作(论文 Fig. 6)

结果对比总结

把主表、消融与真机结果串起来看,VidBot 的收益来源可以量化成一张对照图:

VidBot 结果对比总结流程图:与 VRB、Octo 的差距以及真机与下游任务表现

图 9:结果对比总结:与同源监督的 VRB 相差 +29.2 个百分点,与 Octo 相差 −19.0 个百分点,真机 55 次试验 80.0%

关键发现

  • 同源对照最有说服力:VRB 与 VidBot 共享同一批人类视频监督,成功率从 59.0% 提升到 88.2%,说明瓶颈不在数据量,而在表示层次——2D 方向向量换成度量 3D 轨迹。
  • 粗阶段是最大单点依赖:去掉粗阶段目标预测后成功率从 85.6% 掉到 57.8%,下降 27.8 个百分点,证明直接从高维观测生成细粒度动作非常困难。
  • 引导项与生成质量同等重要:多目标引导贡献 12.3 个百分点,碰撞规避与接触法向分别贡献 7.8 与 8.9 个百分点,代价启发式再加 11.1 个百分点。
  • 模式上同时命中三条创新模式:其一"制造监督信号"——用 SfM 与度量深度把纯 RGB 视频变成 3D 标签;其二"统一异构输入到同一空间"——机器人与人类手共享同一个可供性空间,本体只在推理期以代价形式出现;其三"重新表述为可解对象"——把多次采样目标点改写成单次去噪中的可微代价。
  • 下游可复用:在视觉目标到达与探索两类任务上,VidBot 收敛更快、最终成功率更高,说明可供性模型可以当作通用先验复用到策略搜索。
  • 写作层面的观察:论文开篇以一个宏大问题开场,随即拆成两个可验证的子问题,最后用 13 个任务与 55 次真机试验兑现承诺;证据框架是最强杠杆,数字前置("surpassing the runner-up method by nearly 20%"),但新颖性表述中仍保留 promising 一类弱化词。校对时还发现正文两处漏词与一处主谓不一致,阅读原文时需留意。

局限性

  • 监督质量受上游制约:3D 标签的精度取决于深度基础模型与 SfM 管线的精度,论文只用最终优化损失过滤低质量标签,没有显式建模不确定性。
  • 采集假设较强:需要已有的 SfM 结果(如 EpicFields)、移动单目相机,以及可用的手物检测与分割模型;严重动态遮挡的长视频仍会破坏重建。
  • 引导项依赖外部几何:碰撞规避需要预计算 TSDF,并假设物体可携带;三个权重 $\lambda_g$、$\lambda_c$、$\lambda_n$ 需人工设定,未见自适应策略。
  • 评测范围有限:13 个任务集中在单物体关节操作,未覆盖长程、多物体组合与双臂协同等更贴近真实家务的场景。

常见问题(FAQ)

VidBot 和 VRB 的核心区别是什么?

两者都用人类视频训练,但表示层次不同。VRB 把交互抽象成图像平面内的 2D 方向向量,VidBot 输出度量 3D 空间中的接触点与轨迹;在同一批视频监督下,成功率从 59.0% 提升到 88.2%。

VidBot 需要机器人的遥操作数据吗?

不需要。VidBot 的监督完全来自野外单目 RGB 人类视频,机器人数据只作为基线(Octo 微调)出现;论文在一台 Hello Robot Stretch 3 与一台 Boston Dynamics Spot 上做了零样本验证,55 次试验成功率 80.0%。

测试时的代价引导会不会很慢?

不会。论文把"多次采样不同目标点"重新表述为单一去噪过程中的可微代价 $\mathcal{J}_{goal}$,无需反复调用模型;碰撞规避与接触法向复用预计算的 TSDF,因此整个引导过程是单次采样内完成的。

为什么必须做度量尺度对齐?

轨迹尺度不统一时,从视频恢复的手部运动无法对应真实物理距离,作为标签会引入系统性偏差。论文先用稀疏地标重投影最小化求全局尺度,再联合优化位姿与逐帧尺度,使深度在多视图间自洽。

这个方法能直接迁移到新机器人吗?

可以,前提是新本体能提供 RGB-D 观测与深度。可供性表示与本体无关,更换机器人只需改变测试时代价中的手部或夹爪模型,论文正是在两个异构平台上验证了这一点。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐