摘要

本文解读 ICLR 2025 Oral 论文《Data Scaling Laws in Imitation Learning for Robotic Manipulation》。该论文提出机器人模仿学习中的数据规模化定律,通过融合UMI 手持夹爪的野外数据采集Diffusion Policy 动作扩散建模逐级隔离的受控实验,回答"数据该采多少、采多杂,才能让单任务策略在新环境、新物体上直接零样本部署",其特别之处在于用超过 4 万条演示与 1.5 万次真机 rollout,把"泛化随数据如何变化"写成可外推的幂律。实验表明环境与物体多样性远比演示数量重要:同一场景内把演示量从 50% 提高到 100% 几乎没有增益,而把环境数从 8 增加到 32 持续涨分;4 位采集员一个下午采集的数据,就能让 4 个任务在未见环境与未见物体上达到约 90% 成功率,为具身智能的数据采集预算提供了可计算的定量依据。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Data Scaling Laws in Imitation Learning for Robotic Manipulation
标题(中文)数据规模化定律:模仿学习中的机器人操作泛化
作者Fanqi Lin$^{}$、Yingdong Hu$^{}$、Pingyue Sheng、Chuan Wen、Jiacheng You、Yang Gao
机构清华大学(IIIS) / 上海期智研究院 / 上海人工智能实验室
会议ICLR 2025
arXivhttps://arxiv.org/abs/2410.18647(ICLR 2025 Oral;arXiv:2410.18647)
项目网站https://data-scaling-laws.github.io/(含任务视频、评测视频与曲线)

背景与动机

在自然语言处理与计算机视觉中,缩放定律(scaling law)早已是资源分配的语言:损失随数据量、模型规模与算力按幂律下降。机器人领域却没有对应的规律。数据规模从 RoboNet、BridgeData 一路堆到 Open X-Embodiment 的 100 万条轨迹、22 种本体,但主流路线是"大规模预训练 + 部署前微调",部署到新环境仍需采集数据。与此同时,具身智能真正想要的是零样本泛化:训练好的单任务策略,能在没见过的新环境里操作同类别的新物体。

已有工作留下了三个空白。其一,Open X-Embodiment(OXE)证明了跨本体预训练的可行性,但没有回答"泛化能力随数据规模如何变化";其二,UMIRUMs 都报告了"数据多样性带来泛化",但停留在定性观察,没有给出可外推的曲线;其三,efficient data scaling 类工作研究的是域内组合泛化,与本文关注的域外泛化不是同一问题。本文要补的正是这块:把"数据该采多少、采多杂"从经验直觉变成可测量、可预测的定律。

从时间线看,这条线索相当清晰:2020 年 Kaplan 等人的语言模型缩放定律让幂律成为预算分配语言;2023 年 OXE 用百万级轨迹解决机器人侧的"数据量";2024–2025 年本文首次给出操作模仿学习的系统性数据规模化定律,并因此获得 CoRL 2024 首届 X-Embodiment Workshop 最佳论文与 ICLR 2025 Oral;此后 FastUMI(22 环境 / 9.0K 演示)、DexWild(10 环境 / 9.5K,灵巧手)、FreeTacMan(50 环境 / 10K,含触觉)、DexUMI(力/力矩反馈)等 UMI 系数据集继续在"环境数 × 物体数"上扩展;到 2026 年,具身数据金字塔综述把"可扩展性 × 机器人对齐"列为组织轴,自动驾驶领域也出现了把规模化定律用于世界模型的工作(DriveVLA-W0,ICLR 2026)。

形式上,论文假设数据由 $M$ 个环境、$N$ 个同类别物体、每个环境-物体对 $K$ 条演示组成,用归一化分数 $S$ 衡量策略在未见环境或未见物体上的表现,并把 $Y = 1 - S$(即与满分的差距,optimality gap)与数据规模的关系假设为幂律 $Y = \beta X^{\alpha}$;两边取对数后得到线性关系 $\log Y = \alpha \log X + \log \beta$,因此只要在对数坐标下看到直线,就能反推需要多少数据。

研究主线:从问题到结论

研究主线流程图:从机器人泛化问题到幂律数据规模化定律与采集配方 图 9:研究主线。从「机器人泛化差」出发,经过环境/物体两维分解与 UMI 数据采集,最终落到幂律与可执行的采集配方(Mermaid 流程图)。

基准/方法设计

论文把"泛化"拆成两个可分别控制的维度:环境泛化指策略面对未见过场景(光照、背景、干扰物变化)时的表现,物体泛化指面对同类别新物体(颜色、尺寸、几何差异)时的表现;只有两者同时变化,才逼近真实部署条件。这种设计拒绝"受控实验室里只变一个因素"的旧范式,因为真实世界的影响因素总是同时出现。

数据来自 UMI 手持夹爪:操作者手持夹爪在野外演示,由 SLAM 恢复末端执行器位姿,不需要机器人本体,因此可以低成本地快速切换场景与物体。采集时要求随机化夹爪的初始位姿与物体的初始位置范围,约 90% 的演示能通过有效性过滤,其余因跟踪失败作废。

策略侧使用 Diffusion Policy 建模:CNN U-Net 预测动作噪声,推理时用 DDIM 把去噪步数压到 16 步以实现实时控制;视觉编码器采用全量微调的 DINOv2 ViT-L/14;动作序列之间用 ACT 的时序集成(指数加权平均重叠动作)消除切换抖动。对 Pour Water 与 Unplug Charger,还额外引入 0.25 秒与 0.5 秒之前的更远历史帧,用来消除"即将倒水"与"已经倒完"这种视觉上高度相似的状态歧义。

评测不采用二值成功率,而是把每个任务拆成 2–3 个步骤、每步给 0–3 分,最终报告归一化分数 $S = \text{总分} / (3 \times \text{步数})$,最大值为 1。这样"差一点就成功"与"完全失败"能在分数上被区分开。

论文四任务总览:Pour Water、Mouse Arrangement、Fold Towels 与 Unplug Charger 的机器人操作场景 图 1:论文使用的四个操作任务。Pour Water 与 Mouse Arrangement 用于推导数据规模化定律,Fold Towels 与 Unplug Charger 用于验证采集策略的可迁移性。

分类全景

数据维度分类图:环境数 M、物体数 N 与演示数 K 的差异化行为 图 10:数据规模化分类全景。环境数与物体数呈幂律提升,演示数则在阈值后饱和(Mermaid 流程图)。

方法细节

整套研究的关键不在于新算法,而在于把数据维度做成可控变量。论文分别构造三套数据网格:变化物体数量的物体泛化网格、变化环境数量的环境泛化网格,以及每个环境配一个独特物体的环境-物体对网格。每种网格都按 $2^m$($m = 0,1,2,3,4,5$)抽取环境或物体个数,并按 $2^n$($n = 0,-1,-2,-3,-4,-5$)抽取演示使用比例,组合起来需要为每个格子单独训练一个策略——仅物体泛化一项就训练了 21 个策略。演示数据是嵌套的,即大数据集始终包含小数据集的全部数据,保证不同规模下的数据分布可比。

训练规模同样可观:参数总量超过 3.96 亿,使用 BFloat16 精度与 8 张 A800 GPU;最小的策略训练 800 个 epoch(约 $5.3 \times 10^4$ 步),最大的训练 75 个 epoch(约 $5 \times 10^5$ 步),单次最长需要 75 小时。

评测协议方面,所有测试都在未见环境未见物体上进行:物体泛化实验使用 8 个未见物体、每个试验 5 次;环境泛化实验使用 8 个未见环境、每个试验 5 次;联合泛化实验在 8 个未见环境中、每个环境使用 2 个未见物体、每个环境试验 5 次。指标是测试员按步骤打分后的归一化分数,并给出 95% 置信区间。

8 个未见测试环境:铁柜、木质讲台、黑色工作台、双椅角落、推车、工位与两间会议室 图 2:全部任务共用的 8 个未见测试环境。它们的光照、背景与干扰物各不相同,均未出现在训练数据中。

实验设计与结果

实验覆盖 4 个操作任务,任务难度与评测判据如下:

任务步骤关键难点成功判据
Pour Water3瓶口与杯口对齐、把瓶子放回 9cm 直径的红色杯垫Step1 ≥ 2、Step2 = 3、Step3 ≥ 2
Mouse Arrangement2鼠标厚度低、姿态可能倾斜,需要非抓取推动调整Step1 = 3、Step2 ≥ 2
Fold Towels2可变形物体的高自由度抓取与折叠抓稳左边缘并折叠到位
Unplug Charger2接触力控制与快速拔出动作抓住充电器并成功拔出

按论文给出的采集配方——32 个环境-物体对、每对 50 条演示——训练的策略在 8 个未见环境、每个环境 2 个未见物体上的结果如下:

任务归一化分数成功率
Pour Water0.922 ± 0.07585.0% ± 19.4%
Mouse Arrangement0.933 ± 0.08892.5% ± 9.7%
Fold Towels0.95 ± 0.06287.5% ± 17.1%
Unplug Charger0.887 ± 0.1490.0% ± 14.1%

值得注意的是,Fold Towels 与 Unplug Charger 是在采集配方确定之后才加入的两个新任务,仍然达到约 90% 成功率,说明这不是针对最初两个任务调出来的技巧,而是可以复制的采集方法。

模型侧的消融实验(Pour Water)则给出了另一组结论:

研究项设置归一化分数
训练策略DINOv2 ViT-L/14 全量微调0.90
训练策略LoRA(rank 8)0.72
训练策略从零训练 ViT-L/140.03
训练策略冻结 DINOv2 特征0.00
视觉编码器ViT-S / ViT-B / ViT-L0.66 / 0.81 / 0.90
动作扩散模型small / base / large U-Net0.88 / 0.90 / 0.83

也就是说:预训练与全量微调缺一不可(从零训练只有 0.03 分,冻结特征几乎为 0);视觉编码器越大越好;而动作扩散网络的容量已经够用,把它从 small 放大到 large 反而从 0.90 掉到 0.83。评测指标方面,验证集 MSE 并不能替代真机分数:在环境-物体联合实验中两者强负相关($r = -0.98$、$\rho = -1.00$),但在物体泛化实验中只有 $r = -0.73$,LoRA 的 MSE 更低(0.0049 对 0.006)而实际分数更差(0.72 对 0.90)。

物体泛化实验(横轴为训练物体数,曲线为不同演示比例):

物体泛化曲线:归一化分数随训练物体数量提升,物体越多对演示量的依赖越小 图 3:物体泛化结果。物体数越多,曲线越陡;训练 32 种物体时,只用 12.5% 演示与用全部演示的差距几乎消失。

环境泛化实验(横轴为训练环境数):

环境泛化曲线:归一化分数随训练环境数量提升,50% 与 100% 演示曲线快速重叠 图 4:环境泛化结果。50% 与 100% 演示两条曲线很快重叠,说明在每个环境里多采演示几乎没有收益;环境泛化整体低于物体泛化。

环境与物体同时变化的联合泛化实验(横轴为环境-物体对数量,每个环境配一个独特物体):

环境-物体联合泛化曲线:分数随环境-物体对数持续提升,演示量收益饱和最快 图 5:联合泛化结果。分数随环境-物体对数显著提升,而演示比例的曲线重叠得更早——同时改变环境与物体提高了数据多样性,降低了对演示数量的依赖。

幂律拟合(三个子图分别对应物体、环境与联合泛化,横纵轴取对数,虚线为拟合):

幂律拟合图:双对数坐标下三条曲线与幂律拟合高度一致,可外推预测数据需求 图 6:幂律关系。数据点在对数坐标下近似落在直线上,据此外推,Mouse Arrangement 要达到 0.99 归一化分数需约 1,191 个环境-物体对(该预测尚未验证)。

多物体热图(横轴为每个环境使用的物体数量,纵轴为环境数量,颜色越亮分数越高):

多物体热图:环境数达到 16 以上时每环境多物体与单物体的差距消失 图 7:每个环境放多个物体的收益。环境数少时多物体明显涨分;环境数达到 16 及以上后,与"每环境一个物体"的差距几乎消失。

演示数量曲线(左图为最大采集设置下的总演示数,右侧为不同环境-物体对数量下的饱和过程):

演示数量曲线:分数先快速上升随后饱和,环境-物体对越少饱和越早 图 8:演示数量与分数的关系。幂律相关性很弱($r = -0.62$ 与 $-0.79$),8、16、32 个环境-物体对分别在 400、800、1600 条演示附近饱和。

结果对比总结

结果对比总结图:演示量无增益、环境数持续涨分与约 90% 成功率的采集配方 图 11:结果对比总结。演示从 50% 到 100% 几乎无增益,环境从 1 到 32 持续涨分,32 个环境-物体对 × 50 条演示即可支撑约 90% 成功率(Mermaid 流程图)。

关键发现

  • 幂律成立:泛化能力对训练物体数、环境数与环境-物体对数在双对数坐标下近似线性,与幂律 $Y = \beta X^{\alpha}$ 一致;据此外推,Mouse Arrangement 要达到 0.99 的归一化分数需要约 1,191 个环境-物体对(该预测尚未验证)。
  • 多样性压倒数量:同一批物体或环境上,演示量从 50% 提升到 100% 几乎没有增益;而把环境数量从 1 增加到 32 则持续涨分。当环境与物体同时变化时,演示量的收益饱和得最快。
  • 饱和阈值可预测:在 16 环境 × 64 物体的最大设置下,分数在 800 条演示附近饱和;在推荐配方下,8、16、32 个环境-物体对分别在 400、800、1600 条演示附近饱和——阈值大约与对数成正比。
  • 物体泛化比环境泛化容易:物体泛化曲线初始斜率更陡,环境泛化整体分数更低,说明光照、背景与干扰物的变化对视觉策略的挑战更大。
  • 每个环境一个物体就够:环境数少于 16 时,在每个环境里放多个物体会明显涨分;但环境数达到 16 及以上后,"每环境一物体"与"每环境四物体"的差距几乎消失,采集预算应优先投给更多环境。
  • 约 90% 成功率可直接复现:4 个任务(含 2 个事后加入的新任务)在未见环境与未见物体上分别达到 85.0%、92.5%、87.5% 与 90.0% 的成功率,而数据量只是 4 位采集员一个下午的工作量。

局限性

论文作者列出了四点局限,值得在做工程决策时一并考虑:

  1. 只覆盖单任务策略:研究的是单任务的零样本泛化,没有触及任务级泛化——后者需要上千个任务的数据,规模上超出本文范围。
  2. 只覆盖模仿学习:强化学习很可能进一步提升策略上限,其数据规模化规律仍是空白;本文的幂律不能直接套用到 RL 训练的场景。
  3. 采集与算法都比较单一:UMI 依赖 SLAM 跟踪,存在固有误差,约 10% 演示因此失效;算法只用了 Diffusion Policy,尚未验证换成其他学习算法后幂律是否仍然成立。
  4. 任务面偏窄:结论建立在 4 个任务、最多 32 个环境之上,能否扩展到更复杂的长程任务(例如多阶段装配)还需要验证。

此外,评测指标本身也有边界:归一化分数依赖测试员打分,带主观性;验证集 MSE 与真机表现的相关性不稳定($r$ 从 $-0.98$ 到 $-0.73$ 不等),只能作为调试工具,不能当作替代指标。

常见问题(FAQ)

这篇论文到底解决了什么问题?

它回答了机器人模仿学习里"数据该怎么采"的问题:泛化能力对训练环境数、物体数与环境-物体对数呈幂律关系,因此采集量可以被计算而不是靠猜。结论是一句话——多样性远比数量重要。

想让机器人泛化,需要采多少数据?

论文给出的配方是:每个环境-物体对采 50 条演示、每个环境只放一个独特物体、环境数量尽量多(32 个环境即可)。这样训练出的策略在未见环境与未见物体上能达到约 90% 成功率,按 4 位采集员的工作量算,大约是一个下午的数据采集量。

为什么增加演示数量没有用?

因为演示量存在饱和阈值。同一场景重复演示只会增加高度相似的状态-动作样本,策略在该场景内的误差很快收敛;而新环境、新物体带来的数据多样性会持续扩大状态分布覆盖,因此收益一直存在。论文中 50% 与 100% 演示曲线的重合、以及 400/800/1600 条的饱和点都指向这一点。

为什么环境泛化比物体泛化更难?

环境变化会同时改变背景、光照与干扰物,直接影响视觉输入的全局分布;而物体变化只改变被操作对象本身。对以视觉编码器为核心的策略来说,全局分布偏移更难吸收,因此环境泛化曲线整体更低。论文建议把采集预算优先投给环境多样性。

视觉编码器和动作网络应该怎么选?

视觉编码器要用预训练模型并全量微调:DINOv2 ViT-L/14 得分 0.90,从零训练只有 0.03,冻结特征几乎为 0,LoRA 也只有 0.72。动作扩散网络则"够用即可":small、base、large U-Net 的分数分别是 0.88、0.90、0.83,放大会略微掉分。

这篇论文为什么能拿到 ICLR 2025 Oral?

按顶会创新模式框架分析,它同时命中了三个模式:设计混淆隔离诊断工具(用 $2^m$ 网格逐格隔离环境数、物体数与演示比例,诊断本身即贡献)、审计并扭转负载假设(证明"数据越多越好"在演示量维度上不成立,真正负载的是多样性)、异构分解与差异化处理(环境、物体、联合三个子问题的斜率与饱和行为各不相同)。它既提供了结构性洞察,也提供了可复用的采集配方与评测协议。

论文有哪些需要注意的表述问题?

其一是笔误:图注中的 "Generlization" 与正文中的 "vaild";其二是 hedge 残留:那个 1,191 个环境-物体对的预测只写了 "We leave the verification of this prediction for future work.",缺少实证;其三是致谢里有一条基金号被注释掉。写作层面,它值得借鉴的地方是证据框架(反复强调 4 万条演示、1.5 万次 rollout 的实测规模)与断言式结论("Diversity is all you need."),这两者正是修辞效应最强的两个维度。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐