1500 小时砸出来的双臂机器人:XR-2 与它的“家务数据炼金术“
前几天刷 arXiv 的时候被一篇论文的摘要吓了一跳:1500 小时的双臂操作数据。做机器人学习的朋友应该都知道这个数字有多离谱——Open X-Embodiment 全家桶加起来才百万级 episode,其中真机高质量双臂数据更是稀缺品。而这篇来自 PrimeBot 研究院(上纬新材旗下)、北大和 crobotia 的论文(arXiv:2609.03591)直接掏出了 531.7 小时真机遥操作 + 约 1000 小时 UMI 手持采集,外加一个 5B 参数的 VLA 模型 XR-2,以及一套从"专家示教"到"人工接管纠错"的完整训练闭环。
更有意思的是它回答了一个行业里吵了很久的问题:**数据到底是不是越多越好?什么时候堆数据会失效,失效之后该堆什么?**论文给出的答案相当清晰:专家数据堆到 120 小时就在叠衣服任务上饱和了(84% 成功率),再加 40 小时不但没涨反而微跌到 82%;而换成 DAgger 纠错数据,三轮迭代直接把成功率从 58% 拉到 93%。这个"拐点"的发现比模型本身更有信息量。
下面按我自己的阅读顺序,把这篇论文拆开揉碎讲一遍。会涉及不少公式和架构细节,看完你应该能明白这套系统每个设计决策背后的"为什么"。
一、先说这篇论文到底干了什么
一句话版本:他们造了一台 25 自由度的移动双臂机器人,雇人用 VR 遥操作采了 531.7 小时家务数据,再用手持夹爪在 200 多户人家里采了 1000 小时"野生"数据,拿这些数据训了一个 5B 的 VLA 模型,最后用 DAgger 在线纠错把最难的任务成功率从 58% 拉到 93%。
任务域非常接地气:叠衣服、往洗衣机里塞衣服、沙发区整理、洗衣篮搬运。全是真实家庭场景,没有一个仿真环境。这和目前主流的"sim-to-real"路线是反着来的——他们完全绕开了仿真,直接用数据量硬怼真实世界的复杂性。
数据集的构成长这样:
PrimeBot Household Manipulation Dataset
├── 真机遥操作(531.7h)
│ ├── 轨迹数:32,518 条
│ ├── 总帧数:57.4M 帧(30Hz 同步录制)
│ ├── 场景:叠衣台 14.6k / 洗衣机 8.4k / 沙发 6.1k / 洗衣篮 3.4k
│ ├── 任务:12+ 个日常家务任务
│ └── 标注:帧级语言标注,合并为 11 个原子技能
├── UMI 手持采集(约 1000h)
│ ├── 场景:200+ 户家庭、100+ 采集员、5000 件衣物
│ ├── 模态:双目 egocentric 视频 960×960@30Hz
│ └── 标注:item 级 + 动作步骤级双层语言标注
└── DAgger 在线纠错(持续增长)
└── 部署时人工接管片段,自动关联子任务 prompt
注意真机数据的四类场景分布并不均匀——叠衣台占了快一半。这不是偷懒,而是刻意为之:叠衣服是整个数据集的"锚任务",后面的 scaling 实验全部围绕它展开,UMI 数据的任务分布也刻意与叠衣台对齐。先在一个任务上把 scaling 曲线测完整,再谈泛化,这个实验设计思路比很多"什么任务都碰一点"的数据集务实得多。
二、X2W:这台机器人本身就有讲头
很多人读这类论文会直接跳过硬件部分,但我觉得这篇的硬件章节信息密度很高,因为硬件形态直接决定了数据能采成什么样。
2.1 25 个自由度怎么来的
X2W 是个移动操作平台,自由度账本是这么算的:
| 部件 | 自由度 | 说明 |
|---|---|---|
| 双臂 | 2 × 7 | 每臂 7-DoF,末端各带 1-DoF 平行夹爪 |
| 腰部 | 4 | 让上身可以俯仰侧倾,够得着低处和洗衣机 |
| 头部 | 2 | 云台相机指向 |
| 全向底盘 | 3(轮) | 三轮全向移动 |
| 合计 | 22 关节 + 3 轮 = 25 控制变量 |
本体关节用的是准直驱(QDD)执行器。这个词玩过四足机器人的朋友应该很熟——电机通过低减速比减速器直连关节,牺牲一点力矩密度换来极低的反射惯量和很好的反向可驱动性(backdrivability),做接触富集操作时天然顺滑,摔到衣服上不会把布料戳个洞。
这里有个容易被忽略的细节:控制变量是 25 维,但 proprioception 状态是 89 维。论文里给了一个明确的公式:
st=(qt, q˙t, τt, ptL, ptR, qtw, q˙tw, τtw)∈R89 s_t = \left(q_t,\ \dot{q}_t,\ \tau_t,\ p_t^L,\ p_t^R,\ q_t^w,\ \dot{q}_t^w,\ \tau_t^w\right) \in \mathbb{R}^{89} st=(qt, q˙t, τt, ptL, ptR, qtw, q˙tw, τtw)∈R89
拆开看:22 个关节的位置、速度、力矩(66 维)+ 左右末端执行器位姿(12 维,两个 6-DoF 位姿)+ 3 个驱动轮的位置、速度、力矩(9 维)+ 拼接冗余 = 89。而动作空间是:
at=(qtcmd, q˙tw,cmd)∈R25 a_t = \left(q_t^{cmd},\ \dot{q}_t^{w,cmd}\right) \in \mathbb{R}^{25} at=(qtcmd, q˙tw,cmd)∈R25
即 22 个目标关节位置 + 3 个目标轮速。状态里带力矩、动作里只有位置,这个不对称是经过深思的:力矩信息让策略能"感觉到"接触力(比如夹爪正在绷紧一块布料),但控制层面用位置指令交给底层控制器去实现柔顺,策略不需要也不应该直接输出力矩——25 维的位置控制比力控稳定得多,数据也好采。
传感器配置:头部一个全局相机(场景理解 + 导航),两只手腕各一个近距相机(操作细节),外加 RealSense D435i、ZED X Mini、ZED-XONE GS 和 IMU。所有模态统一在 30Hz 上时间同步录制。头相机 + 双腕相机的"三目"布局,和后面 UMI 数据"纯腕视角"的设计形成了有趣对照,这个后面细说。
2.2 执行链路:10Hz 推理、30Hz 下发、1000Hz 控制
论文实验设置里这段话值得单独拎出来:
策略在 RTX 4090 上以 10Hz 异步推理,每次生成 50×25 的 action chunk;经时间集成(temporal ensembling)后,全身关节指令以固定 30Hz 同步下发;再由全身运动控制器实时优化,以 1000Hz 频率驱动机器人。
三个频率、三层解耦,这是目前 action chunking + VLA 部署的标准姿势,但很多论文不会把 1000Hz 这层写出来。策略只负责"想",底层控制器负责"动"——10Hz 的慢思考配上 1000Hz 的快执行,中间靠 50 步 action chunk 和时间集成做平滑衔接。这和视频编码里"低频码流决策 + 高频环路滤波"的分层思路有点神似:上层做慢速的宏观决策,下层在毫秒级尺度上处理物理世界的毛刺。
三、数据管线:两条腿 + 一个闭环
这是整篇论文我最欣赏的部分。他们的数据体系不是"采一批数据训一次"的开环流程,而是开环采集 + 闭环回流的双管线设计。
3.1 离线专家采集:SOP 化的工业化生产
真机遥操作这部分最值得学的不是遥操作本身(VR 手柄操 25-DoF 机器人现在不算新鲜事,ALOHA 系已经卷了三年了),而是他们把数据采集做成了流水线工业:
- 任务分解:长时程任务按内在结构和交互上下文拆成子任务。比如"洗一锅衣服"拆成"取衣服→放洗衣篮→搬到洗衣机前→开门→塞衣服→关门→启动"。
- SOP 标准化:每个子任务都有一份标准操作规程,规定场景布置、物体摆放、机器人初始化位姿、操作流程。操作员照着 SOP 干活。
- 云端处理:原始多模态轨迹数据上传前自动做后处理和格式转换,入库后过自动质检。
- VLM 标注 + 人工终审:用视觉语言模型自动打任务级和语言标注,最后人工抽审。
为什么要 SOP?因为多操作员、多场景、多机器人采集时,最大的敌人是分布漂移。如果没有 SOP,十个操作员会有十种叠衣服的手法,最后策略学到的是这十种手法的"平均值"——一个谁也没见过的动作。SOP 把人的自由度压在一个可控带宽内,保证数据分布紧致。这本质上是在做数据分布的码控:不追求单条数据质量最大化,而是控制整个数据集的"失真范围"。
3.2 UMI 手持采集:1000 小时的"野生"数据
真机数据再好也有天花板:机器人贵、场地固定、操作员是专业训练过的。UMI(Universal Manipulation Interface,Chi et al. 2024)路线则完全反过来——把夹爪从机器人上拆下来塞进人手里。
他们的 UMI 采集规模同样吓人:200 多户家庭、100 多个采集员、5000 件不同品类/面料/颜色/印花的衣物,采集场景从床上到桌面到晾衣架,时间从清晨到深夜(意味着光照从日光到黄昏到人工照明全覆盖),连叠衣策略都因人而异。这种多样性是任何固定机器人工作单元都给不了的。
技术上有几个点值得展开:
纯视觉、无编码器设计。 每个夹爪唯一的传感器就是腕上相机。夹爪开合度不是编码器读的,是从图像里视觉恢复的;6-DoF 末端轨迹靠视觉惯性 SLAM 重建。这样做的好处论文里说得很直白:没有编码器、电机和驱动电子设备的夹爪极轻,采集员能舒服地连续干几个小时;低功耗设计支持全天待机,单次连续录制最长 90 分钟不用重置。人机工程学决定数据产量——这是很多实验室数据集做不大的真实原因(学生举着手持设备采两小时就废了)。
为什么敢只用腕视角? 论文引用了三条证据:UMI 原文证明腕视角足以支撑双臂协同;Hsu et al.(ICLR 2022)证明手部中心视角比第三人称视角训练效率更高、OOD 泛化更好;Robot Utility Models 证明仅靠手部中心传感就能在陌生家庭零样本部署。头部视角的价值主要在导航和底盘控制,桌面操作场景下反而是冗余信息源。这个论断对做双臂系统的同学很有参考价值——不是相机越多越好,视角的选择要和任务的动作尺度匹配。
双层语言标注。 UMI 数据的标注有两个粒度:item 级片段(“叠那件红衬衫”)和片段内的动作步骤(“抓取→摊平→折叠一侧”)。这个设计直接服务于后面训练时不同粒度的指令条件化。
3.3 在线 DAgger:让失败自动变成数据
这是整个数据体系里最精彩的一环,也是标题里 “On-Policy Corrections” 的来源。
部署阶段的流程是:多台机器人用同一个策略执行完整长时程任务;一旦策略进入失败状态或需要纠偏,人类操作员临时接管,纠正或完成当前子任务,然后立即把控制权还给策略。于是一条长时程轨迹里会交替出现"策略控制段"和"人类控制段",任务不用因为每次失败而重启。
系统自动把所有人工接管片段记录为纠错示教,关联到对应子任务的 prompt,并在同一条轨迹里显式区分策略段和人类段。**数据上云即用,零额外标注成本。**随着部署机器人数量的增加,真实执行中遇到的失败源源不断地转化为新的纠错数据——一个可以自我强化的数据飞轮。
熟悉模仿学习理论的朋友看到这里应该已经条件反射了:这不就是 DAgger(Dataset Aggregation,Ross et al. 2011)吗?是的,而且是教科书级的 DAgger 工程化实现。DAgger 要解决的核心问题是分布偏移(distribution shift):纯模仿学习只见过专家访问过的状态,一旦策略在执行中犯了一点小错、漂到专家从没到过的状态,它就不知道该怎么办,错误滚雪球式放大。
这里我忍不住做个视频编码的类比,因为这个结构和开环/闭环预测太像了:纯专家示教相当于开环编码——编码器在原始序列上做决策,解码器照单全收,任何一点误差都会沿时间轴累积成漂移;DAgger 相当于闭环编码里的周期重同步——把策略自己跑出来的"脏状态"定期送回专家那里拿标准答案,误差被拉回可行域内。专家数据堆到 120 小时后失效、而 DAgger 三轮 +35 个百分点,本质上就是"开环预测已到率失真边界,闭环反馈还远没到"。
四、XR-2:MoT 架构下的 5B VLA
讲完数据讲模型。XR-2 是一个 5B 参数的 VLA(Vision-Language-Action)模型,架构上属于当下 π0 一系流行的 Mixture-of-Transformer(MoT)双专家范式:一个预训练 VLM 做感知,一个扩散/流匹配 Transformer 做动作生成,两者参数各自独立、通过 cross-attention 交互。
4.1 整体结构
语言指令 l ──┐
视觉观测 o ──┼──▶ Qwen3-VL-4B-Instruct(18 层对外暴露隐藏状态)
│ │
│ 18 层 depth-aligned
│ cross-attention ↓
│ ┌─────────────────────────┐
本体状态 s ──┼──▶ │ Action Expert(~1B) │
│ │ 18 × Transformer Block │
│ │ hidden=1024, 8 heads │
│ │ GQA: 4 KV heads │
│ │ SwiGLU FFN │
│ │ adaLN-zero(t) 条件化 │
│ └───────────┬─────────────┘
│ ↓
└──────▶ a_t ∈ R^{50×25}(action chunk)
感知侧:Qwen3-VL-4B-Instruct,4B 的多模态骨干,负责把图像和语言指令编码成隐藏状态。选 4B 而不是 7B/72B,我猜测是在 RTX 4090 上做 10Hz 推理的现实约束——毕竟实验就是在单张 4090 上跑的。
动作侧:一个 18 层的 Transformer,hidden dim 1024,8 个注意力头,组查询注意力(GQA)用 4 个 KV 头——这是标准的 KV cache 省钱配置,从多头检查点蒸馏来的(Ainslie et al. 2023)。每个 block 的数据流是:噪声动作 token 先做双向自注意力(注意是双向,不是因果的——动作 token 之间没有时序生成的必要,整块一起 denoise),然后 cross-attend 到 VLM 骨干的隐藏状态,最后过 SwiGLU FFN。
4.2 Depth-aligned cross-attention:被大多数人忽略的设计
这一处是论文里我个人认为最"值钱"的架构细节:
块 i 的 cross-attention 对齐到 18 层暴露骨干的第 i 层。动作专家因此逐步将其预测锚定在越来越抽象的 VL 特征上,而不是把所有条件化坍缩到最后一层。
常规做法是把 VLM 最后一层输出当成一个黑盒特征,动作头挂在后面猛吸。但 Transformer 各层表征的抽象层级差异巨大:浅层是边缘、纹理、局部空间关系;深层是物体、语义、“这是一只袖子”。叠衣服这种任务恰恰需要两种表征同时在线——你得知道"红衬衫"是什么(深层语义),也得知道布料褶皱的精确边缘在哪(浅层几何)。
逐层对齐让 18 个动作块各取所需:前面的块看低层特征抓几何,后面的块看高层特征懂语义。这和 DenseNet 的 dense connectivity、以及特征金字塔的思路一脉相承——层级化特征的消费方式,比"只喝最浓的那层"更高效。论文没给消融(这是我读这篇最大的遗憾之一),但这个设计在流匹配动作头里确实少见,值得复现验证。
4.3 Action Prefix Conditioning:为异步执行而生
另一个工程导向极强的设计。问题背景是这样的:action chunk 推理需要时间(哪怕 10Hz),推理期间机器人不会停下来等。那新 chunk 的起点应该从哪算起?从上一次推理时刻?不对——那段时间里机器人已经执行了旧 chunk 的一部分动作,实际状态已经前移了。
XR-2 的解法是动作前缀条件化:定义延迟 ddd,把 action chunk 前 ddd 个动作 token 视为"已提交的执行",这些 token 直接锚定在真值上、其去噪时间步固定为 t=1t=1t=1(即无噪声),只有后面的后缀 token 参与噪声注入、去噪和 loss 监督。推理时 ddd 动态取最近 RRR 轮推理的平均执行时长。
用人话说:模型生成新 chunk 时,开头那一段不是"预测"而是"已知条件"——它就是机器人正在执行的那些动作。模型学的是"在这个已承诺前缀之后接什么",而不是每次都凭空重新规划。这保证了 chunk 之间的动作连续性,避免拼接处跳变。
这个设计在视频编码里也有个远房亲戚:码流拼接时的条件刷新——新的一段 GOP 不从全零状态开始编码,而是以解码端已重建的帧为参考起点。已执行的前缀就是"解码端已有的参考帧",新 chunk 是"在此基础上继续编码的下一帧"。异构问题同构解,挺妙的。
推理时完整动作序列通过 5 步 Euler 前向积分从噪声积分出来——5 步,比早期扩散策略动辄几十步去噪快了一个量级,这就是流匹配相对 DDPM 在推理效率上的核心优势。
五、训练配方:两个阶段、一个公式家族
5.1 阶段一:条件流匹配
在 1500 小时专家数据上,XR-2 用**条件流匹配(Conditional Flow Matching)**目标训练:
LCFM(θ)=E{a,o,s,l}∼D, ϵ, t∥πθ(at,o,s,l)−(a−ϵ)∥2 \mathcal{L}_{CFM}(\theta) = \mathbb{E}_{\{a,o,s,l\}\sim D,\ \epsilon,\ t} \left\| \pi_\theta(a_t, o, s, l) - (a - \epsilon) \right\|^2 LCFM(θ)=E{a,o,s,l}∼D, ϵ, t∥πθ(at,o,s,l)−(a−ϵ)∥2
其中 ϵ∼N(0,I)\epsilon \sim \mathcal{N}(0, I)ϵ∼N(0,I),t∼Beta(1.0,1.5)t \sim \mathrm{Beta}(1.0, 1.5)t∼Beta(1.0,1.5),噪声动作块构造为:
at=(1−t) ϵ+t a a_t = (1-t)\,\epsilon + t\,a at=(1−t)ϵ+ta
拆解一下这个损失在干什么:给定一个介于噪声 ϵ\epsilonϵ 和真值动作 aaa 之间的插值点 ata_tat(插值比例由 ttt 控制),模型要回归目标流场 a−ϵa - \epsilona−ϵ——从当前位置指向真值的"速度方向"。训练完成后,从纯噪声出发,沿着模型预测的速度场做 Euler 积分,就能把噪声"流"到合法的动作分布上。
几个值得咀嚼的细节:
- t∼Beta(1.0,1.5)t \sim \mathrm{Beta}(1.0, 1.5)t∼Beta(1.0,1.5) 而非均匀分布。Beta(1.0, 1.5) 的期望是 0.4,意味着训练时更偏向采小的 ttt——也就是噪声占主导、动作还"面目模糊"的早期去噪阶段。这和扩散模型里的 noise schedule 偏置是同一类 trick:早期去噪决定动作的宏观结构(去哪儿、抓什么),后期只修细节,把学习容量往前压,宏观结构的回归质量更高。
- 回归的是速度场而不是噪声。这是 flow matching 和 DDPM 的根本分野:DDPM 预测噪声 ϵ\epsilonϵ,FM 预测速度 (a−ϵ)(a-\epsilon)(a−ϵ),后者在直线路径插值下有直闭式解,积分路径近乎直线,所以 5 步 Euler 就够。4090 上 10Hz 推理 50×25 的 chunk,这个效率是硬指标。
- 多子任务联合训练。一个策略学所有子任务,靠语言指令 lll 区分。这正是前文帧级语言标注的直接受益——11 个原子技能的标注粒度刚好够条件化用。
5.2 阶段二:DAgger 后训练,数据怎么配比是门学问
阶段二是整篇论文方法上的高潮。DAgger 轨迹流式上云后,策略在测试环境上针对失败案例继续优化。论文点出两个核心挑战:
- 学会从失败中恢复,但不能忘掉已会的技能(灾难性遗忘);
- 不同子任务学习动态不同,要均衡训练。
他们的答案是不用任何花哨算法,纯靠数据配比解决。两个决策:
决策一:按轨迹数 1:1 混合,而不是按帧数。 这是个反直觉但想通了会拍大腿的细节。不同子任务的轨迹长度差异很大(塞衣服到洗衣机可能 40 秒,抓起一件衣服只要 8 秒),如果按帧级均匀采样,长任务会被过采样、短任务被欠采样,技能覆盖被随机采样扭曲。按轨迹数配平,保住专家数据的技能分布结构。——数据混合的单位选择本身就是超参数, frame-level 和 trajectory-level 在这里给出了截然不同的结果。
决策二:DAgger 预算向弱势子任务倾斜,用一个闭式分配公式。 设子任务数 NNN,当前策略在子任务 iii 上的成功率为 sis_isi(held-out 评估集上测得),分配给子任务 iii 的 DAgger 轨迹比例为:
wi=wmin+(1−Nwmin)(1−si+ϵ)α∑j=1N(1−sj+ϵ)α w_i = w_{\min} + \left(1 - N w_{\min}\right) \frac{\left(1 - s_i + \epsilon\right)^{\alpha}}{\sum_{j=1}^{N} \left(1 - s_j + \epsilon\right)^{\alpha}} wi=wmin+(1−Nwmin)∑j=1N(1−sj+ϵ)α(1−si+ϵ)α
这个公式的结构值得逐项品味:
- 1−si1 - s_i1−si 是"需求信号":成功率越低的子任务,失败状态越多,越需要纠错数据;
- α≥0\alpha \geq 0α≥0 控制倾斜的锐度:α=0\alpha = 0α=0 退化为均匀分配,α\alphaα 越大预算越集中于弱项。论文取 α=1\alpha = 1α=1,即需求信号线性映射到预算份额——不搞赢家通吃,也不搞平均主义;
- ϵ>0\epsilon > 0ϵ>0 保证已解决的子任务权重不为零(论文取 0.05):一个 si=1s_i = 1si=1 的子任务仍有 (1−1+0.05)1=0.05(1 - 1 + 0.05)^1 = 0.05(1−1+0.05)1=0.05 的需求信号,继续获得少量数据以防遗忘;
- wminw_{\min}wmin 给每个份额兜底(论文取 0.05):先预留 NwminN w_{\min}Nwmin 的总预算做地板,剩余 1−Nwmin1 - N w_{\min}1−Nwmin 按上式比例分配。数学上保证 ∑iwi=1\sum_i w_i = 1∑iwi=1 且 wi≥wminw_i \geq w_{\min}wi≥wmin,闭式可解,不用迭代优化。
这个设计的高明之处在于它同时回答了两个矛盾诉求:预算要流向弱项(提升),但强项不能断粮(防遗忘)。ϵ\epsilonϵ 和 wminw_{\min}wmin 这两个小参数就是两道保险,成本几乎为零。相比那些上强化学习、上课程学习的复杂方案,这种"把先验知识翻译成数据采样权重"的做法工程上稳健得多——训练目标函数一个字没改,改的是喂进去的数据分布。
顺带一提,这个公式对做自适应量化的朋友应该也很眼熟:1−si1 - s_i1−si 扮演失真率的角色,α\alphaα 是率失真倾斜因子,wminw_{\min}wmin 是每宏块的最小码率保障。资源分配问题的数学骨架跨领域通用。
每轮 DAgger 迭代做 2.5 个 epoch 的后训练——注意这个"半截 epoch",说明他们很清楚纠错数据是小样本,多训几轮必过拟合,宁可欠一点也不冒过拟合的风险。
六、实验:两条 scaling 曲线讲了一个完整的故事
6.1 专家数据:从 34% 到饱和
叠衣服任务上,训练数据从 10 小时一路加到 160 小时(8000 条轨迹):
| 有效专家数据 | 成功率 |
|---|---|
| 30h | 34% |
| …单调上升… | … |
| 120h | 84% |
| 160h | 82%(饱和,甚至微跌) |
前 120 小时呈清晰的单调上升——数据集本身支持持续 scaling,这是对数据质量的间接背书。但最后 40 小时不再带来收益。论文对拐点的解释相当克制也非常到位:120 小时之后,专家示教已经稠密覆盖了任务分布;残余的失败来自策略在测试时才到达的状态,这些状态在专家分布之外,再多的专家数据也供给不了。
这句话值得每个做机器人学习的人贴在显示器上。模仿学习的数据价值不是无限可加的——专家数据的价值上限被"专家本人会经过的状态空间"封顶了。这就像开环编码的率失真边界:码率再高,没有反馈信道,信道误码的损伤就是无法恢复的。
(严格说 84%→82% 的微跌在统计噪声范围内,不必过度解读成"数据多了有害",定性结论就是饱和。)
6.2 DAgger:58% → 93% 的三连跳
DAgger 实验从一个 18,695 条专家轨迹、覆盖 10 个子任务的 checkpoint 起步(对应叠衣 58% 成功率),每轮按公式 (4) 计算各子任务的 DAgger 轨迹预算,采数据、混数据、2.5 epoch 后训练:
起点(仅专家数据) DAgger 第1轮 第2轮 第3轮
58% ──▶ 74% ──▶ 82% ──▶ 93%
(+16) (+8) (+11)
累计 +35 个百分点
三轮迭代累计 +35 个百分点,且每一轮都在涨,没有出现第二轮后饱和的迹象。对比专家数据侧的 84% 天花板,DAgger 用相对少量的纠错数据(论文没给具体小时数,但从三轮的增幅看规模远小于 120h 专家数据)持续突破上限——因为它供给的恰恰是专家分布外的状态-动作对,即策略自己制造的失败。
两条曲线放在一起,论文的核心论点就立住了:
堆数据(scaling)和围绕在线失败结构化数据(DAgger)是互补的杠杆,而非竞争关系。 专家数据负责把策略推到"专家能到的最好水平",纠错数据负责把策略从"自己的失误"里捞出来。前者的收益递减点,正是后者开始发力的起点。
6.3 一个诚实的补充数据点
论文还老实交代了一个容易被藏起来的细节:测试环境全部做了轻度泛化(衣物尺寸、颜色、机器人初始位姿变化),85% 泛化条件下的成功率对应分布内条件下 95%+ 的成功率。8~10 个点的泛化 gap,说明模型确实在学任务而不是在背场景。敢报这个 gap 的论文不多。
七、我的几点看法
通读下来,这篇论文的方法论部分没有一个全新算法——MoT 是 π0 的路子,DAgger 是 2011 年的古典方法,流匹配是 2022 年的技术,Qwen3-VL 是现成骨干。但它的价值恰恰在于用工业级的数据工程把这套已知的组合拳打到了 1500 小时的规模,并第一次在双臂家务域上把专家/纠错两类数据的 scaling 行为测清楚了。
几点个人观察:
1. 数据工程 > 模型创新的时代信号越来越强。 这篇论文真正难复现的不是那个 18 层的 action expert(一周能写出来),而是 200 户家庭 1000 小时的 UMI 采集和 32k 条 SOP 化真机轨迹。论文致谢里专门感谢了数据团队"outstanding operational skills"——当算法趋于收敛,壁垒向数据运营迁移。AGI、Droid、RoboMind 之后,这个趋势已经没有悬念了。
2. UMI 的"人机工程学决定数据产量"是个被低估的洞察。 无编码器夹爪轻一斤,采集员就能多干两小时,数据集就多 5%。做数据硬件的团队值得把"采集舒适度"当一等公民指标来优化。
3. 遗憾也有。 depth-aligned cross-attention 没有消融实验,无法归因它贡献了几个点;DAgger 数据量没有公开小时数,导致纠错数据的"性价比"只能定性感受;11 个原子技能的合并规则没有细说。复现者需要自己踩这些坑。
4. 对做具身智能数据集的团队,这篇是必读。 尤其是公式 (4) 那个预算分配器,几乎可以直接搬进任何多任务后训练管线——五个参数,闭式解,防遗忘有兜底,比我见过的一堆复杂的课程学习调度器实用。
5. 和视频编码的深层同构让我反复回味。 开环示教与闭环纠错的互补,本质上是"前向预测"和"反馈信道"的互补。视频编码走了三十年,从纯开环的 MPEG-1 演进到闭环 + 后处理 + 自适应环的 VVC/AV1;模仿学习正在走同一条路:从纯行为克隆,到 DAgger 反馈,再到这篇论文展示的规模化闭环数据飞轮。领域不同,"反馈结构的工程化"都是走向实用化的最后一公里。
数据集已经开源(HuggingFace: challenge-2026/challenge_data,含 URDF),配套的 IROS-2026 Household Bimanual Manipulation Challenge 正在进行中。想入局双臂操作的同学,这可能是目前最好上手的一套真实数据。
论文:Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections (arXiv:2609.03591)。机构:PrimeBot Research Institute (Swancor)、北京大学、Crobotia。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)