ICML 2026|机器人数据不够,OXE-AugE让一份数据跨本体复用
来源 OXE-AugE: A Large-Scale Robot Augmentation of OXE for Scaling Cross-Embodiment Policy Learning(ICML 2026 Spotlight)
作者 Guanhua Ji, Harsha Polavaram, Lawrence Yunliang Chen, Sandeep Bajamahal, Zehan Ma, Simeon Adebola, Chenfeng Xu, Ken Goldberg
具身智能现在最贵的,不一定是模型,而是换机器人。
同一个抓取策略,在Franka上跑得很稳,换成UR5e、xArm,甚至只换一个夹爪,成功率都可能掉点。VLA虽然吃了海量数据,但大量示教仍和具体硬件深度绑定。数据看起来很大,embodiment coverage却不大。
行业一边想做“一套策略控多种机器人”,另一边却还在为每个新本体重复采数、微调。
OXE-AugE给出的突破很直接:把已有真实轨迹批量“改造成”多种机器人版本,让robot embodiment本身成为新的data scaling维度。
全套《跨本体机器人学习与数据增强资料包》已整理完毕,内含OXE-AugE论文精读、AugE-Toolkit方法拆解、VLA跨本体实验对比和后续创新选题方向,以及近年相关顶会顶刊论文合集。
免费发给你。获得方式在这👇:
01|数据多了,为什么换台机器人还是掉点?
OXE汇集60多个机器人数据集,是通用机器人策略的重要数据底座。
但论文指出,Franka、xArm、KUKA iiwa和Google Robot四类机器人,占超过85%的真实轨迹。
这意味着policy学到的未必全是任务能力,还可能混进robot-scene shortcut。机械臂颜色、连杆形态、夹爪外观,都可能被模型当成捷径;一到新硬件,这些shortcut一起失效,形成典型的embodiment bias。
OXE-AugE因此不是简单扩量,而是扩本体分布:从16个常用OXE子数据集出发,引入9种机器人本体,最终得到超过440万条轨迹,规模达到原OXE三倍以上。
图1|从多数据集走向多本体:OXE-AugE的数据版图
对应论文 Figure 1

02|一条真实轨迹,怎么“变成”多台机器人?
机器人数据增强不能只换皮。可训练轨迹除了RGB observation,还绑定末端位姿和action。源数据可写为:
单条轨迹为:
其中 是视觉观测, 是夹爪6D pose, 是动作。目标不是生成一段“像另一台机器人”的视频,而是让新的图像、pose和action继续对齐,能直接进入policy training。
AugE-Toolkit走cross-painting路线:移除源机器人、补背景,再在仿真中让目标机器人重放同一条末端轨迹,最后合成回真实场景。
分割融合SAM2 mask与simulation mask,背景由E2FGVI补全,轨迹在MuJoCo中做kinematic replay。对不同reach、scale的机械臂,系统会自动搜索base pose,用OSC追踪源轨迹;不可达样本直接过滤。
关键在于新本体接入成本低:注册URDF即可进入augmentation pipeline。
图2|AugE-Toolkit:从真实示教到目标机器人轨迹的Cross-Painting管线
对应论文 Figure 2

03|本体多样性,开始出现Scaling效应
训练时,多本体数据与source data直接混合:
作者在Robosuite中以Franka为source,增强到UR5e、Kinova Gen3、Sawyer和Jaco,测试robustness、transfer和unseen embodiment generalization。
只用Franka训练的policy,一遇到lighting shift或visual occlusion就明显掉点;加入更多机器人后,鲁棒性持续回升。
更关键的是OOD机器人:目标机器人完全没参与训练时,augmentation diversity越高,zero-shot成功率越高,部分设置甚至接近直接用目标机器人增强数据训练。
这说明多本体训练正在逼policy放弃“认机械臂”,转而关注gripper-object geometry、目标位置和动作结果。Embodiment Diversity,本身开始像一条Scaling Axis。
图3|机器人增强越多,Transfer与Unseen Embodiment Generalization越强
对应论文 Figure 4

04|OpenVLA、π0上真机,最高提升45%
论文随后用OXE-AugE post-train OpenVLA-OFT和π0,并测试Franka原生夹爪,以及训练阶段完全没见过的定制Robotiq++夹爪,相当于专门制造一个hardware OOD。
四个Bridge manipulation任务上,完整N×增强后,OpenVLA-OFT平均提升24%,π0平均提升45%;在未见过的Robotiq++上,两者平均成功率分别达到75%和82%。
这组结果的价值在于:VLA跨本体,不一定只能靠每台新机器人补真机数据。 如果data engine能主动制造足够多的embodiment variation,post-training阶段就可能提前学到更硬的硬件泛化。
图4|真机验证:OpenVLA-OFT与π0都吃到了多本体数据红利
对应论文 Figure 5

05|数据竞争,可能从“采更多”转向“复用更多”
过去常见闭环是collect → finetune → deploy。换一个arm、gripper或camera setup,数据闭环重新跑一遍。
OXE-AugE试图改成:
reuse → augment → scale
真实示教仍是“母数据”,但资产利用率被放大:一条昂贵的真机轨迹,不再只属于一套hardware stack,而可以派生多个embodiment版本,给VLA更密集的跨本体监督。
当前方法也有边界:主要在2D图像空间合成,对复杂robot-object occlusion、接触动力学、动态操作和双臂任务覆盖有限。
但它留下了一个问题:当VLA进入data engine竞争,真正拉开差距的,也许不再是谁采得最多,而是谁能让同一份真实数据跨更多本体持续复用。
机器人数据的下一条Scaling Axis,可能就是Embodiment。
全套《跨本体机器人学习与数据增强资料包》已整理完毕,内含OXE-AugE论文精读、AugE-Toolkit方法拆解、VLA跨本体实验对比和后续创新选题方向,以及近年相关顶会顶刊论文合集。
免费发给你。获得方式在这👇:
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)