横跨 8 年时间线:具身机器人五大数据源的发展脉络

——给数据建个坐标系

目录

01    五层金字塔:以两大核心矛盾划分数据层级

核心底层逻辑

02    两大时序演化分析,看清行业数据发展脉络

五层数据集规模演变

主流具身模型训练配方变迁

03    贡献与局限

首创标准化五层分层+六维评价体系

数据中心化拆解所有主流具身模型

系统性梳理六大未解决行业核心挑战

04    具身智能的数据底层逻辑


来自北大、港科大、南洋理工等十余所高校的30位研究者联合推出《Data Pyramid for Embodied Manipulation》。

研究提出了具身数据金字塔分层体系:

首次用统一六维指标量化全部机器人训练数据源;

梳理近三年百款具身基础模型的数据使用演进规律;

明确触觉、失败轨迹、跨本体对齐六大行业待解难题。

▲图| 综述框架总览图

01    五层金字塔:以两大核心矛盾划分数据层级

核心底层逻辑

金字塔分层的根本矛盾是可扩展性 vs 机器人对齐度,二者天然互斥:

越贴近真机可直接执行的数据,采集成本越高、越难大规模扩充;

海量低成本通用数据,和机器人控制动作完全脱节。

在此基础上补充数据质量、多样性、可复用性、物理保真度四个辅助维度,六维指标共同判定每一层数据的适用场景、短板。

从塔尖到塔底五层依次排列:真实机器人数据、UMI手持接口数据、第一/第三人称人类数据、仿真数据、通用视觉语言数据。

  • 第一层:塔尖·真实机器人数据

行业最高保真、唯一原生可执行动作数据,通过遥操作、脚本自主采集机器人闭环轨迹,自带本体 proprioception、传感器噪声、真实接触动力学。

优势:动作不用二次转换,直接部署对应硬件,物理保真度拉满,故障、真实交互细节齐全;

短板:硬件、人力、场景重置成本极高,单套数据集轨迹上限百万级别,跨机器人本体复用难度大。

典型数据集:Open X-Embodiment、RoboMIND 2.0、AgiBot World。
  • 第二层:UMI式手持采集数据

行业近两年快速普及的折中方案,不用实体机器人,人手持便携夹爪终端在任意室内外环境采集,仅记录末端6自由度相对轨迹,无机器人本体关节信号。

优势:野外无限制采集、采集成本仅真机1/10,末端动作可通过逆运动学重定向到各类机械臂;

短板:缺失机器人自身动力学、关节延迟信号,遮挡场景下位姿跟踪精度暴跌,灵巧手任务适配差。

典型数据集:FastUMI-100K、DexUMI、RealOmni。

▲图| UMI数据与真实机器人数据硬件采集对比图

  • 第三层:第一/第三人称(自我中心)人类数据

头显、穿戴设备采集人类日常操作视频,包含自然人手精细交互、海量生活化场景,是低成本扩充任务多样性的核心原料。

优势:采集无门槛,普通人日常行为即可生成海量样本,人手灵巧交互信息丰富;

短板:无标准化机器人动作标签,人类与机器人形态鸿沟巨大,必须做手部重建+动作重定向才能用于训练。

典型数据集:Ego4D、Ego-Exo4D、EgoVerse。

▲图| 自我中心数据采集与监督体系图

  • 第四层:仿真数据

各类物理引擎批量生成虚拟交互轨迹,能无限制并行采集,自动输出接触、物体位姿等特权标签。

优势:边际采集成本趋近于零,可自由扩充极端工况、失败案例,支持触觉、流体等难采集交互;

短板:固有的仿真-现实鸿沟,摩擦、形变、传感器噪声难以完全复刻,仿真生成轨迹重复性高。

典型数据集:InternData-A1、GR00T-X Sim、ManiSkill3。

▲图| 仿真基础设施与数据采集管线图

  • 第五层:底层通用视觉语言数据

全网图片、短视频、图文问答、3D场景等无交互通用素材,是模型常识、语义理解的基础原料。

优势:规模无上限,覆盖万物语义、空间常识、抽象推理;

短板:完全不存在机器人动作、接触信号,只能做预训练打底,无法直接用于策略生成。

典型数据集:LLaVA、SA-1B、ScanNet。

▲图| 通用数据任务分类示意图

02    两大时序演化分析,看清行业数据发展脉络

研究整理了2018-2026年近百份公开数据集、主流具身模型,从数据集规模、模型训练配方两个维度梳理行业演进趋势,横向对比当下各技术路线差异。

五层数据集规模演变

▲图| 五类数据集规模演进曲线横轴为时间,分别对应仿真、UMI、真机、自我中心、通用数据五大类数据集,内嵌曲线展示每类数据总量增长规律

  • 仿真数据样本量极大,但轨迹空间分布高度集中,大量重复操作,单纯堆样本收益有限。

优势:无限并行生成,可批量制造极端、故障场景,自动输出稠密标注;

短板:仿真现实差距无法根除,流体、软体、精细接触仿真精度不足。

▲图| 大规模仿真数据集表

适用大规模预训练、算法快速验证、稀有工况扩充。

在研究中明确指出:同等规模下,真机数据单条样本有效交互信息远高于仿真/网络视频,单纯比拼数据量没有实际落地参考价值。

  • UMI数据2024年后爆发式增长,FastUMI-100K等百万级轨迹数据集批量落地

优势:真机平替,低成本扩充居家、野外操作,跨机械臂迁移成本低;

短板:无本体动力学,高速、高力控任务效果大幅下滑,遮挡跟踪失效。

▲图| UMI 数据集统计表

适用场景通用桌面抓取、居家简易操作预训练,作为真机数据低成本补充。

  • 真机数据增长缓慢,硬件成本约束下很难突破百万轨迹门槛

优势:唯一可直接部署、完整还原真实物理交互,容错、恢复行为只能靠真机采集;

短板:采集周期长、硬件投入巨大,多机械臂集群数据采集门槛极高,无法快速扩充新场景。

▲图| 真实机器人数据集统计表

适用场景:最终落地微调、高精度工业操作、人形机器人整机策略训练。

  • 自我中心视频增速断层领先,仅Ego4D单套就拥有3600小时视频

优势:海量生活化灵巧操作,补充机器人稀缺精细手部交互;

短板:人机本体鸿沟大,重建、重定向 pipeline 误差会污染训练信号。

▲图| 自我中心数据集统计表

适用灵巧手、长时序家务任务预训练,提升模型常识与手部 affordance 认知。

  • 通用图文视频数据

优势:零成本海量语义、空间常识素材;

短板:无任何机器人动作与接触信息,无法支撑控制策略训练。

▲图| 通用数据集统计表

适用模型底层视觉、语言预训练,仅作为基座打底。

主流具身模型训练配方变迁

▲图| 主流具身模型发展时序图

  • 2023年早期VLA模型(RT-1、RT-2)几乎只依赖真机数据;
  • 2024-2025年Octo、GR-2开始搭配仿真+通用数据;
  • 2026年最新模型(LingbotVLA2.0、π0.7、HumanScale)全部采用五层混合配方,自我中心、UMI数据成为标配预训练原料。

三类模型的数据适配差异清晰区分行业路线:

  1. 具身大脑模型:侧重感知、规划,以底层通用、自我中心数据为主,少量真机做落地微调;
  2. VLA视觉动作模型:核心依赖真机、UMI这类带动作标签数据,仿真、通用做辅助预训练;
  3. 世界动作模型(WAM):大量仿真+人类视频做动力学预训练,真机数据修正仿真现实偏差。

03    贡献与局限

首创标准化五层分层+六维评价体系

这套金字塔给出可量化标尺,任何数据集、训练方案都能放到框架里横向对标,相当于给具身数据领域建立通用“度量衡”,也是本研究最大亮点之一。

配套开源Awesome Embodied Data Pyramid仓库整合全部公开数据集,降低新人入门门槛。

企业可直接套用“通用+仿真打底,UMI与人类视频扩充,少量真机微调”的分层配方,大幅削减真机采购与人工采集成本;配套开源仓库降低新人入门门槛。

客观局限:

仅做定性分类,缺少最优数据配比定量公式与自动化筛选评分标准,企业在实际操作中仍需大量试错。

数据中心化拆解所有主流具身模型

过往综述多聚焦模型架构,本文反向从“训练用什么数据”切入分析GR00T、Motus、Lingbot等标杆,解释不同数据配比如何影响感知、规划、动作生成、世界预测四大能力,回答“不同模型该怎么搭配数据”这个工程核心问题,对产业落地指导价值极强。

模型立项阶段即可按目标精准规划数据预算:高精度工业任务跳过通用预训练、直接聚焦真机微调;泛化家务机器人则需提前布局人类视频清洗与重定向管线。

客观局限:

对AIGC仿真生成数据(GenSim、Hydra等)着墨甚浅,且未针对世界模型对物理交互数据的前瞻需求做推演,本质是对过去的归纳而非对未来的预判。

系统性梳理六大未解决行业核心挑战

数据几乎只依赖视觉、全是成功演示、缺乏触觉与失败恢复轨迹、跨本体对齐无成熟方案、异构数据混合配方全靠试错。

04    具身智能的数据底层逻辑

大语言模型靠全网通用数据实现规模化,但具身智能永远无法复制这条路径——机器人需要“感知-物理-动作”三位一体闭环数据,单一数据源都存在致命短板。

这篇数据金字塔综述证明五层数据的互补关系:

底层通用数据搭建世界常识,中间仿真、人类视频扩充操作多样性,上层UMI、真机提供可执行动作监督。

正因为单一数据源无法同时满足“世界知识广度”与“物理动作精度”,具身智能的数据策略注定不是“二选一”,而是“怎么配”。

全文搭建的统一分析框架,会成为后续所有具身数据、具身基础模型研究的通用参考标尺。

Ref

论文标题:Data Pyramid for Embodied Manipulation

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐