在具身智能研发的一线,让开发者们最头疼的往往不是底层算法的推倒重来,而是数据基建的极度匮乏。现阶段,行业普遍面临获取成本高昂、长尾场景极难覆盖、数据与单一机器人硬件(本体)重度绑定的系统性难题。单点产品(单一的数据集或仿真库)固然能解决局部问题,但在向通用大模型演进的过程中,开发者需要的是一套能够运转起来的“数据飞轮”。

北京人形机器人创新中心(以下称北京人形)率先落地了一套面向具身智能的大规模数据全链路闭环技术体系。这并非简单的“数据集+仿真工具”的拼凑,而是一个打通了真机数据、无本体数据、高保真物理仿真以及异构实体映射的自动化工程底座。本文将从技术开发者的视角,深度拆解这套全栈式数据平台的架构设计与核心链路。

核心架构:全域多模态数据基座与自动化流水线

对于算法工程师而言,一个由人工标注拼凑的“静态数据集”是远远不够的。为了支撑 PB 级别数据的流转,北京人形构建了从“前端多态设备接入”到“后端模型训练评估”的完整自动化生产管线。

  1. 跨本体与多模态的标准化接入(统一底层格式):平台当前的业务链路已成功支持 10 余类机器人本体的统一接入,覆盖了视觉、触觉、力觉、关节状态等多模态传感器件。这意味着,无论是双臂机械臂还是全尺寸人形机器人,其产生的数据都能在一个统一的框架下进行自动上传、清洗与时空对齐。

  2. 高并发的工程化质检与标注管线:面对数十类真实场景(家庭、工业、办公等)、数万小时的连续长序列数据,平台建立了一套覆盖完整性校验与异常检测的自动化质控体系。结合自动化多任务并行标注流水线,将数据质检有效率稳定维持在 92% 以上。对开发者最直接的收益是:跨机构协作时,设备集成与适配周期平均缩短了 50% 以上,实验启动效率提升了近 2 倍。

数据引擎双轮驱动:从真实世界微操到物理仿真重构

在解决了“怎么管数据”之后,下一步是“怎么造数据”。平台采用了“真机 + 仿真”的双轮混合驱动模式,以突破物理采集的极限。

真实物理交互数据基座:RoboMIND 2.0

继2024年发布RoboMIND数据集之后,2025年北京人形继续发布了RoboMIND 2.0数据集。该数据集连续斩获OS2ATC最佳开源智能突破奖、LeadeRobot2025年度具身智能数据集构建奖、并入选EAI-100 十大数据集项目与中国信通院OSCAR“开源+人工智能”典型案例集。

在真实世界数据层面,RoboMIND 2.0 数据集不仅仅是规模上的翻倍(扩增至 31 万条高质量轨迹、1000小时以上操作时长),更重要的是数据维度扩充

  • 极其稀缺的触觉数据支撑:针对高精度微操任务,包含 1.2 万余条带有法向力和切向力记录的高精度触觉操作数据,这为训练 VTLA/MLA 多模态大模型及机器人大小脑模型提供了不可或缺的底层语料。

  • 全生态模型验证: 数据集原生支持了 UVA, DP3, PI0.5, XR-1 等 8 种主流策略模型,覆盖 6 种机器人本体与 759 项任务。

    https://oscimg.oschina.net//AiCreationDetail/up-836fa4694aab2d35be8088e3d1cb9726.png

Sim2Real 突破:ArtVIP 高保真仿真资产

针对 Sim2Real 迁移中常见的视觉失真与动作僵硬问题,入选 EAI-100 十大数据集项目的 ArtVIP 开源数字资产平台(基于 Isaac Sim 构建)提供了高保真的解决方案:

  • PD²GS 技术与自监督部件解耦:创新引入 PD²GS(Pose-Dependent 3D Gaussian Splatting)技术,可将多视角拍摄的复杂物体(如多门家具)自动转化为可拆分、可连续控制的仿真资产。

  • 视觉与物理动力学双重保真:在构建标准 3D 高斯场实现照片级渲染的同时,底层精准模拟了质量、摩擦力、阻尼等物理约束。这意味着仿真环境中的冰箱门受力、闭门器阻尼、乃至灯光色温,都能与真实世界严格对齐。目前,ArtVIP 已被英伟达 Isaac Sim 5.1 版本率先引用为 SimReady 资产库。

    https://oscimg.oschina.net//AiCreationDetail/up-a84fad302c39708ebb7bae12666b6813.png

    https://oscimg.oschina.net//AiCreationDetail/up-43e6a94e285be80fd56d57b22e1287ff.png

跨越硬件壁垒:无本体泛化与异构协同闭环

实现训练技能在不同型号机器人间的迁移,是通用具身智能面临的核心挑战。平台通过异构数据转换与泛化映射技术,提供了系统性的工程解决方案:

  • 强化无本体数据:系统能够解析人类真实的物理交互行为与操作意图,使得数据获取过程彻底与特定的机器人硬件解耦,极大拓展了数据的规模化生产边界。

  • 中间层表征与异构映射:针对不同品牌、不同自由度的机器人硬件,平台建立了一套通用的运动学、动力学与语义中间层表征标准。通过动作空间的一致性表示,系统能将通用示教数据自适应地重定向并映射到新硬件上。新接入的机器人无需大规模真机重新采集,即可继承已有的通用操作技能

  • 多源异构数据清洗融合:构建了跨平台自动化管线,将“异构真机执行数据”、“无本体解析映射数据”以及“ArtVIP仿真合成数据”进行统一的格式清洗与语义标注,有效解决了多源数据流通的兼容性问题。

演进路线图:从 DaaS 化部署到认知推理

目前,整套数据平台不仅支持私有化部署与 SaaS 服务,更在全球吸引了超 200 万次的数据集下载,成功为多家科研机构和企业打造了“公共数据底座”。面向未来,该平台将向着以下四个核心维度加速演进,为开发者提供更强大的“武器库”:

  • 从“物理模仿”到“认知推理”:引入包含人类在环介入、失败恢复策略及具身思维链标注的高阶数据,辅助大模型理解常识与深层意图。

  • 高精度微操的主动感知:推动视觉、触觉、六维力觉等数据向“主动交互感知”模式转变,重点解决柔性物体操作和精密工业装配等高精度场景的技术难点。

  • 云边协同的 DaaS 管线:面向 VLA (视觉-语言-动作)架构与世界模型,构建“数据即服务”(DaaS)闭环。结合生成式 AI 与仿真引擎,实现长尾场景数据的自动合成与模型自动微调下发,加速工业级部署应用。

依托该全栈式自动化数据基座,具身智能研发人员能够有效降低数据采集与清洗的时间成本,将核心精力集中于算法前沿的探索与突破。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐