机器人数据采集技术栈全景
0.前言:机器人真正的竞争力,正在从模型转向数据
过去两年,OpenVLA、GR00T、π0、LeRobot 等具身智能项目不断涌现,让机器人模型能力快速提升。很多人认为,这是因为模型越来越大、算力越来越强。
但如果回顾近两年的机器人研究,一个更明显的趋势正在出现:越来越多团队开始把关注点放在数据(Data)本身,而不仅仅是模型。从 UMI、ALOHA 到 Ego 系列项目,不同研究都在探索一个共同的问题——如何更高效地采集高质量机器人数据。 因为对于具身智能而言,模型决定能力,而数据决定模型能力的上限。
于是,一个新的问题摆在了每一个机器人开发者面前:
今天,我们应该如何构建一套完整的机器人数据采集流程?
答案已经不再是简单地录制视频或保存机器人轨迹,而是涵盖示教、遥操作、多模态传感器、数据同步、数据管理以及模型训练等完整的数据采集技术栈(Robot Data Collection Stack)。本文将结合 UMI、ALOHA、Ego 等代表性开源项目,梳理当前机器人数据采集技术的发展脉络,并进一步探讨松灵机器人(AgileX Robotics)的 PiKA PRO为代表的企业Ego-centric 具身智能数据采集方案正在如何推动具身智能进入数据驱动的新阶段。
1.机器人数据采集技术栈:机器人数据采集,不只是"录数据"
提到机器人数据采集,很多人的第一反应往往是:打开相机,启动机器人,记录视频和机器人轨迹。事实上,这只是整个数据采集流程中的第一步,首先我们需要思考机器人到底需要采什么数据?
对于现代具身智能而言,一条能够用于模型训练的数据,远不止包含一段视频或一条机械臂轨迹。它通常需要同时记录机器人状态、传感器信息、环境变化、操作者动作以及任务指令等多种信息,并保证这些数据在时间轴上保持同步,最终以统一的数据格式组织,才能真正用于模型训练。
换句话说,数据采集已经从过去简单的"记录(Recording)",演变成了一套完整的数据工程(Data Engineering)。
我们可以将这一过程理解为一套 Robot Data Collection Stack(机器人数据采集技术栈)。
整个技术栈中,每一层都承担着不同的职责:
-
Human Demonstration:如何高效获取高质量的人类示教数据,例如 UMI 等低成本示教方案。
-
Teleoperation:如何通过遥操作设备完成机器人动作采集,例如 ALOHA 等双臂遥操作平台。
-
Multi-modal Sensors:同步采集 RGB、深度、力觉、IMU、机器人状态等多模态信息,为模型提供更完整的环境感知。
-
Dataset Format:将来自不同设备的数据按照统一格式组织,例如 LeRobot Dataset、RLDS 等数据规范。
-
Data Engine:负责数据同步、存储、管理、回放、质量检查及导出,是连接采集与训练的重要基础设施。
-
Policy Training:最终利用采集的数据训练 Diffusion Policy、ACT、OpenVLA 等机器人策略模型。
因此,当我们今天讨论机器人数据采集时,真正关注的已经不再是"如何录制一段数据",而是如何建立一条从数据产生、数据管理到模型训练的完整数据流水线(Data Pipeline)。
而近年来出现的 UMI、ALOHA、Ego、LeRobot 等项目,本质上都是在这条技术栈中的不同层级解决各自的问题,共同推动机器人学习进入数据驱动的新阶段。
2.数据从哪里来
2.1 机器人最早是如何学会动作的:Kinesthetic Teaching
在机器人学习早期,大多数示教任务并不依赖复杂的数据采集平台,而是采用最直接的方式——人工拖动机器人完成一次操作,并记录机器人关节轨迹。这种方式通常被称为 Kinesthetic Teaching(拖拽示教)或 Hand Guiding。
目前,包括 Franka Emika、Universal Robots(UR)等机器人平台都提供了 Hand Guiding 功能,开发者可以直接拖动机器人完成目标动作,系统自动记录各关节的位置、姿态以及运动轨迹,并用于后续轨迹复现或模型训练。
整个流程可以理解为:

作为机器人领域最经典的示教方式,Kinesthetic Teaching 具有以下特点:
-
示教过程简单直观,学习成本较低。
-
机器人直接记录真实关节运动轨迹,数据精度高。
-
无需额外视觉定位或轨迹恢复算法。
-
广泛应用于工业机器人编程、模仿学习以及实验室研究。
但由于需要操作者直接接触机器人完成示教,采集效率相对较低,且难以快速构建大规模数据集,因此更多适用于小规模任务验证和精细操作示教。
2.2 低成本获取机器人示教数据:UMI
机器人学习的第一步,是拥有足够多的高质量示教数据(Demonstration Data)。传统的数据采集方式通常依赖人工拖动机器人、示教器编程或专业遥操作设备,不仅设备成本高,而且采集效率较低,很难快速构建大规模训练数据集。这也成为早期机器人学习发展的重要瓶颈之一。
UMI(Universal Manipulation Interface)的提出,正是为了解决这一问题。与传统机器人示教不同,UMI 并不要求操作者直接控制机器人,而是让操作者手持一个轻量化夹爪完成真实操作,同时利用第一视角相机和 SLAM 技术恢复夹爪在空间中的运动轨迹。
整个流程可以理解为:
Human Demonstration
│
▼
Hand-held Gripper
│
▼
Camera + SLAM
│
▼
Trajectory Reconstruction
│
▼
Robot Dataset
相比传统示教方式,UMI 最大的优势在于:
-
降低了机器人示教成本,无需机器人参与即可完成数据采集。
-
人类操作更加自然,能够快速获得大量连续轨迹数据。
-
数据采集流程简单,更容易在不同实验室之间复现和扩展。
从整个 Data Collection Stack 来看,UMI 解决的并不是机器人如何学习,而是更基础的问题——如何以更低成本、更高效率采集高质量示教数据。
2.3 机器人直接学习人类操作:ALOHA
随着机器人操作任务越来越复杂,仅仅恢复人类运动轨迹已经无法满足高精度操作需求。对于双臂协作、装配、折叠衣物等任务,研究者希望机器人能够直接复现人类的操作过程,从而获得更加真实、稳定的训练数据。
斯坦福基于松灵 TRACER 系列底盘的ALOHA(A Low-cost Open-source Hardware System for Bimanual Teleoperation)数采方案的提出,为机器人遥操作数据采集提供了一种低成本解决方案。ALOHA 采用 Leader-Follower(主从控制)架构,操作者通过 Leader Arm 控制机器人完成动作,Follower Robot 实时同步执行,并记录机器人关节状态、末端位姿、相机图像等多种信息,最终形成完整的示教数据。
整个流程可以理解为:

相比传统示教方式,ALOHA 的主要优势包括:
-
机器人直接执行任务,无需后续轨迹映射。
-
可同步记录机器人关节、末端位姿及视觉信息。
-
特别适用于双臂操作、精细装配等复杂 Manipulation 任务。
-
已成为 ACT、LeRobot 等机器人学习项目常用的数据采集方案之一。
从整个 Data Collection Stack 来看,ALOHA 更关注的是如何高质量获取机器人真实执行过程中的示教数据(Robot Demonstration)。
2.4 从动作到意图:Ego
随着 Vision-Language-Action(VLA)模型的发展,机器人学习的目标已经不仅仅是复现动作,而是理解人类为什么这样操作。仅依赖机器人轨迹,模型能够学习"做了什么",却很难理解"为什么这样做"。
因此,近年来越来越多研究开始采用第一视角(Egocentric)数据采集方式,通过记录操作者第一视角视频、手部动作、语言指令以及周围环境信息,让机器人学习人与环境之间的交互过程。
典型的 Ego 数据采集流程如下:
Head Camera
│
├── Hand Motion
├── Scene Observation
├── Language
└── Environment
│
▼
Multi-modal Dataset
相比传统示教方式,Ego 数据采集具有以下特点:
-
第一视角更加接近真实人类操作过程。
-
可同步采集视觉、语言、动作等多模态信息。
-
有助于机器人学习任务意图和决策过程。
-
广泛应用于 VLA、World Model 等具身智能研究。
从整个 Data Collection Stack 来看,Ego 更关注的是如何帮助机器人理解人类操作背后的意图(Human Intentions)。
2.5 如何融合不同数采方案?——从单一方案到开放式数据采集平台
回顾当前机器人领域主流的数据采集方案可以发现,不同方案各有优势,也分别适用于不同的研发场景。
-
Kinesthetic Teaching 适用于机器人快速示教和小规模任务验证;
-
UMI 适用于低成本、大规模的人类示教数据采集;
-
ALOHA 更适合双臂遥操作和机器人真实执行数据采集;
-
Ego 能够记录第一视角信息,帮助机器人理解人类操作意图;
随着具身智能进入规模化数据驱动阶段,越来越多团队开始发现,一个完整的数据采集流程往往并不会只采用其中一种方案,而是根据任务需求进行组合。在这样的场景下,真正需要解决的问题已经不再是"选择哪一种数采方式",而是"如何让不同设备、不同传感器和不同采集方式协同工作"。
例如:
-
如何同时接入 UMI 手持夹爪与机器人末端夹爪?
-
如何同步 Ego 第一视角相机与机器人视觉数据?
-
如何统一管理 RGB、Depth、机器人状态、力觉等多模态信息?
-
如何让不同来源的数据采用统一时间戳和统一格式进行存储?
这也是近年来机器人数据采集逐渐从"单一工具"演进到"开放式数据采集平台"的重要原因。在这一背景下,多种数据采集方式进行灵活组合成为当前的主流方案,以松灵 PiKA PRO为代表的的数采设备定位并不是替代单一的数采方案,而是提供一套更加开放、可扩展的数据采集平台,将机器人本体、机械臂、夹爪、第一视角相机以及多种传感器统一接入到同一个数据采集流程中,实现多设备协同、多模态同步以及标准化数据管理。
3.企业级机器人数采方案:从单一数采到数据生产平台
前文介绍的 Kinesthetic Teaching、UMI、ALOHA、Ego 以及多模态数据采集,为机器人学习提供了丰富的数据来源。但在企业级研发场景中,真正的挑战已经不再是"如何采集一组数据",而是如何持续、稳定地生产高质量机器人数据,本文将以松灵 PiKA PRO 为例,介绍如何搭建一体化的数据采集平台,将原本分散的采集设备整合为完整的数据生产系统。
(1)PiKA Ego
-
负责:
第一视角。
-
对应:
Ego Collection
PiKA Ego 用于采集操作者第一视角视频及环境信息,可用于记录人机交互过程,为 Vision-Language-Action(VLA)模型提供更加真实的第一视角数据。
(2)PiKA Sense
-
负责:
夹爪
视觉
感知
-
对应:
UMI
PiKA Sense 集成视觉感知与夹爪交互能力,可用于采集操作轨迹、视觉信息以及机器人执行过程中的多模态数据,为低成本示教和 Manipulation 数据采集提供支持。
(3)PiKA Package
-
负责:计算,数据存储
PiKA Package 提供统一的数据计算与存储能力,对来自不同设备的数据进行集中管理,为后续数据处理与模型训练提供统一的数据基础。
从整体来看,PiKA 系列并不是多个独立设备的简单组合,而是围绕机器人数据采集流程构建的一套完整生态,其中:
-
PiKA Ego 负责采集第一视角数据,帮助模型理解人与环境的交互过程;
-
PiKA Sense 负责采集操作轨迹、多模态感知信息以及夹爪交互数据;
-
PiKA Package 提供统一的计算、存储和数据管理能力;
不同模块各司其职,共同覆盖了从数据采集、数据同步到数据管理的完整流程,为机器人训练提供持续、稳定的数据生产能力。从行业发展趋势来看,未来企业级机器人数采平台的竞争重点,不再是单个设备的性能,而是能否围绕不同的数据采集方式构建完整的数采生态,实现第一视角、遥操作、多模态感知以及机器人状态等数据的统一组织与管理。
4.结语
如果说过去机器人研发的核心是算法,那么未来机器人研发的核心之一,将是数据生产能力。无论是 Kinesthetic Teaching、UMI、ALOHA、Ego,还是多模态数据采集,它们都代表了机器人数据采集在不同阶段、不同场景下的探索方向。而企业级数据采集平台的出现,则进一步推动机器人研发从"一次性采集"迈向"持续化数据生产"。
未来,随着 VLA、World Model 以及具身智能基础模型不断发展,机器人对于真实世界数据的需求仍将持续增长。如何构建更加开放、高效、标准化的数据采集体系,也将成为机器人研发的重要课题。松灵 PiKA 系列数据采集套件正是围绕这一理念进行设计,通过模块化设备协同,帮助开发者根据不同任务灵活组合数采方案,构建适用于具身智能研发的数据基础设施。

FAQ
Q1:机器人数据采集(Robot Data Collection)有哪些主流方案?
目前主流的机器人数据采集方案主要包括五类:
-
Kinesthetic Teaching:通过手动拖动机器人完成示教,记录机器人关节轨迹,适用于工业机器人和小规模示教。
-
UMI(Universal Manipulation Interface):利用手持夹爪、第一视角相机和 SLAM 技术采集人类示教数据,具有成本低、部署简单等特点。
-
ALOHA Teleoperation:采用 Leader-Follower 遥操作架构,由机器人直接完成动作执行,适用于双臂操作和模仿学习。
-
Egocentric Collection(Ego):采集第一视角视频、手部动作及环境信息,帮助机器人学习人类操作意图。
-
Multi-modal Collection:同步采集视觉、机器人状态、语言、力觉等多模态数据,为 VLA、World Model 等模型提供训练数据。
不同方案适用于不同的数据采集场景,并不存在唯一的最佳选择。
Q2:UMI、ALOHA 和 Ego 有什么区别?
三者分别解决机器人数据采集中的不同问题:
-
UMI 更关注如何低成本获取大量示教数据,适合快速构建 Demonstration Dataset。
-
ALOHA 更关注机器人真实执行过程中的遥操作数据采集,能够直接记录机器人关节状态和控制信息。
-
Ego 更关注理解操作者的意图和环境交互,适用于 Vision-Language-Action(VLA)模型和具身智能研究。
在实际项目中,这三种方案通常可以结合使用,而不是相互替代。
Q3:为什么具身智能越来越强调多模态数据采集?
随着 Vision-Language-Action(VLA)、Diffusion Policy 和 World Model 等模型的发展,机器人已经不能仅依赖单一的视觉信息或运动轨迹进行学习。
现代机器人数据集通常会同步采集:
-
RGB 图像
-
Depth 深度信息
-
第一视角视频
-
Robot State
-
力觉与触觉
-
语言指令
多模态数据能够帮助机器人更全面地理解环境、任务目标以及人与机器人的交互关系,从而提升模型的泛化能力。
Q4:企业为什么需要机器人数据采集平台,而不仅仅是单个数采设备?
实验室研究通常关注完成一次数据采集,而企业研发更关注持续、高质量地生产数据。
因此,企业级数据采集平台除了完成数据采集外,还需要支持:
-
多设备统一接入;
-
多传感器时间同步;
-
第一视角与机器人数据协同采集;
-
数据管理、回放和导出;
-
面向模型训练的数据标准化管理。
例如,像 松灵 PiKA PRO 这样的企业级数采套件方案,更关注不同数采设备之间的协同,而不仅仅是单一设备的性能。
Q5:未来机器人数据采集的发展趋势是什么?
机器人数据采集正在从单一示教工具向开放式数据采集生态发展。
未来的发展趋势主要包括:
-
多种数采方式协同(UMI、ALOHA、Ego 等组合使用);
-
多模态传感器融合(视觉、语言、力觉、机器人状态等);
-
企业级数据采集平台统一管理多设备和多数据源;
-
数据采集、数据管理与模型训练形成完整的数据闭环;
-
支持 VLA、World Model、具身智能基础模型等新一代 AI 系统的数据需求。
随着机器人研发逐渐进入数据驱动阶段,持续生产高质量、多模态数据将成为未来具身智能的重要基础能力。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)