0.前言

随着 Vision-Language-Action(VLA)模型和机器人基础模型的发展,具身智能正在从“程序驱动”逐渐走向“数据驱动”。不同于互联网 AI 可以通过海量文本、图像获取知识,机器人学习需要来自真实世界的交互数据,包括视觉信息、动作轨迹、空间状态以及环境反馈。如何高效获取高质量、多模态的机器人数据,正在成为具身智能发展的关键挑战。

从传统拖拽示教、遥操作采集,到近年来兴起的第一视角数据采集,机器人数据获取方式正在不断演进。针对这一需求,松灵机器人(AgileX Robotics)推出 Pika Pro 具身智能数据采集套件,通过第一视角采集人类在真实环境中的操作过程,并结合机器人状态、动作及空间信息进行数据关联,为后续机器人学习提供数据基础。

本文将围绕机器人数据采集的发展趋势,分析当前主流方案,并探讨 Pika Pro 如何帮助构建面向具身智能时代的数据闭环。

关键词:具身智能,具身智能数据采集,Ego-centric,松灵机器人,VLA

松灵 Pika Pro Ego-centric数采方案
​​

1.机器人正在经历一次数据驱动的范式转变

过去几十年,机器人产业的发展主要围绕机械结构、控制算法以及自动化流程展开。工业机器人能够在高度结构化环境中完成重复任务,但面对开放环境中的复杂操作,例如整理物品、抓取未知物体、人与机器人协作等任务,传统机器人依赖人工编程的方法逐渐遇到瓶颈。

随着 Vision-Language-Action(VLA)模型和具身智能的发展,机器人正在从“执行预设程序”向“通过数据学习技能”转变。然而,与大语言模型可以从互联网获取海量文本不同,机器人学习需要真实世界中的视觉、动作、空间和交互数据。

因此:

如何高效获取高质量机器人数据,正在成为具身智能发展的关键问题。

2.为什么机器人数据成为瓶颈?

在前期LLM起步阶段,数据来源于互联网规模化非结构数据,但是互联网 AI 中依赖海量数字内容进行规模化训练的方式,难以直接复制到机器人领域。具身智能模型的训练相比之下又需要更多同时满足“多模态”和“动作闭环”。

2.1 机器人数据与互联网 AI 数据存在本质差异

过去几年,大模型的发展依赖于互联网中海量的数据资源。对于 ChatGPT、视觉大模型等系统而言,训练数据主要来自:

  • 网络文本

  • 图片

  • 视频

  • 代码

  • 文档

这些数据具有一个共同特点:

数据天然存在,并且可以低成本规模化获取。

例如,一个语言模型可以通过阅读大量网页内容学习:

  • 什么是物体

  • 什么是语言关系

  • 什么是知识逻辑

模型只需要理解:

输入:

一句话

输出:

下一句话

本质上是一个信息预测问题。但机器人学习面临的是完全不同的问题。机器人不仅需要“理解世界”,还需要:

在真实世界中采取行动,并获得反馈。

因此,对于需要进行真实世界交互的机器人学习任务而言,仅依赖视频或图片通常不足以完整描述任务执行过程,还需要结合动作、状态以及环境反馈等信息。

例如,一个机器人学习“拿起杯子”这一任务:

单张图片只能告诉模型:

这里有一个杯子

但机器人真正需要学习的是:

杯子在哪里?

机械臂应该移动到什么位置?

末端执行器应该如何调整姿态?

夹爪需要施加多大的力度?

抓取后如何移动?

如何避免碰撞?

因此,机器人数据天然包含:

  • 环境状态(State)

  • 感知信息(Observation)

  • 动作指令(Action)

  • 执行结果(Feedback)

形成一个完整的数据闭环:

观察环境

理解任务

执行动作

获得反馈

调整策略

这也是机器人数据与互联网数据最大的区别:

互联网 AI 学习的是“世界是什么”,而机器人 AI 学习的是“如何改变世界”。

2.2 机器人数据不仅需要“大”,更需要“有效”

大模型研究表明,在一定条件下,模型规模、训练数据规模和计算资源的扩展能够带来能力提升。但在机器人领域,仅扩大数据规模并不足以保证模型能力提升,数据质量、多样性、动作关联以及真实环境覆盖同样重要。

但对于机器人而言:

数据规模并不是唯一指标,高质量、高关联性的机器人数据更加重要。

因为机器人面对的是高度复杂的物理环境。

例如:

让机器人学习抓取一个杯子。

如果只有大量:

杯子的图片

杯子的类别识别

机器人只能知道:“这是一个杯子”。但它不知道:手应该从哪里靠近? 应该怎样调整角度? 需要多大的抓取力度? 放置时如何保持稳定?

因此,机器人训练数据必须包含:

从感知到动作的完整映射关系。

2.3 真正让机器人理解环境的多模态数据

为了让机器人具备更强的环境理解能力,实现视觉感知、语言推理与执行控制的深度融合,模型训练需要依赖大规模、多模态、高质量的机器人数据。只有通过持续的数据规模化积累,才能推动具身智能模型实现真正意义上的 Scaling,进一步提升机器人的泛化能力与自主执行能力。

一条完整机器人数据通常包含: (1)视觉数据 RGB Image

视觉数据负责告诉机器人:

“环境中有什么?”

摄像头传感器捕获:

  • 物体类别

  • 颜色

  • 位置

  • 场景信息

(2)深度信息 Depth

RGB只能告诉机器人:

二维图像关系。

但机器人操作需要知道:

“物体距离我有多远?”

深度数据提供:

  • 空间距离

  • 三维结构

  • 物体表面信息

(3)位姿数据 Pose

机器人需要知道:

自身和目标的位置关系。

例如:

机械臂:

末端位置:

x=0.35m

y=0.12m

z=0.45m

rotation=(...)

这些数据帮助机器人完成:

  • 运动规划

  • 轨迹控制

  • 精准操作

(4)动作轨迹 Action

这是机器人数据区别于普通视觉数据最重要的一点。

机器人不仅需要知道:“人做了什么”,还需要知道:“人如何完成这个动作”,如下所示案例:

例如:启动机器人完成某个动作需要经历以下的动作规划

t1:

机械臂移动

t2:

调整姿态

t3:

夹爪闭合

t4:

提升杯子

(5)机器人状态 State

包括:

  • 关节角度

  • 电机状态

  • 速度

  • 力反馈

例如:

机械臂抓取过程中:

Joint State

判断当前位置

调整下一步动作

在完成多模态数据采集的基础上,数据处理阶段还需要进一步关注从原始感知数据到动作标签的有效关联。通过对视觉、状态、位姿以及操作轨迹等信息进行时间同步与语义标注,将机器人观察到的环境状态(Observation)与执行动作(Action)建立对应关系,形成可用于模型训练的高质量数据。

普通视觉数据:

人拿杯子的视频

机器人看到:

人完成了拿杯子

但是机器人不知道:

  • 手为什么移动到这里?

  • 为什么选择这个抓取角度?

  • 什么时候闭合手指?

  • 如何调整力度?

因此,具身智能需要的是:

带动作标签的视频数据(Action-Labeled Data)。

例如:

任务:

“拿起桌上的杯子”

完整数据:

Observation: 摄像头图像

Robot State: 机械臂当前状态

Action: 关节运动 夹爪控制

Feedback: 是否抓取成功

形成:

视觉输入

任务理解

动作生成

机器人执行

环境反馈

因此正因为具身智能模型所需训练数据:多模态、强时序、强动作关联、强环境依赖特性,传统互联网数采模式无法满足其需求,必须通过

  • 遥操作(Teleoperation)

  • 第一视角采集(Ego-centric)

  • 机器人自主采集

  • 仿真数据生成

等方式获得,最终建立如下图所示的流程框架:

真实环境

多模态数据采集

机器人数据集

模型训练

机器人能力提升

数据采集正在从模型训练前端的辅助环节,逐渐成为连接真实世界、机器人与智能模型的重要基础设施。

松灵 Pika Pro 套件的多模态感知融合

3.如何高效获取真实世界机器人数据?

目前,行业主要通过多种方式获取机器人示教数据(Robot Demonstration Data),包括:

  • Kinesthetic Teaching(拖拽示教)

  • Teleoperation(遥操作)

  • Vision-based / Ego-centric Data Collection(第一视角数据采集)

  • Simulation Data Generation(仿真数据生成)

不同方案在数据质量、采集成本以及适用场景上存在明显差异。

3.1 Kinesthetic Teaching:基于机器人本体的直接示教

Kinesthetic Teaching(拖拽示教)是机器人数据采集中最经典的方法之一。

该方法通过人工直接拖动机器人完成目标动作,并同步记录机器人自身状态数据,包括:

  • 关节角度(Joint States)

  • 末端位姿(End-effector Pose)

  • 运动轨迹(Trajectory)

相比传统编程方式,Kinesthetic Teaching 不需要开发者提前设计复杂运动规划逻辑,操作者可以直接通过物理交互告诉机器人:

“我希望机器人如何完成这个动作。”

目前,包括

当前部分协作机器人平台已经支持 Hand Guiding 等直接示教功能,使开发者能够快速完成任务示教。

Kinesthetic Teaching 的主要优势:

  • 操作方式简单直观:无需复杂编程,降低机器人示教门槛;

  • 数据精度高:机器人直接记录真实运动轨迹;

  • 适合精细任务验证:能够快速验证机器人动作策略。

但其局限也较为明显:由于数据采集依赖机器人本体参与,因此:

  • 单次采集成本较高;

  • 采集效率有限;

  • 难以快速构建大规模机器人数据集。

因此,Kinesthetic Teaching 更多应用于:

  • 工业机器人编程;

  • 实验室研究;

  • 小规模模仿学习任务。

整体的数采流程如下所示:

3.2 Teleoperation:通过遥操作采集机器人执行数据

随着机器人学习任务逐渐复杂,仅记录运动轨迹已经无法满足需求。对于:

  • 双臂协作;

  • 精密装配;

  • 复杂操作任务;

机器人需要学习的不仅是:“动作轨迹”,还包括:

“机器人在真实环境中的执行过程”。

因此,遥操作(Teleoperation)成为目前机器人数据采集的重要方案。

遥操作的核心思想是:

人类通过控制设备操作机器人,机器人同步执行任务,并记录整个过程中的多模态数据。

典型方案包括:

  • ALOHA

  • VR Teleoperation

  • Leader-Follower System

采集的数据通常包括:

  • RGB图像;

  • 深度信息;

  • 机器人关节状态;

  • 末端执行器位姿;

  • 动作轨迹。

相比 Kinesthetic Teaching,Teleoperation 最大优势在于:

机器人本身直接完成任务,因此采集的数据天然包含:

Observation → Action

之间的对应关系。

这类数据更加适合:

  • 模仿学习(Imitation Learning)

  • ACT(Action Chunking Transformer)

  • VLA 模型训练

但其挑战在于:

  • 设备成本较高;

  • 操作系统复杂;

  • 数据采集效率仍受人工限制。

松灵 COBOT MAGIC 遥操采集数据

3.3 Vision-based / Ego-centric Data Collection:基于第一视角的数据采集

松灵 Pika Pro 具身智能数采套件方案

随着 Vision-Language-Action(VLA)模型的发展,机器人学习目标逐渐从:

“复制动作”

转向:

“理解任务意图”。

因此,仅记录机器人自身动作已经不足够。机器人需要理解:

  • 人为什么这样操作;

  • 当前环境意味着什么;

  • 下一步应该采取什么行为。

第一视角数据采集(Ego-centric Data Collection)因此成为近年来的重要方向。该方案通过采集人类执行任务时的第一视角信息,包括:

  • 头戴摄像头视频;

  • 手部运动;

  • 语言指令;

  • 环境变化。

相比传统机器人示教:

Ego 数据更加接近人类完成任务时的信息模式。

例如:

人类整理桌面:

传统机器人数据:

机械臂移动 
↓ 
抓取物体

Ego 数据:

看到桌面环境

理解任务目标

判断物体关系

执行操作

因此,Ego-centric 数据能够帮助模型学习:

从环境理解到动作决策的完整过程。

目前,该方向广泛应用于:

  • VLA 模型训练;

  • World Model;

  • 通用机器人学习。

松灵 Pika Pro 轻量化 Ego-centric 采集

3.4 Simulation Data:利用仿真环境扩大数据规模

除了真实机器人数据采集,仿真数据也是当前重要的数据来源。通过:

  • Isaac Sim

  • MuJoCo

  • Gazebo

等仿真平台,可以快速生成大量机器人交互数据。

优势:

  • 数据规模容易扩展;

  • 采集成本低;

  • 可以覆盖大量极端场景。

但仿真数据最大的挑战是:

Sim-to-Real Gap(仿真与现实差距)。

因此,目前行业通常采用:

Simulation Data + Real Robot Data

提升模型泛化能力

3.5 当前趋势:从单一数据采集走向多模态数据闭环

随着具身智能研究不断深入,机器人数据采集的需求也在变得更加多样化。不同数据采集方式解决的问题并不完全相同,因此很难用某一种方案覆盖所有数据生产需求。

从实际应用来看,不同方案各自具有比较明确的优势:

数据采集方式 更适合的场景 核心价值
Kinesthetic Teaching 精细动作示教 获取精准的机器人动作轨迹
Teleoperation 远程操作与机器人示教 获取机器人真实执行过程中的动作数据
Ego-centric 人类任务执行记录 从第一视角理解人类操作过程与任务意图
Simulation 大规模数据生成 降低数据采集成本并扩大数据规模

但未来具身智能训练需要的不再是单一数据,例如,Kinesthetic Teaching 更适合需要精确记录机械臂末端轨迹和关节运动的数据采集任务;Teleoperation 则可以让操作人员直接控制机器人,在真实环境中完成任务,从而获得更加完整的机器人执行数据。

相比之下,Ego-centric 数据采集关注的并不只是机器人“怎么运动”,而是从人的第一视角记录整个任务执行过程,包括视觉观察、手部动作以及人与环境之间的交互。这类数据能够为后续理解人类如何完成任务、为什么采取某种操作方式提供更多信息。

Simulation 则主要解决真实数据采集成本高、场景覆盖有限等问题。通过在仿真环境中生成大量不同场景和任务数据,可以进一步扩大训练数据规模,并用于算法验证和 Sim-to-Real 研究。

因此,这几种方式并不是简单的竞争关系。

Kinesthetic Teaching、Teleoperation、Ego-centric 和 Simulation 更可能在未来的具身智能数据生产体系中形成互补:

Kinesthetic Teaching 提供精细动作轨迹,Teleoperation 获取真实机器人执行数据,Ego-centric 补充人类任务视角,而 Simulation 则进一步扩大数据规模。

换句话说,未来具身智能需要的可能不再是某一种“万能”的数据采集方式,而是能够将视觉信息、语言指令、动作轨迹、机器人状态以及环境反馈结合起来的多模态数据体系。

因此,未来的数据生产体系更可能是多种采集方式协同,而不是某一种方式完全取代其他方式。

在这一趋势下,松灵机器人也在探索以 Ego-centric(第一视角)为核心的机器人数据采集方案

与传统的固定相机或直接操作机器人不同,Ego-centric 数据采集更关注“人是如何完成任务的”。通过从人的第一视角记录任务执行过程,可以获得机器人动作数据之外的视觉信息和人类操作行为,为后续的模仿学习、行为理解以及具身智能模型训练提供更加丰富的数据来源。

这也意味着,机器人数据采集正在从过去相对单一的“记录机器人怎么动”,逐渐向“理解人在什么环境下、基于什么信息、完成了什么任务”扩展。

4.从数据采集到数据生产:具身智能时代的新方案

当具身智能从单一任务学习的实验室走到任务更加通用化的商用场景中,这意味着训练数据需要同时满足:

  • 更丰富的任务覆盖;

  • 更高质量的数据关联;

  • 更强的多模态融合能力;

  • 更低成本的数据生产方式。

因此,未来机器人数据采集不再只是简单记录机器人运动轨迹,而需要构建完整的数据生产流程。

4.1 从实验室采集到规模化数据生产

过去机器人数据采集主要服务于:

  • 单个实验;

  • 单个任务;

  • 单台机器人。

采集流程通常需要:

  • 专业工程人员;

  • 复杂设备配置;

  • 长时间调试。

这种方式难以满足未来具身智能模型对于大规模数据的需求,因此未来的数据采集系统需要具备:

低门槛部署

让研究人员无需复杂工程配置,即可快速开始采集。

高效率采集

支持连续任务执行,快速生成大量有效数据。

多设备兼容

能够适配不同机器人平台,实现数据迁移。

数据闭环能力

采集

管理

标注

训练

形成完整链路。

4.2 松灵具身智能数据采集方案:构建真实世界机器人数据闭环

随着具身智能模型的发展,机器人数据采集正在从单一的轨迹记录,逐渐转向包含视觉、动作、空间信息以及任务上下文的多模态数据构建。

作为一家长期专注于移动机器人与机器人开发生态建设的企业,松灵机器人也持续关注机器人从“执行任务”向“自主学习”发展的数据需求,并围绕真实机器人场景探索更加高效的数据采集方式。

针对具身智能模型训练对于真实世界数据的需求,松灵 Pika Pro 具身智能数据采集套件探索了一种基于第一视角(Ego-centric)的机器人数据采集方式,通过记录人在真实环境中的操作过程,将人类经验转化为机器人可学习的数据。

相比传统机器人示教方式主要关注:

Robot Action

Robot Learning

基于 Pika Pro 第一视角数据采集方式,更关注完整任务过程:

Human Observation

Human Action

Task Context Understanding

Robot Learning

这种方式不仅记录“做了什么动作”,同时保留了操作过程中环境变化、空间关系以及任务上下文,使机器人模型能够学习更加接近人类的任务执行逻辑。

在数据形式上,具身智能训练需要的不再是单一轨迹数据,而是多模态信息的融合。基于 Pika Pro 进行机器人操作任务数据采集时,可以同步获取包括:

  • RGB 视觉信息;

  • 深度数据;

  • 空间位姿信息;

  • 末端执行器状态;

  • 机器人运动状态;

  • 操作轨迹。

其数据表达可以理解为:

Camera Image + Depth Information + 6D Pose + Robot State + Action ↓ Multimodal Demonstration Data

通过将环境感知信息(Observation)与机器人执行动作(Action)进行关联,采集的数据能够帮助模型学习从“观察环境”到“采取行动”的映射关系,为后续模仿学习(Imitation Learning)、策略训练以及 VLA 模型研究提供数据基础。

这使得数据采集不再是独立环节,而能够连接:

Data Collection ↓ Data Processing ↓ Model Training ↓ Robot Deployment

形成更加完整的机器人学习闭环。

最终,面向具身智能的数据采集方案并不是简单记录机器人运动轨迹,而是构建一个从:

Environment Observation

Human Demonstration

Robot Data

Model Training

Robot Execution

的完整数据闭环。

结语

未来,随着具身智能模型不断发展,机器人能力的提升将越来越依赖高质量、可规模化获取的真实世界数据。数据采集正在从模型训练前端的辅助环节,逐渐成为连接真实世界、机器人与智能模型的重要基础设施。面向这一趋势,松灵 Pika Pro 具身智能数据采集套件通过融合第一视角采集、多模态数据记录以及机器人开发生态,为构建真实世界机器人数据闭环提供了一种新的探索方向。

FAQ

Q1:为什么具身智能机器人需要专门的数据采集方案?

具身智能机器人需要学习的不仅是视觉信息,还包括机器人如何与真实环境进行交互。

相比互联网 AI 可以通过文本、图片和视频获取大量数据,机器人训练需要同时理解:

  • 环境状态(Observation)

  • 机器人动作(Action)

  • 空间关系(Pose)

  • 执行反馈(Feedback)

因此,单纯的视频数据或轨迹数据无法完整描述机器人任务过程,需要通过多模态数据采集方式,将视觉、动作、状态等信息进行关联,形成可用于模型训练的机器人数据集。

Q2:Pika Pro 与传统机器人示教方式有什么区别?

传统机器人示教方式,例如 Kinesthetic Teaching 或部分遥操作方案,通常关注机器人自身的运动轨迹记录,即:

Robot Action

Robot Learning

而 Pika Pro 更关注完整的人机交互过程,通过第一视角(Ego-centric)采集方式记录:

  • 人如何观察环境;

  • 如何进行操作;

  • 操作过程中的空间关系;

  • 任务执行上下文。

其目标不仅是记录“机器人做了什么”,而是帮助模型理解“为什么这样做”,从而支持机器人学习更加复杂的任务策略。

Q3:Pika Pro 采集的数据可以用于哪些机器人学习场景?

Pika Pro 采集的多模态数据可以作为机器人学习的数据基础,支持多种研究和应用方向,包括:

  • 模仿学习(Imitation Learning):让机器人通过人类示范学习操作技能;

  • 策略模型训练(Policy Learning):训练机器人根据环境状态生成动作;

  • Vision-Language-Action(VLA)模型研究:融合视觉、语言和动作信息;

  • 真实机器人验证(Real Robot Deployment):将模型能力迁移到实际机器人平台。

通过建立 Observation 与 Action 的对应关系,机器人能够逐步学习从感知环境到执行任务的完整过程。

Q4:什么是具身智能多模态数据闭环?

多模态数据闭环是指将视觉、语言、动作、机器人状态和环境反馈等不同类型的数据关联起来,并形成从数据采集、模型训练、机器人执行到反馈数据回流的完整流程。相比单一动作数据,多模态数据能够为具身智能模型提供更加完整的任务上下文。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐