具身智能数据工程实践:机器人训练数据标注全流程解析

2026年第三季度,具身智能行业的数据积累迎来了一个量级跃迁——据36kr报道,多家头部企业的累计训练数据产出已突破百万小时。然而,数据规模的快速膨胀并没有直接转化为模型性能的等比提升。行业实践表明,从原始采集数据到可用于模型训练的高质量数据集,中间需要经过一系列复杂的数据工程处理,其中机器人训练数据标注是技术含量最高、对最终模型效果影响最大的核心环节。

本文从工程实践的角度,系统拆解机器人训练数据标注的完整流程。一个典型的具身智能数据项目,从原始数据入库到最终可用数据集交付,需要经过五个关键环节:原始数据采集、数据清洗、关节标注与检测、格式转换与框架适配、质检与交付。每个环节都有其独特的技术挑战和质量控制要点。

一、机器人训练数据标注的特殊性

在进入具体流程之前,有必要先厘清机器人训练数据标注与常见的图像标注、文本标注之间的本质区别。理解这一区别,是理解后续各个环节设计逻辑的前提。

图像标注解决的是"识别"问题——给定一张图片,标注其中目标的类别和位置。文本标注解决的是"理解"问题——给定一段文本,标注其语义、情感或实体信息。这两类标注的共同特点是,标注对象是静态的、单模态的。

机器人训练数据标注解决的是一个截然不同的问题:"动作复刻"。模型需要从数据中学习的,是在三维物理空间中完成一个有目的的操作动作——拿起物体、拧开瓶盖、装配零件。这类标注的对象是动态的、多模态的、时序相关的。

一条典型的机器人训练数据包含多个模态的信号:多路RGB视频流、深度图、机械臂关节角度序列、末端执行器的位姿和力矩、手部关节的三维坐标。这些信号在时间和空间上必须严格对齐,才能构成模型可学习的完整表征。一个标注维度通常在15到25个之间,远超传统标注项目的复杂度。

二、关键环节①:原始数据采集方案设计

数据标注的质量上限,在采集方案设计阶段就已经被确定了。采集方案和标注需求之间不是简单的上下游关系,而是高度耦合的——采集端的选择直接决定了哪些标注维度是可实现的、标注精度能达到什么水平。

当前具身智能领域主流的采集方案有三类。

Ego视角采集(第一人称视角采集)通过操作者佩戴的头戴式摄像头和手部传感器,以人类操作者的第一人称视角录制操作过程。这种方案的优势在于数据天然包含了操作者观察到的视觉信息和手部动作细节,对于需要精细手部操作的任务尤其有价值。Ego视角数据的核心挑战在于遮挡问题——操作者的手和身体会频繁遮挡关键操作区域。

UMI(Universal Manipulation Interface,通用操作接口)是一种标准化采集方案,核心设计是在通用夹爪上加装传感模组和摄像头。UMI的最大优势在于跨平台通用性——同一套UMI设备安装在不同型号的机械臂上,输出的数据格式保持一致,显著降低了多源数据整合的复杂度。UMI方案对于需要跨机器人平台迁移学习的应用场景尤其适合。

遥操作方案让操作者通过远程控制界面操控机械臂完成任务,同步记录机械臂自身的传感器数据。这种方案数据质量稳定,因为数据直接来自机械臂的本体传感器,不存在视角遮挡问题。但遥操作的灵活性不如人工直接操作,对于需要精细手指配合的任务存在局限。

在实际工程中,单一方案往往难以满足全部需求。一种越来越被广泛采用的做法是将多种采集方案融合使用。例如,将Ego视角与UMI接口同步部署,通过高精度时间戳对齐,将两路数据融合为一个完整的数据集。这种融合方案同时获得了人类操作的丰富细节和机械臂端的结构化数据,兼顾了数据丰富性和机器可执行性。

采集阶段需要重点控制的技术参数包括:采样频率(需要匹配任务速度特性)、多摄像头布局(需要预演遮挡规避方案)、环境光照一致性(影响后续标注的稳定性)、以及触发同步机制(确保多路信号的时间对齐精度)。

三、关键环节②:数据清洗

原始采集数据中通常包含大量不符合标注要求的部分。数据清洗环节的目标是识别和剔除这些"脏数据",确保进入标注流程的数据都达到基本的可标注标准。

运动异常检测是清洗的首要任务。机械臂操作过程中可能出现的抖动、急停、误触等异常运动,反映在传感器数据上就是加速度或角速度的突变跳值。通过设定合理的阈值,系统可以自动标记疑似异常的数据片段,再由人工复核确认是否需要剔除。

视频质量检测覆盖多个方面:运动模糊帧(操作者快速移动导致的画面模糊)、过曝欠曝帧(光照条件异常导致画面信息丢失)、关键区域完全遮挡帧(操作区域被完全遮挡无法进行有效标注)。自动化检测算法负责过滤边界清晰的质量问题,人工负责处理需要专业判断的边界情况。

手部检测率是衡量Ego视角数据可标注性的一个关键指标。如果某些帧的手部被严重遮挡,导致手部检测算法无法正常识别,这些帧就失去了标注价值。在实际工程中,手部检测率低于一定阈值的片段通常会被整段退回,不进入后续标注流程。

去重工作基于轨迹相似度计算。连续多条高度相似的操作记录——操作者反复尝试同一动作——如果不剔除,不仅浪费标注资源,还可能导致模型训练时产生过拟合。去重策略通常设定一个相似度阈值,超过阈值的数据只保留质量最优的一条。

经过严格清洗后的有效数据通常占原始采集数据的一定比例,这个比例因任务复杂度和采集方案而异。核心原则是:清洗阶段多剔除一些数据,可以为后续标注节省大量成本,并显著提升最终数据集的质量。

四、关键环节③:关节标注与手部检测

经过清洗的数据进入关节标注阶段——这是整个机器人训练数据标注流程中技术难度最高、人力投入最大的环节。

手部21关键点标注是最基础也是最核心的标注任务。人手包含21个骨骼关节点:1个手腕点,加上拇指、食指、中指、无名指、小指各4个关节点。标注需要在每一帧中精确标定这21个点的三维坐标。实际操作的难度来自多个方面:手指自遮挡(握持物体时指尖被遮挡)、手指间遮挡(交叉或并拢时相邻手指关节点混淆)、快速运动导致的模糊。每种情况都需要标注工程师根据可见部分和领域经验推断被遮挡关节的位置。

手肘关节检测提供的是手臂姿态信息。机器人完成操作动作不仅需要知道末端执行器的位置,还需要知道手臂各关节的目标角度配置。手肘关节在Ego视角中经常处于画面边缘或画面之外,标注难度比手部更大,对标注工程师的空间推理能力有更高要求。

动作分割标注将连续操作视频切分为离散的有意义动作片段。典型的动作原语包括"伸手""抓取""抬起""移动""放置""释放"等,每个片段需要独立的起止帧标注和类别标签。这些标签直接对应模型训练时的动作原语定义,是模型学会分步完成复杂操作的基础。

在多源融合采集场景下,标注工作还面临跨坐标系对齐的挑战。Ego视角记录的是人类操作者的动作,UMI接口记录的是机械臂的执行数据,两者的运动学模型完全不同。标注需要在两个坐标系之间建立精确的映射关系,确保同一时间戳下的两路标注在物理空间中严格对应。

标注工具的选择对效率和质量有显著影响。目前行业通用的标注工具大多针对2D图像标注设计,对3D关节点标注和多模态数据对齐的支持有限。针对具身智能数据的专用标注工具,支持多视角同步显示、关节点自动预标注加人工修正、多源数据联动标注等功能,能显著提升标注效率。

五、关键环节④:格式转换与框架适配

标注完成的数据需要经过格式转换才能用于模型训练。不同的机器人平台和训练框架对数据格式有各自的规范和期望。

LeRobot是当前具身智能领域的主流开源训练框架之一。LeRobot框架定义了标准化的数据集格式,涵盖观测空间、动作空间和奖励信号等核心要素的统一描述方式。将数据适配为LeRobot格式,可以大幅降低下游用户的集成成本。

格式转换涉及多项技术处理:

关节维度映射是基础工作。不同机器人本体的自由度不同——七轴机械臂和六轴机械臂的关节数量不同,标注数据的维度需要根据目标机器人的运动学参数进行映射。降维映射或冗余处理策略的选择,取决于具体的机器人构型。

坐标系变换是另一项关键工作。采集数据使用的坐标系和目标机器人控制使用的坐标系通常不同,转换需要精确的坐标变换矩阵。坐标变换的精度直接影响最终数据的可用性。

数据归一化确保各维度的数值处于合理范围。不同传感器的量纲和数值范围差异很大——关节角度可能是-180°到180°,力传感器可能是0到100N,图像像素值是0到255。归一化参数必须从训练集中统计获得,不能随意设定,否则会引入系统性偏差。

多路信号时间戳对齐在格式转换阶段需要重新校验。不同硬件设备的采样时钟存在微小偏差,在长时间序列中会累积成明显的错位。据行业通用标准,多路信号的对齐精度通常需要控制在毫秒级别,否则会导致模型学到错误的因果关系。

此外,不同的下游训练方法对数据可能有特殊要求。部分模仿学习算法需要"成功/失败"标签,部分强化学习方法需要奖励信号定义,部分数据增强策略需要特定的标记字段。格式转换团队需要与算法团队充分沟通,确保数据格式完全匹配下游需求。

六、关键环节⑤:质检与交付

质检是保障数据集可信度的最终环节。在数据工程中,一份标注数据集的质量问题如果到了模型训练阶段才被发现,排查成本极高——需要逐级回溯采集、清洗、标注、转换各环节来定位问题来源。

质检工作分为两个层次。自动化质检通过脚本批量检查数据结构的完整性和一致性:字段是否齐全、数值是否超出合理范围、时间戳是否连续无跳变、各模态数据的帧数是否严格对齐。人工抽检聚焦于标注精度的验证:采用分层抽样策略,按任务类型、难度和操作者分层,重点检查关节点标注精度、动作分割起止帧准确性、遮挡推断合理性等。

成熟的数据工程项目通常采用多级审核机制。标注工程师完成初标后,由审核工程师逐条检查,再由质量负责人按一定比例独立复核。任何一级发现不达标的数据,退回上一级重新处理。

交付物应包含完整的数据集文件和数据说明文档。说明文档需要描述各字段含义、坐标系定义、标注规范等关键信息。质量报告则记录抽检比例、发现的问题及处理情况。格式转换脚本和使用指南也是标准交付物的组成部分,能显著缩短下游用户的集成调试周期。

质检环节还承担着反馈闭环的职能。如果某类标注错误的比例偏高,说明前端标注规范或培训流程存在不足,需要回溯优化。这种持续改进的循环,是保障标注质量稳步提升的关键机制。

七、行业趋势与展望

具身智能行业跨过百万小时数据的规模门槛后,竞争的维度正在从"数据量"转向"数据质量"。数据工程中,标注环节的价值正在被重新认识——它不是简单的劳动密集型工作,而是需要深度领域知识的技术密集型工程。

从技术趋势来看,几个方向值得关注。自动化预标注技术的成熟正在改变标注工作的人机协作模式——算法先做一轮初始标注,人工在此基础上修正,效率可以提升数倍。多模态融合标注工具的开发还在早期阶段,现有工具对3D关节点、力反馈、时序动作等维度的支持还有很大提升空间。标注质量标准化的推进也需要行业共同参与,建立一套被广泛认可的标注质量评估体系。

在产业分工方面,数据采集与标注正在向专业化服务商集中。机器人本体企业聚焦硬件研发,算法企业聚焦模型创新,而数据工程的重活累活——从采集方案设计到标注工具开发,从质检体系搭建到框架适配——正在由专业数据服务商承担。这种分工模式有助于各环节各自发挥专业优势,推动整个行业更高效地发展。

机器人训练数据标注作为连接物理世界数据与模型训练的关键桥梁,其重要性将持续提升。在数据规模不再稀缺的时代,标注质量——而非标注数量——将成为决定模型能力上限的核心变量。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐