“开物元启” 具身大模型平台 技术支持

系列第四篇。前三篇讲了格式选型八维质检清洗算子,这篇讲流水线里最费人的一环:标注

先把话说在前面:AI 预标注不能替代人工标注。任何声称能全自动标注的方案,要么是任务太简单,要么是在忽悠。

但 AI 预标注能做一件更有价值的事——把人的工作从"画框"变成"审框"。这两件事的成本差着一个数量级。

一、具身智能的标注,和 CV 的标注不是一回事

做过 CV 标注的人接手具身智能数据,第一反应通常是"不就是画框吗"。三个差异会很快打脸。

差异一:模态是混的,不是单一的。

一条 episode 里同时有 RGB 图像、深度图、点云、关节角、力矩、语音指令、任务文本。标注不是标一种,是每种都要标,而且要在时间轴上互相对应。

差异二:标注对象往往不是物体,是关系和意图。

CV 标注问"这是什么"。具身智能标注还要问"这一段在干什么"——接近、抓取、提起、移动、放置、释放。这是时序分段标注,标的是动作阶段的边界,不是画面里的物体。

差异三:错一帧不要紧,错一段就完了。

CV 数据集里标错一张图,影响可以忽略。具身智能数据里,某条 episode 的动作分段标错,整条 episode 都是污染样本——因为模型学的是序列。

二、六种模态,各该用什么模型打底

预标注的核心是:用成熟模型把机械劳动做掉,把判断留给人。 各模态的选型逻辑如下。
请添加图片描述

图像 —— YOLOv8(检测)+ SAM(分割)

YOLOv8 负责目标检测,出边界框。选它的理由不是精度最高,是速度与生态:单阶段检测器,推理快,能在大批量数据上跑得动;预训练权重覆盖常见类别,实验室场景里的杯子、盒子、工具基本都在。

SAM(Segment Anything Model)负责分割。它的价值在于不需要类别就能分割——给一个点或一个框的提示,它就能把物体轮廓抠出来。

这两个配合起来是标准打法:YOLOv8 出框 → 框作为提示喂给 SAM → 得到实例分割掩码。标注员只需要看掩码对不对,不需要一个点一个点描边。

必须人工介入的地方:透明物体(玻璃杯)、反光物体(金属工具)、严重遮挡。这三类 SAM 的表现不稳定,必须人工修。

视频 —— YOLOv8 Video(逐帧检测)+ ByteTrack(多目标跟踪)

视频标注不能逐帧当独立图片处理,那样得到的框在时间上是抖的,而且同一个物体在不同帧的 ID 对不上

所以需要跟踪器。ByteTrack 的思路是把低置信度的检测框也利用起来做关联,在遮挡场景下比只用高置信度框的方法稳得多。

**跟踪的核心指标不是框准不准,是 ID 切换(ID switch)多不多。**一个物体被短暂遮挡后重新出现,如果被分配了新 ID,这段轨迹就断了。

必须人工介入的地方:ID 切换点。工程上的做法是让工具自动标出所有 ID 切换发生的帧,标注员只审这些点,不用看全片。

音频 —— Whisper(语音转写)+ pyannote.audio(说话人分离)

具身智能里的音频主要是语言指令

Whisper 做语音转写,多语言、抗噪能力都不错,转写结果直接就是 VLA 模型需要的语言指令文本。

pyannote.audio 做说话人分离,回答"这段话是谁说的"。多人协作场景、或者需要区分"指令"和"环境对话"时必须用。

必须人工介入的地方:专有名词和指令术语。Whisper 会把"抓取三号工位的夹具"转成同音的其他词。建议维护一份领域词表做后处理校正。

点云 —— CenterPoint(3D 检测)+ PointNet++(语义分割)

CenterPoint 做 3D 目标检测,出的是三维包围盒——位置、尺寸、朝向。它的思路是先预测物体中心点再回归属性,比直接在三维空间里滑窗高效得多。

PointNet++ 做点云语义分割,逐点分类。它在 PointNet 的基础上加了局部区域的层次化特征提取,能捕捉局部几何结构。

具身智能场景下这两个的分工:CenterPoint 定位物体(抓哪个),PointNet++ 分割场景(哪里是桌面、哪里是障碍)。

必须人工介入的地方:三维包围盒的朝向。位置和尺寸模型算得挺准,朝向经常差 90 度或 180 度——而抓取姿态规划恰恰最依赖朝向。这一项建议全量人工复核。

轨迹 —— ByteTrack Trajectory(轨迹关联)+ Trajectron++(轨迹预测)

轨迹类是具身智能特有的模态。

ByteTrack Trajectory 把检测结果串成连续轨迹。Trajectron++ 做轨迹预测——给定历史轨迹,预测未来一段时间的位置分布。

预标注场景下,轨迹预测的用法有点反直觉:它不是用来预测的,是用来查错的。如果实际轨迹和预测轨迹偏离过大,要么是真的发生了突发事件(值得标注),要么是数据有问题(该清洗)。这是个很便宜的异常检测器。

文本 —— BERT(分类)+ UIE(信息抽取)

任务描述、操作日志、指令文本这些非结构化文本,需要转成结构化标签。

BERT 做文本分类,比如把任务描述归入"抓取/放置/推动/开合"等类别。

UIE(Universal Information Extraction)做信息抽取,从"把桌上那个红色的杯子放到左边的架子上"里抽出:动作=放置,目标物体=杯子,属性=红色,源位置=桌上,目标位置=左边架子。

这一步的价值在 VLA 训练里被严重低估:结构化的指令表示能让模型更快学到语言到动作的映射,比直接喂原始句子有效得多。

三、人机分工的判据

十二个模型摆在那,真正的问题是:哪些结果可以直接采信,哪些必须人工过一遍

给一个可操作的判据表:

在这里插入图片描述
外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

情况 处理方式
任务客观 + 模型置信度高 + 与相邻帧一致 直接采信,不进人工队列
任务客观 + 置信度低 进人工队列,按置信度升序排
时序不一致(ID 切换、分段边界跳变) 强制人工,且工具要自动定位到问题帧
任务主观(动作阶段边界、意图判断) 全量人工,模型只提供初始建议
长尾类别 / 训练集里没见过的物体 全量人工
三维朝向、透明反光物体 全量人工(模型在这两类上系统性不可靠)

核心原则:让模型处理"重复且客观"的部分,让人处理"稀少且需要判断"的部分。

一个常见的错误做法:把预标注结果全部丢给标注员逐个审。这样人的工作量并没有减少多少——审一个框和画一个框的时间差不到一倍。

正确的做法是分流:高置信度的直接过,只把低置信度和时序异常的推给人。这时候人的工作量才是数量级级别的下降。

四、标注工具的效率,藏在快捷键里

预标注解决了大头,剩下的人工精修环节,效率取决于工具设计。

需要的工具形态其实不多:矩形框、多边形、关键点、画笔、擦除,加上撤销和重做。矩形框做检测,多边形做精细分割,关键点做位姿标注,画笔和擦除修 mask 的边缘。

真正拉开效率差距的是快捷键

一个标注员一天要切换工具几百次。如果每次切换都要把鼠标移到工具栏点一下,这部分时间累计起来能占到工作时长的两三成。工具切换、撤销重做、上一张下一张,全部绑快捷键,是标注工具最基本的要求。

衡量标注工具好不好,就看一件事:标注员的手需不需要频繁离开当前操作区域。

五、工程化实现长什么样

上面这套人机协同的逻辑,我们在「开物元启」平台里落成了两个并列的子模块:

  • 自动标注(AI):内置上述 12 个模型,覆盖图像 / 视频 / 音频 / 点云 / 轨迹 / 文本六种模态,按数据类型选模型批量跑预标注;
  • 手工标注:矩形框 / 多边形 / 关键点 / 画笔 / 擦除五种工具,带快捷键和撤销重做,用于精修。

任务类型覆盖目标检测、语义分割、关键点检测、图像分类。整个标注环节的产出直接进下一环节——八维度质检,过了才允许导出。

设计上刻意做的一件事:自动标注和手工标注是两个独立入口,不是一个流程的两个步骤。因为实际工作里,这两件事的执行者、执行时机、执行频率都不一样——预标注是批量跑一次,精修是持续进行的。合成一个流程反而互相牵制。

写在最后

具身智能的标注成本,比大多数团队预估的高一个量级。因为它不是标一种数据,是标六种,还要在时间轴上互相对齐。

指望全自动是不现实的。但把机械劳动交给模型、把判断留给人,成本是能压下来的——前提是你得先想清楚哪些是机械劳动,哪些是判断。

这篇的判据表就是干这个用的。


下一篇是系列最后一篇,写《高校要开具身智能课,数据这一关怎么过》,把前四篇串成一条完整的链。

在做具身智能数据这一块的,欢迎评论区聊;做高校实验室方案的可以私信我。



Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐