摘要

背景:机器人操作数据集的质量直接影响模仿学习与 VLA 类模型的训练效果。当前社区存在多种开源质量评估工具,但它们分别从不同维度定义「质量」,其结论是否可比、能否互相替代,缺乏系统的实证材料。

方法:本研究将三个公开 LeRobot 格式数据集(lerobot/xarm_lift_mediumlerobot/xarm_push_mediumlerobot/jaco_play)于 2026-08-25 从 HuggingFace Hub 完整重新下载(含 data、meta、videos 三部分),在本地离线环境下分别使用三款代表性开源工具进行全量评估:RDA v0.5.4(完整性 + 行为层,verdict 制)、lerobot-doctor 0.2.0(结构与训练就绪检查,PASS/WARN/FAIL 制)、score_lerobot_episodes 0.1.0(视觉启发式连续打分,0–1 分制)。全部工具使用默认参数,不对单个数据集调优。

结果:①三款工具在可直接对照的强信号上高度一致(如 jaco_play 的执行器粘滞、时长极端值);②但跨数据集的健康排序出现方向性反转——两款工具判定最需关注的数据集,在第三款中获得最高分(0.870 vs 0.696/0.686);③反转根因可完全归因:视觉清晰度指标在 84×84 低分辨率输入上发生结构性失效(均值 0.000),而该失效与数据本身的采集质量无关。

结论:不同评估工具输出的分数不具备线性可比性,任何单一总分不应作为独立的验收卡口;可靠做法是分层列示结论、以多工具交集确认强信号、并保持口径可复现。

关键词:机器人学习;数据质量;LeRobot;数据审计;工具评测


1 引言

1.1 背景与动机

模仿学习与 VLA(Vision-Language-Action)模型的效果高度依赖训练数据的采集质量。行业调查显示,遥操作采集的有效数据漏斗损耗显著(某大型数采场负责人:「采了 100 个小时,漏斗筛选下来只有 50 个小时有效」,甲子光年,2026-07),数据采购合同却普遍缺少可执行的验收口径。在此背景下,交付方提供的质检报告通常只覆盖文件完整性层(格式、帧数、缺失值),而行为层的缺陷(轨迹空转、动作尖峰、执行器异常)往往不在检查范围内。

本项目此前对 12 个公开数据集的全量审计(2026-08-20,共 4,959 个 episode)发现两个事实:其一,全部数据集的完整性层均为 CLEAN,即「文件能读」这一验收重点的通过率天然接近 100%;其二,同一机器人平台的两个任务数据集在行为层差异可达四倍(详见 §4.1)。这些发现引出一个方法论问题:由单一工具给出的质量结论是否稳健?不同范式的评估工具能否交叉验证?

此外,一次偶然事故强化了该动机:HuggingFaceVLA/libero 数据集的一次本地审计曾报出 1,690/1,693 个 episode 全部不可读,经排查确认为数据集侧 meta 与实际文件布局不一致所致(后经独立 pyarrow 脚本复核属实)——这类问题恰好位于「供应商质检报告」与「训练侧排障」之间的责任空白区,也是促成本跨工具研究的直接原因之一。

1.2 研究问题

  • RQ1(一致性):三款范式不同的评估工具,对相同数据集的判断在多大程度上一致?
  • RQ2(可比性):各工具输出的量化结果(verdict 计数、PASS/WARN 计数、连续分数)能否直接互比或合成统一排序?
  • RQ3(失效模式):若出现排序冲突,根因是什么?该根因对评估工具的选用有何含义?

2 受评工具与评估范式

三款工具代表了当前社区三类主流评估范式:

维度

RDA

lerobot-doctor

score_lerobot_episodes

评估范式

完整性 + 行为统计学

结构合规 + 训练就绪性

视觉/运动学启发式打分

输出形态

逐 episode 三值判定(PASS/REVIEW/EXCLUDE)+ 数据集三层聚合

12 类检查项,PASS/WARN/FAIL

每 episode 每镜头 5 维 0–1 连续分 + 加权聚合

主要测量对象

NaN/Inf、时间戳有效性、缺帧、schema;空闲率、动作尖峰、状态空间占用

视频文件完整性、episode 时长健康、分布离群值、零方差维度、归一化安全性、异常检测

视觉清晰度(Laplacian 方差 + 曝光)、平滑度、碰撞尖峰、时长离群、执行器饱和

视觉依赖

无(显式不读视频内容)

仅查文件存在性与可解码性

强(清晰度为主要加权维度之一,权重 20%)

版本

0.5.4(PyPI: robot-data-audit)

0.2.0

0.1.0(源码安装)

三者对「质量」的操作性定义不同:RDA 关注「轨迹层面是否存在影响训练的行为风险」;doctor 关注「数据结构能否被标准训练管线无损消费」;score 工具关注「演示画面与运动学是否像高质量人类示范」。这一差异本身即是本研究要检验的对象。


3 实验设计

3.1 数据集

数据集

平台/任务

Episodes

元数据声明帧数

选择理由

lerobot/xarm_lift_medium

真实 xArm / 抓举

800

20,000

同平台对照组之一

lerobot/xarm_push_medium

真实 xArm / 平推

800

20,000

与 lift 构成同平台任务对照

lerobot/jaco_play

真实 Jaco / 自由玩摆

1,085

77,965

高分辨率双镜头,行为层信号丰富

数据获取协议:三套数据集于 2026-08-25 从 HuggingFace Hub 一次性完整重新下载(本地目录标记为 refetch_*),包含 data/meta/videos/ 全部三部分,排除早期「仅 data+meta」的不完整本地副本干扰(见 §5.2 对此教训的分析)。

3.2 执行环境与控制变量

  • 硬件/系统:本地 Windows 工作站,全程离线执行,无数据外传。
  • 控制变量原则:所有工具一律使用默认参数,不对单个数据集做任何调优。理由:审计工具在真实使用场景下面向未知数据,调优会破坏「开箱即可比」的前提。
  • Python 运行时:3.13.x,各工具独立虚拟环境隔离依赖。

3.3 执行流程

评估分两轮迭代:

  • 第一轮(v1):以不完整本地副本(缺 videos)运行三工具。结果显示 lerobot-doctor 对三套数据均报 Video Integrity: FAIL。经排查,该 FAIL 由评估方副本不完整导致,非数据集缺陷,构成本轮的方法学修正点(详见 §5.2)。
  • 第二轮(v2,正式轮):完成 §3.1 所述完整重下后重跑。lerobot-doctor 该项转 PASS,确认 v1 假阳性已被消除。以下 §4 全部结果均出自 v2 正式轮;RDA 侧另以 2026-08-20 的 12 数据集全量重跑作为背景参照。

兼容性修补披露:score_lerobot_episodes 0.1.0 在本环境下无法直接全量运行,正式运行前施加了三项工程修补:① 支持单数形式图像键名 observation.image(否则在 xarm 两套数据上除零崩溃);② 清除环境中一条异常超长的环境变量(约 48 万字符,触发 Windows 子进程环境重建崩溃);③ 执行器饱和度比较在 action/state 维数不一致时退化为公共前缀比较。修补均为兼容性修复,不改变评分逻辑;修补脚本已随产物归档(附录 B)。


4 结果

4.1 RDA v0.5.4:完整性与行为层

数据集

PASS

REVIEW

EXCLUDE

通过率

动作尖峰(波及 ep)

中位空闲率

xarm_lift_medium

767

33

0

95.9%

6(5 ep)

20.8%

xarm_push_medium

238

562

0

29.8%

845(500 ep)

83.3%

jaco_play

390

695

0

35.9%

11,958(837 ep)

74.1%

  • 完整性层(NaN/Inf、时间戳有效性、缺帧、schema):三套全部 CLEAN(100% 通过)。
  • 关键背景观察:lift 与 push 为同平台、同实验室、同规模的两个任务集,行为层差异达四倍(空闲率 20.8% vs 83.3%;通过率 95.9% vs 29.8%)。结合任务性质(抓举 vs 平推扁平物体),该差异更可能来自任务本身的等待/试探结构,而非采集质量劣化——这构成后文方法学讨论的一个重要案例:行为层信号是风险指示器,不是缺陷判决书
  • 次级指标:三套数据的传感器同步检测均不可用(元数据缺失 stream_timestamps,NA);状态空间占用均属低位(中位 0.017–0.028)。

4.2 lerobot-doctor 0.2.0:结构与训练就绪检查(v2 干净轮)

数据集

总体

PASS/WARN/FAIL

非 PASS 要点

xarm_lift

WARN

10 / 1 / 0

Episode Health(W):800/800 集长度 25 帧 < chunk_size=50(影响 ACT/Diffusion 类策略的分块)

xarm_push

WARN

9 / 2 / 0

Data Distribution(W):state[3] 存在 126 个极端离群值(>10σ);Episode Health(W):同上短 episode 问题

jaco_play

WARN

5 / 6 / 0

Action Quality(W):action[6] 有 65.1% 取最小值 0;多集动作连续冻结(如 ep0 冻结占比 14%、ep2 达 27%)·Anomaly(W):action[6] 在 1078/1085 集中呈粘滞态;state dim6 全程常量 ·Data Distribution(W):3 个维度零方差 ·Training Readiness(W):按现有 stats 归一化将产生 NaN/Inf ·Episode Health(W):1085 集长度 22–195 帧(均值 72),178 集短于 chunk_size=50,7 集超均值 3σ 以上

  • v2 轮零 FAIL:视频完整性一项在补齐 videos 后全部转 PASS(对比 §5.2 的 v1 假阳性)。
  • doctor 在 jaco_play 上给出了与 RDA 方向一致的强行为信号:action[6] 粘滞(1078/1085 集)与连续冻结帧问题,指向同一执行器维度的可疑行为。

4.3 score_lerobot_episodes 0.1.0:连续五维打分

默认权重:visual_clarity 20 / smoothness 10 / collision 10 / runtime 20 / actuator_saturation 10。

数据集

视觉清晰度

平滑度

碰撞

Runtime

执行器饱和

聚合均值(0–1)

xarm_lift_medium

0.000

0.956

0.917

1.000

1.000

0.696

xarm_push_medium

0.000

0.997

0.805

1.000

1.000

0.686

jaco_play(1085 集 × 2 镜头)

主镜头 0.689 / 腕部 0.479(均值)

1.000

0.945

0.988

1.000

0.870

细分统计:

  • xarm 两套数据的视觉清晰度为全场 0.000:其视频原生分辨率为 84×84,Laplacian 方差的量纲天然极低,被 opencv 启发式的模糊/暗帧规则系统性罚分为「模糊」。该失效与采集质量无关,属于指标对输入分辨率的结构性失效(详证见 §5.1)。
  • jaco_play 双镜头分化明显:主镜头视觉清晰度均值 0.689(中位 1.000),腕部镜头仅 0.479(中位 0.480)——夹爪视角更模糊符合物理直觉,且该信号与数据集的公开描述一致。
  • 时长离群:26 条镜头级记录(对应 13 个唯一 episode,双镜头各计一次)runtime 得分为 0。若按每集取双镜头最高聚合分的口径重算,jaco 均值升至约 0.90,说明聚合口径的选择本身也会影响结论。

4.4 跨工具对比分析(RQ1/RQ2)

(a)健康排序

工具

判定的相对排序(好 → 差)

依据

RDA

lift 最干净 → push 次之 → jaco 最需关注

REVIEW 计数 + 中位空闲率

lerobot-doctor

lift(10P/1W)→ push(9P/2W)→ jaco(5P/6W,且异常项最多最重)

非 PASS 检查项的数量与严重度

score_lerobot_episodes

jaco 最好(0.870) → lift 0.696 → push 0.686

五维加权聚合分

前两款工具方向一致,第三款发生方向性反转:RDA 与 doctor 均判定 jaco_play 最需人工介入、lift 相对最干净;score 工具则给 jaco 全场最高分、给两套 xarm 全场最低分。

(b)一致交集(RQ1 的答案):尽管总分排序冲突,三款工具在若干强信号上相互独立地给出了吻合的 flag:

强信号

RDA

doctor

score

jaco action[6] 维度异常(粘滞/常驻最小值)

✓(计入 REVIEW 波及 837 ep 的尖峰群)

✓(1078/1085 集粘滞 + 65.1% 取最小值)

—(不测该维度)

jaco 部分 episode 时长极端

—(不在判定核心)

✓(7 集超 3σ)

✓(13 集双镜头 runtime=0)

push 分布离群(state[3] 126 个 >10σ 点)

✓(同批 REVIEW 密集)

✓(Data Distribution W)

—(未见对应罚分)

xarm 视觉分辨率低

不适用(有意不读视觉)

不适用(仅查可解码性)

✓ 但误判为「模糊」(0.000)

即:多工具的「报警交集」可以作为高置信信号的交叉验证来源;但报警的「沉默」不等于干净——每款工具都有自己看不见的维度。

(c)可比性(RQ2 的答案):三款工具的输出(三值 verdict 计数、三档检查计数、连续加总分)度量对象与量纲均不同,不存在已知的线性换算关系。跨数据集的直接排名冲突(§4.4a)即是证明。任何把它们并列成一列「健康分」的做法都不成立。


5 讨论

5.1 排序反转的根因分析(RQ3)

反转由视觉清晰度维度的结构性失效驱动,证据链如下:

  1. 两套 xarm 数据的视频原生分辨率为 84×84;
  2. score 工具的视觉清晰度采用 Laplacian 方差 + 曝光启发式,此类度量的取值量纲依赖分辨率,在 84×84 输入下区分度趋近于零;
  3. 实测两套 xarm 全部 1,600 条镜头记录的视觉清晰度得分为 0.000(非低分,而是地板值),而其余四个维度得分均在 0.80 以上;
  4. 该维度默认权重占总权重的 20%/60 中的一部分,但因其打满零分,成为压低 xarm 聚合分的主导项;
  5. jaco(224×224)不受此失效影响,叠加其运动学层面平滑(smoothness 1.000),从而获得最高聚合分。

换言之,score 工具实际上测量的是「画面是否像高分屏演示」,而 xarm 数据的低分辨率是上游硬件属性,不是采集劣化。当工具对某一数据属性的敏感度达到饱和时,它对该属性背后的真实质量变化不再有响应力——这与测量理论中的天花板/地板效应一致。

同时需要指出:RDA 对 push 的高 REVIEW 率同样不能直接解读为「push 采得更烂」。平推任务天然包含大量等待与微调,空闲率中位 83.3% 很大程度上是任务结构的函数。若使用者据此机械删除高空闲 episode,会连带丢弃失败恢复等有价值样本。两个方向的误读(把工具盲区当好分、把任务特性当坏数据)都源于同一个根源:工具输出的是代理指标的统计特征,而不是质量的真值。

5.2 对评估实践的启示

本次实验提供了两个具有普遍意义的方法学教训:

教训一:评估方的副本必须先于结论被验证。 第一轮中 doctor 报出的三连 FAIL(Video Integrity)在补齐 videos 后完全消失。若当时以 v1 结果对外发布,将构成一次针对三个无辜数据集的错误指控。数据审计结论的第一责任对象是评估流程自身。

教训二:工具的可运行性本身是复现性的前置条件。 score 工具在本环境暴露了键名复数兼容、环境变量污染、维度不一致比较三处工程问题(§3.3),均已修补并披露。学术与实践报告中应常规化披露此类修补,否则他人复现时会遭遇无声的门槛。

对数据验收场景的具体建议:

  1. 拒绝单一总分作为合同卡口。本次实验中,同一批数据在不同合理工具下可以得出方向相反的排序;将其任何一个写入合同的「合格率 ≥95%」条款都会制造纠纷。
  2. 要求分层列示:完整性结论可作为拒收依据;行为层信号只能触发按比例抽检;视觉/感知层结论必须注明输入分辨率等适用前提。
  3. 用交集验证强信号,用差异集界定盲区:多工具同时 flag 的项进入必检清单;仅单一工具 flag 的项标明该工具的已知盲区后再定处理方式。
  4. 口径先于数字:任何写入验收文档的指标,须同时写明阈值、工具版本、参数与复现命令。

5.3 效度威胁(Threats to Validity)

  • 构念效度:三款工具的「质量」操作性定义不同(§2),本研究的「排序对比」是在承认这一差异的前提下检验其后果,而非判定孰对孰错。行为层指标(空闲率、尖峰)是风险信号,未被下游训练效果验证为因果。
  • 内部效度:score 工具的三项兼容性修补可能偏离原作者意图(修补逻辑已披露并存档);RDA/doctor 的 v1→v2 迭代表明本地副本状态会影响结论,v2 已消除该威胁。
  • 外部效度:样本仅 3 个数据集、2,685 个 episode,且偏向真实机器人 LeRobot 数据集;结论向仿真数据、更高分辨率、多机异构数据的外推需谨慎。此外两套 xarm 来自同一实验室,平台内相关性强。
  • 检出力:全部工具使用默认参数,反映「开箱体验」而非各工具调优后的上限。
  • 基准真值缺失:本研究没有外部标注的真值(哪些 episode 真的坏),因此衡量的是工具间的一致性而非各自的准确率。
  • 利益相关:作者为 RDA 维护者,尽管采用了对称陈述框架(§开头利益声明),读者仍应在解读对 RDA 有利的细节(如其对 jaco/push 的强信号捕获)时保留一份折扣。

6 结论与后续工作

本研究将三款范式不同的开源评估工具应用于三个公开 LeRobot 数据集,得到三点结论:

  1. 强信号上一致:对于足够显著的数据缺陷(执行器粘滞、时长极端离群、分布离群值),独立设计的工具能够相互印证,多工具交集具备交叉验证价值。
  1. 总量上不可比:三款工具的分数体系在量纲、权重与失效模式上互不相容,跨数据集的绝对分数与基于它的健康排序会发生方向性反转,不可用于任何验收或横评场景。
  1. 失效可归因:本次观测到的排序反转可完全归因于视觉启发式在低分辨率输入上的地板效应,提示每个工具都有明确的适用域边界,采购与验收文档必须同步写明该边界。

后续工作计划按优先级排列:(a) 将数据集扩展至 12+ 并纳入仿真与高分辨率集,检验反转现象的发生频率;(b) 引入人工抽检标注构建小型真值集,估计各工具的查准/查全;(c) 以「过滤前后策略训练收益」为终点做下游验证,厘清行为层风险信号与训练效果的因果链条。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐