元信息:工具 RDA (robot-data-audit) 0.5.8 · 数据集 lerobot/libero_10(LeRobot v3.0 格式,379 个演示片段,101,469 帧)· 纯 CPU 运行 · 2026-09-03

    如果你在用 libero_10 做 VLA 或模仿学习实验,大概率对它的 10 个任务、每个任务 35–49 条轨迹很熟悉了。但「这批数据本身质量如何」这个问题,很多人(包括我们自己)通常是凭感觉回答的。最近我们在给自己的开源审计工具 RDA 做 0.5.8 版本的回归测试,顺手把 libero_10 完整跑了一遍。这篇只报告测试结果——它是什么、不是什么,我们都尽量说清楚。

先说结论

在 13 项可执行的自动化检查中:

  • 12 项全部通过:文件完整性、视频帧一致性、时间戳有效性、schema 一致性、关节限位、动作连续性、抽样抖动、速度/加速度合理性、缺失/异常值等,379 个片段无一报错;
  • 2 项不适用:传感器同步(该数据集无多传感器时间序列)、部分关节限位子检查,自动跳过并如实标注 na
  • 0 个硬伤:没有发现数据损坏、帧错位、时间戳倒挂这类结构性问题。

    换句话说:libero_10 的数据工程质量是过硬的。唯一触发「建议复核(REVIEW)」的,是一项低运动启发式检查——这正是我们想拿出来讨论的部分。

REVIEW 的 247 个片段,是怎么回事

    65% 的片段(247/379)被 RDA 标记为 REVIEW,依据只有一条:有效运动占比低于 0.30。这个指标的定义是「发生明显运动的帧 / 总帧数」,0.30 是 RDA 的默认经验阈值。

    从分布图看,libero_10 全部片段的有效运动占比集中在 2%–41%,中位数 28.3%,恰好卡在阈值附近。我们认为这更可能是阈值与数据集特性的匹配问题,而非数据质量问题,理由有三:

  1. libero_10 的任务大多是桌面级精细操作(放杯子、开抽屉、摆调料盒),机械臂动作本身就小而慢,单位时间内「显著运动」的帧天然偏少;
  2. 这些片段的时间戳、动作连续性、速度/加速度检查全部通过——如果是真实的卡死或故障,这几项大概率会同时报警,但没有;
  3. 0.30 这个阈值本来是为通用场景设计的经验值,面对不同 style 的数据集,理应允许使用者调整。

    所以我们的建议是:如果你用 RDA 跑 libero_10,看到大面积 REVIEW 不必紧张,这是启发式阈值在精细操作数据集上的正常反应。RDA 的定位是「给出信号 + 解释原因」,最终判断权在使用者手里。

这次审计还顺带验证了两件事

    对 RDA 自身而言,这次跑全量数据集修复并验证了两个 0.5.8 的适配问题(v3.0 chunked 视频的帧数校验误报、episode 层任务标识输出),现在:

  • 每个 episode 的 JSON 记录都带 task_index / task_description,可以直接按任务切分分析;
  • 379 个片段跑完约 3 分钟(纯 CPU,无 GPU 依赖),pip install robot-data-audit 即可复现。

自己跑一遍

pip install robot-data-audit
rda audit /path/to/libero_10 --format json --output report.json
# 或者
python -m rda.cli.main audit D:/data/libero_10

    支持 LeRobot v2.1 与 v3.0 格式。JSON 报告里每个 episode 有 14 个指标的完整测量值、阈值、判定原因,可以直接程序化消费。

边界声明(重要)

  • 本文只代表 RDA 0.5.8 在一个数据集上的一次测试结果,不构成对 libero_10 的全面质量背书,也不构成任何基准排名;
  • 低运动启发式的阈值设定有主观性,我们给出的解释是分析而非定论,欢迎不同意见;
  • RDA 是我们的开源项目(Apache-2.0),利益相关,请带着批判的眼光使用和验证;
  • 我们没有借此对比任何其他审计工具——不同工具的指标定义和适用场景不同,简单拉踩没有意义。

    有任何问题或发现 bug,欢迎到 GitHub 仓库 提 issue。如果你跑了别的数据集,也欢迎分享结果。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐