最近做具身智能数据项目,我越来越强烈地感受到一个变化:

数据还在疯狂增加,但真正“新的数据”,可能没有想象中增加得那么快。

原因来自两个方向。

一个发生在采集之前:

工厂、酒店、学校、仓库这些真实场景,

正在被不同平台、不同数据公司一遍又一遍地寻找、登记和采集。

另一个发生在采集之后:

同一批已经采完的数据,又可能经过不同供应链节点反复流转。

行业里有个很直接的说法:串货。

场地重复采,数据重复卖。

这两个现象叠在一起,我觉得具身智能行业正在悄悄出现第一轮:

“数据通胀”。

一、场地还没开始采,就已经被登记了很多遍

前段时间具身智能数据最火的时候,很多项目第一句话不是问:

你有多少标注员?

而是:

  • 你手里有多少真实场景?

  • 工厂有没有?

  • 酒店有没有?

  • 学校有没有?

  • 图书馆有没有?

  • 仓库、商超、办公室能不能进?

于是很多公司开始干一件事情:

  • 疯狂收集场地资源、场地名称、所在城市、面积。

  • 行业类型、生产工序。

  • 能不能进机器人、能不能拍摄、每天能进多少人。

  • 是否有保密要求、甚至现场负责人联系方式。

慢慢地,“场地库”开始变成具身数据公司的一种资源。

这没有什么问题。

问题是:行业里容易获得的真实场景其实就那么多。

一家工厂可能今天被A平台登记。

下个月B公司找到厂长,又登记一次。

再过一段时间,C数据公司拿着另外一个机器人项目重新进场。

甚至同一个场地,同时出现在好几个供应商的资源表里。

最后就会出现一个很有意思的现象:

大家都说自己有500个场景,但把名单真正合并以后,可能大量场景其实是重合的。

这就是第一层“数据通胀”。

不是数据已经重复。

而是:生产数据的资源,先重复了。

二、同一工厂不能只是换个甲方再采一遍

这里很容易产生一个误解:是不是一个工厂采过一次,以后就不能采了?

当然不是。

同一个工厂完全可以产生很多批高价值数据。

  • 第一次采正常搬运。

  • 第二次增加不同重量。

  • 第三次增加遮挡。

  • 第四次增加多人干扰。

  • 第五次专门采失败。

  • 第六次采失败后的恢复。

  • 第七次加入长流程装配。

虽然场地没有换,数据分布一直在变。

这种重复采集当然有意义。

真正的问题是另外一种情况:

  • 场地没变。

  • 工位没变。

  • 物体差不多。

  • 任务差不多。

  • 动作也差不多。

只是:换了一家公司、换了一个项目、换了一批采集员,又重新采了几百小时。

文件确实是新的。

但是对模型来说:到底新增了多少它以前没见过的信息?

这才是关键。

所以我理解的具身数据“通胀”,并不是数据数量变多。

而是:每新增一个小时数据,带来的信息增量正在下降。

三、数据采完以后,还可能继续串货

如果第一种通胀发生在上游,第二种就发生在供应链里。

具身数据现在有一个非常特殊的问题:很多数据并不是甲方直接组织生产。

中间可能存在:机器人公司,数据平台,一级供应商,区域服务商,采集公司,甚至个人资源方。

供应链一长,就会出现一个风险:同一批数据被反复流转。A项目采了一批。

经过中间环节以后,换个数据包名称,重新拆一下目录,改一下任务描述,又进入另外一个需求。

行业里大家说的“串货”,很多时候就是这个意思。

这里当然需要区分具体合同、数据权属和授权范围,并不是所有二次流转都有问题。

但从模型训练价值来看,有一个问题无法回避:客户以为自己买到了第二批数据,实际上可能只是第一次见过的数据换了一件衣服。

这比场景重复更麻烦。

因为场景重复至少:重新采了一次。

光照有变化、人员有变化、动作会有细微差异。

但数据直接重复流转,可能连这些变化都没有。

三、这会让1000小时数据越来越危险

现在很多具身数据项目还是按照:小时。或者:Episode / 条,结算。

这套计价方式很容易理解。

但是当数据通胀越来越明显以后,一个问题一定会出现:

A公司给我1000小时。

B公司又给我1000小时。

所以我现在有2000小时数据?

未必。

如果两批数据高度相似,模型真正获得的有效信息量可能远小于2000小时。

于是未来客户可能不会只问:这批数据多少小时?

而会继续问:

  • 和我已有的数据重复多少?

  • 场景覆盖增加了多少?

  • 新增了什么动作?

  • 有没有新的失败类型?

  • 有没有新的长尾状态?

  • 这1000小时里,真正值得进入训练集的有多少?

这时候,“有效小时”这个概念也会再次升级。

过去我们讲:采集小时 ≠ 可结算有效小时。

以后可能还要再加一层:可结算有效小时 ≠ 训练有效小时。

五、正是这时我看到一类新工具出现

最近看到一个机器人数据工具:Calibra。

它给自己的定位是:Robot Dataset Observability。

简单理解:不要急着拿机器人数据去训练,先给数据做一次体检。

它不是传统的画框工具。

它检查的是:时间戳有没有异常,有没有丢帧,摄像头有没有冻结,视频是不是模糊,机器人动作有没有突然抖动,Episode是不是不完整,不同轨迹之间是不是高度相似,整个数据集到底覆盖了多大的行为范围。

它把流程概括成四步:Integrity → Quality → Coverage → Optimize

翻译过来就是:完整性 → 质量 → 覆盖度 → 优化。

这个顺序非常值得数据公司注意。

因为前两个问题大家一直在做。

数据坏没坏?

数据合不合格?

真正新的,是后两个:这批数据够不够丰富?

以及:这里面哪些数据其实可以不要?

六、过去QA找错数据,以后还找重复数据

传统数据标注公司的QA主要抓:漏标、错标、框偏、视频损坏、任务未完成。

这些属于:Bad Data。

但是如果具身数据进入今天这个阶段,QA可能还得面对另外两类问题:Duplicate Data。

重复数据。

以及:Low-value Data。

低增量数据。

最麻烦的是:后两种数据看起来完全“合格”。

比如一条机器人轨迹:视频完整、动作完整、没有丢帧、任务也成功完成。

甲方按照传统规则完全可以验收。

但如果客户数据库里已经有5000条高度相似轨迹,第5001条到底值多少钱?

这就是数据工具接下来必须回答的问题。

Calibra现在已经在尝试通过轨迹多样性、Coverage以及Coreset Selection,从大量Episode中筛选一个更有代表性的数据子集。

项目方还对30个公开LeRobot数据集进行了自动质量审计,结果显示这些公开数据集普遍存在至少一项值得关注的质量问题。

需要说明的是,它关于数据裁剪和训练效果的结果目前主要来自项目自己的实验,不能直接推导成“机器人数据可以统一删除75%”。

但它真正重要的地方根本不在这个数字。

而在于:已经有人开始把,“这条机器人数据到底值不值得留下”做成工具了。

七、为什么这种工具会在现在出现?

我觉得答案就在前面说的两个“通胀”里。

当数据非常缺的时候,没有人关心重复,先采回来再说。

当行业只有1000小时数据的时候,第1001小时通常都有价值。

但是当数据开始变成:10万小时、100万条Episode,不同公司又在相同场景反复生产,供应链里还有数据反复流转,问题就变了。

这时候模型训练真正稀缺的已经不只是:更多数据。

而是:新的数据。

所以去重、质量评分、轨迹聚类、Coverage分析、Coreset筛选这些工具开始有价值。

它们本质上都在解决同一个问题:别再告诉我有多少数据,先告诉我这里面到底有多少东西是我没见过的。

八、下一阶段,数据公司开始建数据指纹库

这是我觉得对现在数据公司最重要的一个变化。

很多公司正在积累:场地资源库。

以后可能还需要另一套东西:数据指纹库。

比如:

这个场地以前采过什么?

采过哪些任务?

有哪些物体?

哪些动作已经很多?

哪些动作很少?

数据和历史项目相似度多高?

有没有重复Episode?

哪些异常状态没有覆盖?

客户已有数据和准备采购的数据,到底有多少重合?

一旦这些信息能被记录下来,数据生产逻辑就会发生变化。

以前:客户要1000小时,我去找地方采1000小时。

以后:客户要提升模型能力,我先看已有数据缺什么,再决定下一批1000小时到底应该采什么。

前一种卖的是:产能。

后一种卖的是:数据设计能力。

九、具身数据第一轮淘汰赛不是价格战

而是:谁还在靠“数据量”做生意。

具身数据一定还会继续高速增长。

工厂也一定还会继续被采,数据交易也不会消失。

但是行业评价数据的方式可能正在变化:

第一阶段看:有没有。

第二阶段看:有多少。

第三阶段看:质量怎么样。

再往后一定会问:有没有增量。

到那个时候,一家数据公司真正值钱的能力,可能不再是:我手里有500家工厂。

而是:我知道这500家工厂里,哪50家还能生产客户真正缺的数据

也不再是:我这里还有10万条机器人数据。

而是:我能证明这10万条数据和你已有的数据到底重复多少,新增覆盖了什么。

这才是“数据通胀”真正会改变行业的地方。

场地被一遍又一遍地采。

数据被一层又一层地流转。

当大家手里的“小时数”越来越大以后,真正稀缺的反而会变成一件很简单的东西:

没见过的数据。

我是AI数据标注猿刘吉,

跟着我,用数据视角看AI世界。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐