具身智能第一轮“数据通胀”来了:场地被反复采,“数据串货”赚快钱
最近做具身智能数据项目,我越来越强烈地感受到一个变化:
数据还在疯狂增加,但真正“新的数据”,可能没有想象中增加得那么快。
原因来自两个方向。
一个发生在采集之前:
工厂、酒店、学校、仓库这些真实场景,
正在被不同平台、不同数据公司一遍又一遍地寻找、登记和采集。
另一个发生在采集之后:
同一批已经采完的数据,又可能经过不同供应链节点反复流转。
行业里有个很直接的说法:串货。
场地重复采,数据重复卖。
这两个现象叠在一起,我觉得具身智能行业正在悄悄出现第一轮:
“数据通胀”。
一、场地还没开始采,就已经被登记了很多遍
前段时间具身智能数据最火的时候,很多项目第一句话不是问:
你有多少标注员?
而是:
-
你手里有多少真实场景?
-
工厂有没有?
-
酒店有没有?
-
学校有没有?
-
图书馆有没有?
-
仓库、商超、办公室能不能进?
于是很多公司开始干一件事情:
-
疯狂收集场地资源、场地名称、所在城市、面积。
-
行业类型、生产工序。
-
能不能进机器人、能不能拍摄、每天能进多少人。
-
是否有保密要求、甚至现场负责人联系方式。
慢慢地,“场地库”开始变成具身数据公司的一种资源。
这没有什么问题。
问题是:行业里容易获得的真实场景其实就那么多。
一家工厂可能今天被A平台登记。
下个月B公司找到厂长,又登记一次。
再过一段时间,C数据公司拿着另外一个机器人项目重新进场。
甚至同一个场地,同时出现在好几个供应商的资源表里。
最后就会出现一个很有意思的现象:
大家都说自己有500个场景,但把名单真正合并以后,可能大量场景其实是重合的。
这就是第一层“数据通胀”。
不是数据已经重复。
而是:生产数据的资源,先重复了。
二、同一工厂不能只是换个甲方再采一遍
这里很容易产生一个误解:是不是一个工厂采过一次,以后就不能采了?
当然不是。
同一个工厂完全可以产生很多批高价值数据。
-
第一次采正常搬运。
-
第二次增加不同重量。
-
第三次增加遮挡。
-
第四次增加多人干扰。
-
第五次专门采失败。
-
第六次采失败后的恢复。
-
第七次加入长流程装配。
虽然场地没有换,数据分布一直在变。
这种重复采集当然有意义。
真正的问题是另外一种情况:
-
场地没变。
-
工位没变。
-
物体差不多。
-
任务差不多。
-
动作也差不多。
只是:换了一家公司、换了一个项目、换了一批采集员,又重新采了几百小时。
文件确实是新的。
但是对模型来说:到底新增了多少它以前没见过的信息?
这才是关键。
所以我理解的具身数据“通胀”,并不是数据数量变多。
而是:每新增一个小时数据,带来的信息增量正在下降。
三、数据采完以后,还可能继续串货
如果第一种通胀发生在上游,第二种就发生在供应链里。
具身数据现在有一个非常特殊的问题:很多数据并不是甲方直接组织生产。
中间可能存在:机器人公司,数据平台,一级供应商,区域服务商,采集公司,甚至个人资源方。
供应链一长,就会出现一个风险:同一批数据被反复流转。A项目采了一批。
经过中间环节以后,换个数据包名称,重新拆一下目录,改一下任务描述,又进入另外一个需求。
行业里大家说的“串货”,很多时候就是这个意思。
这里当然需要区分具体合同、数据权属和授权范围,并不是所有二次流转都有问题。
但从模型训练价值来看,有一个问题无法回避:客户以为自己买到了第二批数据,实际上可能只是第一次见过的数据换了一件衣服。
这比场景重复更麻烦。
因为场景重复至少:重新采了一次。
光照有变化、人员有变化、动作会有细微差异。
但数据直接重复流转,可能连这些变化都没有。
三、这会让1000小时数据越来越危险
现在很多具身数据项目还是按照:小时。或者:Episode / 条,结算。
这套计价方式很容易理解。
但是当数据通胀越来越明显以后,一个问题一定会出现:
A公司给我1000小时。
B公司又给我1000小时。
所以我现在有2000小时数据?
未必。
如果两批数据高度相似,模型真正获得的有效信息量可能远小于2000小时。
于是未来客户可能不会只问:这批数据多少小时?
而会继续问:
-
和我已有的数据重复多少?
-
场景覆盖增加了多少?
-
新增了什么动作?
-
有没有新的失败类型?
-
有没有新的长尾状态?
-
这1000小时里,真正值得进入训练集的有多少?
这时候,“有效小时”这个概念也会再次升级。
过去我们讲:采集小时 ≠ 可结算有效小时。
以后可能还要再加一层:可结算有效小时 ≠ 训练有效小时。
五、正是这时我看到一类新工具出现
最近看到一个机器人数据工具:Calibra。
它给自己的定位是:Robot Dataset Observability。
简单理解:不要急着拿机器人数据去训练,先给数据做一次体检。
它不是传统的画框工具。
它检查的是:时间戳有没有异常,有没有丢帧,摄像头有没有冻结,视频是不是模糊,机器人动作有没有突然抖动,Episode是不是不完整,不同轨迹之间是不是高度相似,整个数据集到底覆盖了多大的行为范围。
它把流程概括成四步:Integrity → Quality → Coverage → Optimize
翻译过来就是:完整性 → 质量 → 覆盖度 → 优化。
这个顺序非常值得数据公司注意。
因为前两个问题大家一直在做。
数据坏没坏?
数据合不合格?
真正新的,是后两个:这批数据够不够丰富?
以及:这里面哪些数据其实可以不要?
六、过去QA找错数据,以后还找重复数据
传统数据标注公司的QA主要抓:漏标、错标、框偏、视频损坏、任务未完成。
这些属于:Bad Data。
但是如果具身数据进入今天这个阶段,QA可能还得面对另外两类问题:Duplicate Data。
重复数据。
以及:Low-value Data。
低增量数据。
最麻烦的是:后两种数据看起来完全“合格”。
比如一条机器人轨迹:视频完整、动作完整、没有丢帧、任务也成功完成。
甲方按照传统规则完全可以验收。
但如果客户数据库里已经有5000条高度相似轨迹,第5001条到底值多少钱?
这就是数据工具接下来必须回答的问题。
Calibra现在已经在尝试通过轨迹多样性、Coverage以及Coreset Selection,从大量Episode中筛选一个更有代表性的数据子集。
项目方还对30个公开LeRobot数据集进行了自动质量审计,结果显示这些公开数据集普遍存在至少一项值得关注的质量问题。
需要说明的是,它关于数据裁剪和训练效果的结果目前主要来自项目自己的实验,不能直接推导成“机器人数据可以统一删除75%”。
但它真正重要的地方根本不在这个数字。
而在于:已经有人开始把,“这条机器人数据到底值不值得留下”做成工具了。
七、为什么这种工具会在现在出现?
我觉得答案就在前面说的两个“通胀”里。
当数据非常缺的时候,没有人关心重复,先采回来再说。
当行业只有1000小时数据的时候,第1001小时通常都有价值。
但是当数据开始变成:10万小时、100万条Episode,不同公司又在相同场景反复生产,供应链里还有数据反复流转,问题就变了。
这时候模型训练真正稀缺的已经不只是:更多数据。
而是:新的数据。
所以去重、质量评分、轨迹聚类、Coverage分析、Coreset筛选这些工具开始有价值。
它们本质上都在解决同一个问题:别再告诉我有多少数据,先告诉我这里面到底有多少东西是我没见过的。
八、下一阶段,数据公司开始建数据指纹库
这是我觉得对现在数据公司最重要的一个变化。
很多公司正在积累:场地资源库。
以后可能还需要另一套东西:数据指纹库。
比如:
这个场地以前采过什么?
采过哪些任务?
有哪些物体?
哪些动作已经很多?
哪些动作很少?
数据和历史项目相似度多高?
有没有重复Episode?
哪些异常状态没有覆盖?
客户已有数据和准备采购的数据,到底有多少重合?
一旦这些信息能被记录下来,数据生产逻辑就会发生变化。
以前:客户要1000小时,我去找地方采1000小时。
以后:客户要提升模型能力,我先看已有数据缺什么,再决定下一批1000小时到底应该采什么。
前一种卖的是:产能。
后一种卖的是:数据设计能力。
九、具身数据第一轮淘汰赛不是价格战
而是:谁还在靠“数据量”做生意。
具身数据一定还会继续高速增长。
工厂也一定还会继续被采,数据交易也不会消失。
但是行业评价数据的方式可能正在变化:
第一阶段看:有没有。
第二阶段看:有多少。
第三阶段看:质量怎么样。
再往后一定会问:有没有增量。
到那个时候,一家数据公司真正值钱的能力,可能不再是:我手里有500家工厂。
而是:我知道这500家工厂里,哪50家还能生产客户真正缺的数据
也不再是:我这里还有10万条机器人数据。
而是:我能证明这10万条数据和你已有的数据到底重复多少,新增覆盖了什么。
这才是“数据通胀”真正会改变行业的地方。
场地被一遍又一遍地采。
数据被一层又一层地流转。
当大家手里的“小时数”越来越大以后,真正稀缺的反而会变成一件很简单的东西:
没见过的数据。
我是AI数据标注猿刘吉,
跟着我,用数据视角看AI世界。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)