最近接触具身智能数据项目,我发现一个很有意思的现象:

大家嘴里说的词越来越专业,但很多人其实没有真正搞明白。

“这个项目要Ego数据。”

“客户要求GoPro采集。”

“这个是UMI,不是真机遥操。”

“我们这里做的是动捕。”

听起来好像都是一种东西。

但如果真把项目拿到手,你会发现:

Ego、GoPro、UMI、遥操作,根本不是一个维度的概念。

甚至“GoPro采集”这句话,严格来说都不太准确。

今天这篇不讲机器人估值,也不讲谁又融了多少钱。

我们就干一件事:

把具身智能数据采集里最常见的8个“黑话”,一次讲明白。

一、Ego:不是一种设备,而是一种“视角”

先说现在最火的一个词:Ego。

Ego一般指Egocentric,也就是第一人称视角数据。

最简单理解:你头上戴一个摄像头,然后正常干活。

图片

你拿杯子、叠衣服、切菜、整理货架,摄像头记录下来的,就是你自己“眼睛附近看到的世界”。

这和站在旁边架一台摄像机拍你完全不同。

因为机器人以后真正工作的时候,也不是站在第三视角看自己干活,而是通过自己身上的摄像头去理解环境。

所以Ego数据真正有价值的地方,是:

它记录的是“一个智能体如何从自己的视角理解世界、完成任务”。

一句话记住:Ego不是相机,是第一人称数据视角。

二、Exo:站在旁边看你干活

和Ego对应的还有一个词:Exo。

也就是第三人称、外部视角。

图片

比如一个人正在叠衣服。

头上戴着摄像头拍到的,是Ego。

旁边架着一台摄像机,把人的身体、桌子和衣服全部拍进去,这就是Exo。

为什么具身智能还需要Exo?

因为Ego虽然更像机器人的“眼睛”,但它有一个问题:很多身体动作看不全。

比如手臂到底抬了多少、身体怎么转、双手之间什么关系,第一视角有时候反而看不清。

所以很多数据采集项目现在会做:Ego + Exo同步采集。

一个看“我看到了什么”,一个看“我到底怎么动”。

三、GoPro:它只是摄像机,不是一种数据类型

这个词是目前最容易被叫错的。

不少项目直接说:“我们做GoPro数据。”

实际上,GoPro只是一个运动相机品牌。

图片

它之所以频繁出现在具身智能项目里,

是因为它轻、广角、方便佩戴,

比较适合第一视角视频采集。

所以:人戴着GoPro采第一视角视频,得到的依然叫Ego数据。

GoPro只是:拿什么设备去采,这个关系可以这样理解:

Ego是“怎么拍”。

GoPro是“拿什么拍”。

就像你说“航拍”,这是拍摄方式;

大疆,是设备品牌。

这两个不能混在一起。

以后有人跟你说:“我们这个项目是GoPro采集。”

最好继续问一句:GoPro具体采什么?第一视角视频?有没有IMU?有没有手部轨迹?有没有深度数据?

这才开始进入项目本身。

四、UMI:人拿着“机器人的手”给机器人做示范

图片

UMI这两年在具身智能数据圈非常火。

UMI全称:Universal Manipulation Interface。

普通Ego是什么?

人直接用自己的手干活。

比如伸手拿杯子。

UMI不一样。

它会让人拿着一个类似机器人夹爪的采集装置,再去完成任务。

比如:

  • 夹杯子

  • 拿香蕉

  • 整理物品

  • 打开抽屉

为什么绕这么一圈?

因为人的手和机器人的夹爪差别太大。

你用五根手指轻轻一捏就能拿起来的东西,机器人可能只有一个二指夹爪。

所以UMI的思路非常聪明:不要让机器人直接模仿人的手,而是让人先用一个接近机器人末端执行器的东西完成任务。

这样采出来的数据,就更容易映射到机器人动作上。

所以我经常把UMI解释成一句话:Ego是机器人“看人学”,UMI是人拿着“机器人手”给机器人做示范。

五、Teleoperation:遥操作就是人给机器人当代驾

图片

接下来这个词,做具身数据的人基本都会碰到:

Teleoperation,遥操作。

这是目前最直接的一种机器人数据采集方式。

机器人真的在现场。

人通过手柄、VR设备、示教器、机械臂或者其他控制设备,让机器人完成任务。

比如:机器人面前放着一个杯子。

人通过控制设备,让机器人伸手、抓取、移动、放下。

整个过程中,系统会记录:机器人看到的画面、关节角度、末端位置、

动作指令、时间戳,甚至力、触觉等数据。

最终形成一个非常重要的数据关系:机器人当时看到了什么——人告诉机器人应该怎么做。

这就是大量机器人策略学习需要的数据。

所以遥操作可以理解成:人临时充当机器人的大脑。

人操作一次,机器人记一次。

等积累足够多以后,再让模型自己学。

六、MoCap:它采的不是视频,而是人到底怎么动

图片

MoCap,全称Motion Capture。

中文就是:动作捕捉。

这个大家其实不陌生。

电影里的特效角色、游戏人物动作,很多就是通过动捕做出来的。

到了具身智能里,动捕又有了新的价值。

比如一个人抬手拿杯子。

普通摄像头看到的是:一段视频。

但动捕系统可以把它变成:肩膀在哪里,手肘弯了多少度,手腕怎么旋转,手指怎么变化,人体各个关节如何移动。

也就是说:视频记录“发生了什么”,动捕记录“身体到底是怎么动的”。

所以在一些全身机器人、人形机器人项目里,MoCap特别重要。

未来人形机器人学习走路、弯腰、搬箱子、双手协同,很多时候都需要这类数据。

七、Data Glove:数据手套,专门解决手怎么动

图片

如果说MoCap主要看身体,那么Data Glove,也就是数据手套,重点就在手。

人的手其实是一个非常复杂的系统。

五根手指,每根手指还有多个关节。

你拿一个鸡蛋和拿一个铁锤,看起来都是“抓”,实际上手指姿态、力度完全不同。

普通视频想精准还原这些细节,很难。

所以一些机器人灵巧手项目,会让采集员戴数据手套。

系统可以记录:手指弯曲、手掌姿态、部分空间位置,甚至结合力反馈和触觉。

未来机器人如果真的要学会:穿针、拧螺丝、折衣服、插数据线,光看视频可能远远不够。

手部动作本身,也会成为一种独立的数据。

八、Robot Trajectory:真机轨迹,才是机器人自己真正干过的数据

图片

最后一个词:Trajectory,轨迹数据。

这个其实特别重要。

机器人完成一次完整任务,留下来的不只是“一段视频”。

真正有价值的是整个任务过程中的连续状态。

比如:机器人开始时手在哪里,看到了什么;

第一步执行什么动作,执行以后环境发生了什么变化;

第二步又做什么;最终任务有没有成功。

这整个过程,就是一条轨迹。

所以现在很多项目按:条、轨迹、episode来统计数据。

而不是简单按照视频小时数。

一条高质量轨迹,理论上应该能够回答三个问题:

  1. 当时环境是什么状态?

  2. 机器人采取了什么动作?

  3. 动作最后产生了什么结果?

这也是为什么我一直说:具身智能数据真正值钱的,最终未必是“录了多少小时视频”。

而是:里面有多少能够真正拿去训练机器人的有效轨迹。

把这8个词放在一起,其实就很好理解了

大家可以记住一个最简单的框架。

第一层,是怎么看世界:Ego第一视角。Exo第三视角。

第二层,是拿什么设备采:GoPro、头戴相机、深度相机。

第三层,是人怎么教机器人:UMI、遥操作、MoCap、数据手套。

第四层,才是最后得到什么数据:视频、姿态、关节、位姿、动作和Robot Trajectory。

你把这四层搞清楚以后,具身数据项目里很多所谓的“黑话”,其实就没那么神秘了。

真正接项目的时候,别只问“多少钱一小时”

我最近接触不少想入局具身数据的团队。

很多人的第一个问题都是:“现在一小时多少钱?”

但做这种项目,我反而建议你先问六个问题:

第一,采的是Ego还是Exo?

第二,用什么设备?普通相机、GoPro还是RGB-D?

第三,是人类行为采集,还是UMI、遥操作、真机采集?

第四,要采哪些模态?只有视频,还是还要IMU、位姿、关节、力、触觉?

第五,最终按什么结算?原始小时、有效小时还是有效轨迹?

第六,最重要的一点:什么叫“有效”?

因为同样叫“采100小时具身数据”,背后的成本可能完全不是一回事。

一个人戴着GoPro整理货架,和一个人操作几十万元的机器人完成插拔任务,都可以叫“具身数据采集”。

但它们的设备成本、人员要求、失败率、验收标准和最终数据价值,完全不同。

所以未来做具身智能数据,真正要学会的不是背几个英文缩写。

而是听到这些词以后,你能够马上判断:

客户到底要什么数据,数据是怎么生产出来的,以及这笔项目到底能不能做。

我是AI数据标注猿刘吉,跟着我用数据视角看AI世界。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐