具身智能数据采集的8个“黑话”:Ego、GoPro、UMI、遥操作到底是什么?
最近接触具身智能数据项目,我发现一个很有意思的现象:
大家嘴里说的词越来越专业,但很多人其实没有真正搞明白。
“这个项目要Ego数据。”
“客户要求GoPro采集。”
“这个是UMI,不是真机遥操。”
“我们这里做的是动捕。”
听起来好像都是一种东西。
但如果真把项目拿到手,你会发现:
Ego、GoPro、UMI、遥操作,根本不是一个维度的概念。
甚至“GoPro采集”这句话,严格来说都不太准确。
今天这篇不讲机器人估值,也不讲谁又融了多少钱。
我们就干一件事:
把具身智能数据采集里最常见的8个“黑话”,一次讲明白。
一、Ego:不是一种设备,而是一种“视角”
先说现在最火的一个词:Ego。
Ego一般指Egocentric,也就是第一人称视角数据。
最简单理解:你头上戴一个摄像头,然后正常干活。

你拿杯子、叠衣服、切菜、整理货架,摄像头记录下来的,就是你自己“眼睛附近看到的世界”。
这和站在旁边架一台摄像机拍你完全不同。
因为机器人以后真正工作的时候,也不是站在第三视角看自己干活,而是通过自己身上的摄像头去理解环境。
所以Ego数据真正有价值的地方,是:
它记录的是“一个智能体如何从自己的视角理解世界、完成任务”。
一句话记住:Ego不是相机,是第一人称数据视角。
二、Exo:站在旁边看你干活
和Ego对应的还有一个词:Exo。
也就是第三人称、外部视角。

比如一个人正在叠衣服。
头上戴着摄像头拍到的,是Ego。
旁边架着一台摄像机,把人的身体、桌子和衣服全部拍进去,这就是Exo。
为什么具身智能还需要Exo?
因为Ego虽然更像机器人的“眼睛”,但它有一个问题:很多身体动作看不全。
比如手臂到底抬了多少、身体怎么转、双手之间什么关系,第一视角有时候反而看不清。
所以很多数据采集项目现在会做:Ego + Exo同步采集。
一个看“我看到了什么”,一个看“我到底怎么动”。
三、GoPro:它只是摄像机,不是一种数据类型
这个词是目前最容易被叫错的。
不少项目直接说:“我们做GoPro数据。”
实际上,GoPro只是一个运动相机品牌。

它之所以频繁出现在具身智能项目里,
是因为它轻、广角、方便佩戴,
比较适合第一视角视频采集。
所以:人戴着GoPro采第一视角视频,得到的依然叫Ego数据。
GoPro只是:拿什么设备去采,这个关系可以这样理解:
Ego是“怎么拍”。
GoPro是“拿什么拍”。
就像你说“航拍”,这是拍摄方式;
大疆,是设备品牌。
这两个不能混在一起。
以后有人跟你说:“我们这个项目是GoPro采集。”
最好继续问一句:GoPro具体采什么?第一视角视频?有没有IMU?有没有手部轨迹?有没有深度数据?
这才开始进入项目本身。
四、UMI:人拿着“机器人的手”给机器人做示范

UMI这两年在具身智能数据圈非常火。
UMI全称:Universal Manipulation Interface。
普通Ego是什么?
人直接用自己的手干活。
比如伸手拿杯子。
UMI不一样。
它会让人拿着一个类似机器人夹爪的采集装置,再去完成任务。
比如:
-
夹杯子
-
拿香蕉
-
整理物品
-
打开抽屉
为什么绕这么一圈?
因为人的手和机器人的夹爪差别太大。
你用五根手指轻轻一捏就能拿起来的东西,机器人可能只有一个二指夹爪。
所以UMI的思路非常聪明:不要让机器人直接模仿人的手,而是让人先用一个接近机器人末端执行器的东西完成任务。
这样采出来的数据,就更容易映射到机器人动作上。
所以我经常把UMI解释成一句话:Ego是机器人“看人学”,UMI是人拿着“机器人手”给机器人做示范。
五、Teleoperation:遥操作就是人给机器人当代驾

接下来这个词,做具身数据的人基本都会碰到:
Teleoperation,遥操作。
这是目前最直接的一种机器人数据采集方式。
机器人真的在现场。
人通过手柄、VR设备、示教器、机械臂或者其他控制设备,让机器人完成任务。
比如:机器人面前放着一个杯子。
人通过控制设备,让机器人伸手、抓取、移动、放下。
整个过程中,系统会记录:机器人看到的画面、关节角度、末端位置、
动作指令、时间戳,甚至力、触觉等数据。
最终形成一个非常重要的数据关系:机器人当时看到了什么——人告诉机器人应该怎么做。
这就是大量机器人策略学习需要的数据。
所以遥操作可以理解成:人临时充当机器人的大脑。
人操作一次,机器人记一次。
等积累足够多以后,再让模型自己学。
六、MoCap:它采的不是视频,而是人到底怎么动

MoCap,全称Motion Capture。
中文就是:动作捕捉。
这个大家其实不陌生。
电影里的特效角色、游戏人物动作,很多就是通过动捕做出来的。
到了具身智能里,动捕又有了新的价值。
比如一个人抬手拿杯子。
普通摄像头看到的是:一段视频。
但动捕系统可以把它变成:肩膀在哪里,手肘弯了多少度,手腕怎么旋转,手指怎么变化,人体各个关节如何移动。
也就是说:视频记录“发生了什么”,动捕记录“身体到底是怎么动的”。
所以在一些全身机器人、人形机器人项目里,MoCap特别重要。
未来人形机器人学习走路、弯腰、搬箱子、双手协同,很多时候都需要这类数据。
七、Data Glove:数据手套,专门解决手怎么动

如果说MoCap主要看身体,那么Data Glove,也就是数据手套,重点就在手。
人的手其实是一个非常复杂的系统。
五根手指,每根手指还有多个关节。
你拿一个鸡蛋和拿一个铁锤,看起来都是“抓”,实际上手指姿态、力度完全不同。
普通视频想精准还原这些细节,很难。
所以一些机器人灵巧手项目,会让采集员戴数据手套。
系统可以记录:手指弯曲、手掌姿态、部分空间位置,甚至结合力反馈和触觉。
未来机器人如果真的要学会:穿针、拧螺丝、折衣服、插数据线,光看视频可能远远不够。
手部动作本身,也会成为一种独立的数据。
八、Robot Trajectory:真机轨迹,才是机器人自己真正干过的数据

最后一个词:Trajectory,轨迹数据。
这个其实特别重要。
机器人完成一次完整任务,留下来的不只是“一段视频”。
真正有价值的是整个任务过程中的连续状态。
比如:机器人开始时手在哪里,看到了什么;
第一步执行什么动作,执行以后环境发生了什么变化;
第二步又做什么;最终任务有没有成功。
这整个过程,就是一条轨迹。
所以现在很多项目按:条、轨迹、episode来统计数据。
而不是简单按照视频小时数。
一条高质量轨迹,理论上应该能够回答三个问题:
-
当时环境是什么状态?
-
机器人采取了什么动作?
-
动作最后产生了什么结果?
这也是为什么我一直说:具身智能数据真正值钱的,最终未必是“录了多少小时视频”。
而是:里面有多少能够真正拿去训练机器人的有效轨迹。
把这8个词放在一起,其实就很好理解了
大家可以记住一个最简单的框架。
第一层,是怎么看世界:Ego第一视角。Exo第三视角。
第二层,是拿什么设备采:GoPro、头戴相机、深度相机。
第三层,是人怎么教机器人:UMI、遥操作、MoCap、数据手套。
第四层,才是最后得到什么数据:视频、姿态、关节、位姿、动作和Robot Trajectory。
你把这四层搞清楚以后,具身数据项目里很多所谓的“黑话”,其实就没那么神秘了。
真正接项目的时候,别只问“多少钱一小时”
我最近接触不少想入局具身数据的团队。
很多人的第一个问题都是:“现在一小时多少钱?”
但做这种项目,我反而建议你先问六个问题:
第一,采的是Ego还是Exo?
第二,用什么设备?普通相机、GoPro还是RGB-D?
第三,是人类行为采集,还是UMI、遥操作、真机采集?
第四,要采哪些模态?只有视频,还是还要IMU、位姿、关节、力、触觉?
第五,最终按什么结算?原始小时、有效小时还是有效轨迹?
第六,最重要的一点:什么叫“有效”?
因为同样叫“采100小时具身数据”,背后的成本可能完全不是一回事。
一个人戴着GoPro整理货架,和一个人操作几十万元的机器人完成插拔任务,都可以叫“具身数据采集”。
但它们的设备成本、人员要求、失败率、验收标准和最终数据价值,完全不同。
所以未来做具身智能数据,真正要学会的不是背几个英文缩写。
而是听到这些词以后,你能够马上判断:
客户到底要什么数据,数据是怎么生产出来的,以及这笔项目到底能不能做。
我是AI数据标注猿刘吉,跟着我用数据视角看AI世界。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)