EGO 数采的“眼睛“:深度相机如何撑起具身智能数据元年
第一章 现象层:2026,"具身数据元年"是怎么被点名的
1.1 三问"具身数据元年"
把时间拨回 2026 年 3 月 30 日。36 氪发了一篇题为《三问"具身数据元年"》的稿子,把这一年正式定调。三个问题分别是:为什么是 2026 年?数据到底缺在哪?谁来建数据基础设施?
稿子给出的核心判断是:当 VLA 架构统一了模型层之后,具身智能的瓶颈已经从"算法有多聪明"转移到了"数据够不够、采得对不对"。模型层的"聪明红利"已经吃完,下一程要拼的是"数据红利"。
这个判断被业内反复印证。CSDN 天企 7 月 23 日的长文《EGO 数采为什么突然火爆?》把它拆成了四个维度——技术驱动、产业需求、成本革命、资本狂潮。这是 2026 年最具传播力的"元年叙事"框架之一。
1.2 四维拆解:为什么是 EGO 数采
CSDN 天企的四维拆解,是理解 EGO 数采为什么"突然火爆"的最简明骨架(综合 CSDN 天企 7/23 长文 + 36 氪 + 知乎 7/27 EGO 新风向 + 6/30《2026 中国具身智能数据采集与数据产业发展展望》解读四源印证):
① 技术驱动——多模态同步
EGO 数采的"第一人称"不是修辞,是工程定义。它要求视觉、力觉、触觉、IMU 等多路传感信号在同一时间基准下同步采集。视觉这条链路里,深度相机是承担"看见空间结构"的核心传感器——RGB 告诉机器人"那是什么",Depth 告诉它"那有多远",IMU 告诉它"我自己在哪"。三者时间戳必须对齐到毫秒甚至亚毫秒级,否则下游的模仿学习算法会因为"时序错位"而学出错误的因果。
② 产业需求——算法跑不通、场景不通用
36 氪三问里点出一个现实痛点:很多团队在实验室里跑通的抓取算法,搬到真实产线或家庭场景就跑不通。根因不是算法不行,是训练数据与真实场景的分布偏差太大。EGO 数采的价值在于:让机器人在真实场景里"以第一人称视角记录自己的交互过程",采集到的数据天然贴合部署分布。
③ 成本革命——便携化与百万小时计划
2026 年的 EGO 数采,已经不是"几百万一套的实验室设备"了。鹿明机器人在 AWE2026 上发布的 FastUMI Ego——全球首款无需建图的第一人称数据采集方案,把数据采集的门槛拉到了"便携可量产"级别。配套的"百万小时数据采集计划"在 2026 年正式启动。这是 EGO 数采从"实验室课题"走向"产业基础设施"的标志事件。
④ 资本狂潮——220 亿美元与 64 座数采中心
2026 上半年,全球具身智能融资突破 220 亿美元;中国一级市场融资 1072 亿元 / 217 笔,超过 2025 年全年(综合知乎 8/6 + 36 氪 + 财富号三源印证)。配套地,全国规划建设的数采中心已达 64 座,覆盖 27 城(6/30《2026 中国具身智能数据采集与数据产业发展展望》解读)。
资本与基础设施同步进场,是"元年"被点名的最后一根钉子。
1.3 行业标杆:奥比中光×蚂蚁灵波
如果说四维拆解是"叙事骨架",那 7 月 17 日奥比中光与蚂蚁灵波联合发布的方案,就是"元年"叙事里第一块被钉死的工程样板。
这个联合方案的核心,是奥比中光 Gemini 330 系列深度相机 + 蚂蚁灵波具身机器人本体,做成了业内第一个被广泛引用的"EGO 数采行业标杆"。它的技术亮点在于——芯片侧深度计算。Gemini 330 系列搭载奥比中光自研的 MX6800 深度引擎芯片,深度计算在相机侧完成,主机只接收已经算好的深度数据,大幅降低了主机算力负载。
这件事的工程意义在于:当机器人本体同时要跑 VLA 大模型 + 运动控制 + 多路传感融合时,主机算力是稀缺资源。深度计算下沉到相机侧,等于把"视觉感知"这一层的算力账单从主机剥离了出去。这是 EGO 数采从"能跑"到"能规模化部署"的关键工程拐点之一。
第二章 技术骨架层:EGO 数采的"眼睛",看的是四项硬指标
2.1 EGO 数采对深度相机提出的四项硬指标
把 EGO 数采的"多模态同步"这件事拆到深度相机这一层,工程师真正要看的,是四项硬指标。
指标一:多模态同步精度(RGB + Depth + IMU 时间戳对齐)
EGO 数采不是单路视觉采集,是"视觉 + IMU + 力觉 + 触觉"的多路同步采集。深度相机至少要同步输出 RGB + Depth + IMU 三路信号,且三路时间戳必须能在硬件层面对齐。软件层面的"后对齐"会引入抖动,对下游模仿学习算法是致命的——机器人会从错位的时序里学出错误的因果。
奥比中光 Gemini 330 系列在这一指标上的工程亮点,就是原生 RGB + Depth + IMU 同步输出——不是事后拼接,是硬件级同步。这是它被选为蚂蚁灵波联合方案"行业标杆"的根本原因之一。
指标二:帧率(高速运动场景不掉帧)
EGO 数采覆盖的场景里,有一类是高速运动——机械臂快速抓取、灵巧手操作物体、机器人移动过程中的视觉伺服。这些场景对帧率的要求是 60 FPS 起步,部分场景要到 120 FPS。低帧率会导致运动物体在相邻帧间位移过大,下游光流与位姿估计算法失真。
指标三:精度与测距范围(覆盖近场抓取到中远场导航)
EGO 数采是"全场景数据栈"——既要采集近场精密抓取(0.3-1m,亚毫米级精度),也要采集中距离避障(2-5m,厘米级),还要采集远距离导航(5-20m+)。单一深度相机难以全覆盖,这就是为什么 EGO 数采方案往往需要"多相机组合"。
指标四:算力侧处理(降低主机算力负载)
这条指标在 2026 年变得格外重要。具身机器人本体的算力预算是被 VLA 大模型 + 运动控制 + 多路传感融合"瓜分"的稀缺资源。深度计算如果全压在主机上,会吃掉可观的比例。算力侧处理(depth-on-camera) 已经从"锦上添花"变成"规模化部署的硬约束"。
2.2 深度相机在 EGO 数采里到底承担什么
把四项指标合起来看,深度相机在 EGO 数采里承担的角色,可以这样概括:
它是机器人"看见世界"的物理入口,也是机器人"记住看见"的数据源头。
光从镜头进来,被 CMOS 转成电信号,被深度算法转成空间结构,最后被时间戳"封存"成一份可以反复学习的数据样本。这条链路里,深度相机承担的是"光 → 空间结构 → 数据"的三重转换。
这正是为什么我把今天这篇长文的文风主线,定在"光作为数据洪流"——
8/10 那篇《当光成为尺子》,讲的是光怎么量距离;8/11 那篇全局快门哲学,讲的是光怎么测时间;今天这一篇,讲的是光怎么变成机器人学会"看见世界"的全部记忆。
数据洪流,从这里开始涌动。
第三章 路线适配层:结构光、ToF、双目,谁才是 EGO 数采的"最佳眼睛"
3.1 EGO 数采是"多场景数据栈",不是单一场景
承接 8/10《当光成为尺子》的三路线决策框架,我们来看一个被很多团队忽略的关键认知:EGO 数采不是单一场景,是"多场景数据栈"。
这意味着——选型工程师不能问"哪一条路线最好",而要问"我的数据采集场景矩阵里,每一条路线各覆盖哪一段"。
把 EGO 数采的典型场景拆开,至少有这么几类:
| 数据采集场景 | 典型距离 | 精度要求 | 帧率要求 | 推荐路线 | 典型相机 |
|---|---|---|---|---|---|
| 灵巧手精密抓取 | 0.3-1m | 亚毫米 | ≥60 FPS | 结构光 | 奥比中光 Gemini 330 |
| 室内操作台交互 | 1-3m | 毫米级 | 30-60 FPS | 结构光 / iToF | Gemini 330 / 图漾 TM421 |
| 室内 AGV 避障 | 2-5m | 厘米级 | ≥60 FPS | iToF | 图漾 TM421-E1 |
| 室外机器人导航 | 5-20m+ | 厘米级 | 30 FPS | 被动双目 | Stereolabs ZED X / 海康 MV-DP |
| 长距离环境感知 | 20m+ | 厘米-分米 | 30 FPS | dToF 激光雷达 / 长基线双目 | Ouster / Livox |
这张表传递的核心信息是:没有任何一条深度相机路线能单打独斗覆盖 EGO 数采的全场景。一套成熟的 EGO 数采方案,往往是"近场结构光 + 中距离 iToF + 远距离双目"的组合。
3.2 三路线在 EGO 数采场景的适配差异
把 8/10《当光成为尺子》的五维评分(精度/测距/抗光/算力/成本)平移到 EGO 数采语境下,三路线的适配差异会更清晰:
结构光(代表:奥比中光 Gemini 330)
- 适配场景:室内近场精密抓取数据采集(0.3-3m)
- EGO 数采核心价值:亚毫米级近场精度,是灵巧手抓取数据采集的首选
- 短板:户外强光失效,远距离精度衰减——意味着 EGO 数采如果覆盖户外场景,结构光必须搭配双目/iToF
奥比中光 Gemini 330 系列之所以能成为"EGO 数采行业标杆",正是因为它把结构光的"近场高精度"与"AI 模型后处理补洞降噪"做了一次工程融合——配合 LingBot-Depth 模型在边缘做降噪补洞,把结构光原本在弱纹理、反光表面的失效问题做了工程兜底。
iToF(代表:图漾 TM421-E1 / Basler-Sony DepthSense)
- 适配场景:室内中距离避障、导航数据采集(0.5-10m)
- EGO 数采核心价值:广谱中距离、帧率高、算力需求低
- 短板:多路径干扰(墙角、镜面、透明物体)——意味着 EGO 数采如果场景有大量反射面,iToF 数据需要算法补偿
图漾 TM421-E1 iToF 系列在 EGO 数采语境下的位置,是"中距离万金油"——它不是任何一段的冠军,但是中段最稳的那条线。
被动双目(代表:Stereolabs ZED X / 海康机器人 MV-DP)
- 适配场景:户外、远距离导航数据采集(5-20m+)
- EGO 数采核心价值:被动感知、户外抗强光、远距离精度
- 短板:白墙问题(无纹理区域匹配失败)、算力需求高——意味着 EGO 数采如果场景有大量无纹理平面,双目需要搭配主动补光或结构光辅助
Stereolabs ZED X GMSL2 全局快门双目立体相机(30fps 1920×1200,2m 内 ±0.8% 深度精度)是 EGO 数采户外场景的典型选型;海康机器人 MV-DP 系列则是国产被动双目在工业产线级数据采集的代表。
3.3 一个被低估的选型维度:数据采集的"可重复性"
除了上述三路线的物理适配差异,EGO 数采还有一个常被低估的选型维度——数据采集的"可重复性"。
EGO 数采不是"采一次就完",是"采一批可以反复学习的数据集"。这意味着同一台深度相机在同一场景下,多次采集的数据必须高度一致——否则下游模仿学习算法会被"传感器自身噪声"干扰,学出"飘忽不定"的动作策略。
这条维度上:
- 结构光的可重复性最高(主动投射已知图案,每次测量基准一致)
- iToF 可重复性中等(受多路径干扰影响,每次测量有波动)
- 被动双目 可重复性受场景纹理影响最大(白墙场景每次匹配结果都可能不同)
这也是为什么奥比中光 Gemini 330 这种"结构光 + AI 补洞"的方案,在 EGO 数采语境下被反复选型的另一个底层原因——结构光的"测量基准稳定"特性,让采集到的数据天然适合做模仿学习的训练样本。
第四章 选型对标层:6 款标杆深度相机的 EGO 数采适配矩阵
4.1 六维评分体系
为了让选型工程师有一张可以直接对照的表,我把 EGO 数采语境下的深度相机选型维度收敛为六维:
| 维度 | 评分口径 | 1 分 | 10 分 |
|---|---|---|---|
| 多模态同步 | RGB + Depth + IMU 硬件级同步能力 | 软件后对齐 | 硬件级原生同步 |
| 帧率 | 高速运动场景不掉帧能力 | ≤30 FPS | ≥120 FPS |
| 精度 | 近场亚毫米 / 远场厘米能力 | 分米级 | 亚毫米级 |
| 测距范围 | 覆盖距离区间 | <3m | >20m |
| 算力侧处理 | depth-on-camera 能力 | 全压主机 | 芯片侧完成 |
| 数据采集适配度 | 综合可重复性 + 工程成熟度 | 不可重复 | 工业级可重复 |
4.2 6 款标杆深度相机 EGO 数采适配矩阵
| 相机 | 路线 | 多模态同步 | 帧率 | 精度 | 测距 | 算力侧 | 数据采集适配度 | 综合适配 |
|---|---|---|---|---|---|---|---|---|
| Gemini 330 | 结构光 | 10 | 8 | 9 | 6 | 9 | 9 | 51 |
| RealSense D585 | 结构光/iToF 混合 | 9 | 8 | 8 | 7 | 8 | 8 | 48 |
| 图漾 TM421-E1 | iToF | 8 | 9 | 7 | 8 | 8 | 8 | 48 |
| Stereolabs ZED X | 被动双目 | 8 | 8 | 7 | 9 | 7 | 7 | 46 |
| 海康 MV-DP | 被动双目 | 8 | 8 | 7 | 8 | 7 | 8 | 46 |
| 鹿明 FastUMI Ego | 第一人称专用 | 8 | 7 | 7 | 6 | 7 | 9 | 44 |
4.3 矩阵解读
-
奥比中光 Gemini 330 综合得分最高——它的"多模态同步 + 算力侧处理 + 近场精度"三项硬指标全部拉满,是 EGO 数采"室内近场精密抓取"场景的标杆选型。这也是它能成为蚂蚁灵波联合方案"行业标杆"的根本原因。
-
图漾 TM421-E1 与 RealSense D585 并列第二——前者是 iToF 中距离万金油,后者是结构光/iToF 混合方案。两者在 EGO 数采语境下更适合"中距离避障/导航"场景。
-
Stereolabs ZED X 与海康 MV-DP 并列第三——两者是"户外/远距离导航"场景的首选,但"数据采集适配度"略低,因为被动双目的可重复性受场景纹理制约。
-
鹿明 FastUMI Ego 是一个特殊存在——它的"数据采集适配度"得 9 分,是因为它是唯一一款专门为第一人称数据采集设计的方案(全球首款无需建图)。它的精度、测距、算力侧指标并不拔尖,但它的"便携化 + 第一人称专用 + 百万小时数据采集计划"定位,让它在"大规模数据采集基础设施"语境下独占一席。
第五章 国产坐标层:从"数据石油"到"数据基础设施"
5.1 国产 EGO 数采的三个坐标
如果说 2026 年的 EGO 数采是一场"数据石油开采"运动,那国产坐标可以分三层来看:
第一层——深度相机硬件("钻头")
- 奥比中光:结构光 + 自研深度引擎芯片 MX6800(相机侧深度计算),是 EGO 数采"室内近场精密抓取"的钻头
- 图漾科技:iToF 中距离万金油,是 EGO 数采"中距离避障/导航"的钻头
- 海康机器人:被动双目工业产线级,是 EGO 数采"工业场景"的钻头
第二层——数据采集方案("采油机")
- 鹿明机器人 FastUMI Ego:全球首款无需建图的第一人称数据采集方案,"百万小时数据采集计划"启动——这是 EGO 数采从"实验室设备"走向"产业基础设施"的标志
- 奥比中光 × 蚂蚁灵波联合方案:深度相机 + 具身机器人本体的"行业标杆"
第三层——数据采集硬件底座("油田基础设施")
这一层是常被忽略但至关重要的——EGO 数采的"多模态同步采集",本质上是一个高精度数据采集工程问题。它需要的硬件底座包括:
- 多通道同步采集(视觉 + 力觉 + 触觉 + IMU 多路时间戳对齐)
- 高精度 ADC(应变桥路、ICP/IEPE 加速度传感器等微弱信号调理)
- IMU 与惯导模组(三轴加速度计 + 陀螺仪 + 磁力计 9 轴,姿态解算)
朗锐创新业务板块下的高精度数据采集应用(24-bit Σ-Δ ADC、8/16/32 路同步采集、≥100 kS/s 采样率、USB 3.0/GigE/PCIe 高速数据流上传)与 IMU 与惯导模组(三轴加速度计+陀螺仪+磁力计 9 轴、出厂全温标定、GNSS/INS 松耦合与紧耦合解算),正是 EGO 数采"多模态同步采集"硬件底座的国产承载者之一。
5.2 朗锐智能·萝卜派 DCM3:相机侧深度计算的国产嵌入式平台
把视角从"数据采集硬件底座"再往相机侧推一层——奥比中光 Gemini 330 的"芯片侧深度计算"之所以能工程落地,离不开一颗相机核心主板。
朗锐创新"朗锐智能"业务板块下的萝卜派(RabuPaw)计算模组,有一条产品线叫 DCM3——明确对标奥比中光相机核心主板,面向深度感知与空间智能的嵌入式处理平台。它原生支持多路 MIPI/GMSL 相机接入,硬解码 H.264/H.265,适配双目/深度/多光谱相机模组,预装 TensorRT/CUDA 推理环境。
这条产品线的意义在于——它把"相机侧深度计算"这件事,从"奥比中光 Gemini 330 单点方案"延展到了"国产嵌入式平台的通用能力"。当 EGO 数采方案商需要自研深度相机时,DCM3 是一个可以直接对标奥比中光相机核心主板的国产坐标。
5.3 国产数据基础设施的市场坐标
2026 年的市场数据可以给国产 EGO 数采基础设施一个相对客观的坐标:
- 全球具身智能融资(综合知乎 8/6 + 36 氪 + 财富号三源印证):2026 上半年突破 220 亿美元,中国一级市场融资 1072 亿元 / 217 笔,超过 2025 全年
- 数采中心规划(6/30《2026 中国具身智能数据采集与数据产业发展展望》):全国规划 64 座数采中心,覆盖 27 城
- 数据集占比预测(亿欧智库,7/2):预计 2031 年中国数据集占全球 50%
这个坐标提醒选型工程师:EGO 数采不是短期的工程课题,是 2026-2031 这五年里"数据基础设施"国产化的核心战场。深度相机是"钻头",数据采集方案是"采油机",高精度数据采集硬件底座是"油田"——三层国产化进度,决定了具身智能能不能真正"采到油"。
第六章 :光,从尺子到数据洪流
回到开篇那个动作——8/10 那篇《当光成为尺子》开篇,是"你伸手接住朋友抛来的苹果"。
今天,我想把这个动作再往前推一步——当机器人也要"学会"接住那个苹果时,它需要的不只是看见,而是"记住每一次看见"。
光,在 8/10 那篇里是尺子——量出"那有多远";
光,在 8/11 那篇里是时间——按下相机的"暂停键";
光,在今天这篇里是数据洪流——它从镜头涌进来,被 CMOS 转成电信号,被深度算法转成空间结构,最后被时间戳"封存"成机器人学会"看见世界"的全部记忆。
EGO 数采的"眼睛",就是深度相机。它看见的不只是空间,是机器人学习"看见"的每一份样本。
- 结构光 像一位精准的钟表匠——主动打光,在近场里量到亚毫米,是灵巧手精密抓取数据采集的"最佳眼睛";
- iToF 像一位稳健的测绘师——每个像素独立测距,中距离广谱,是室内避障、导航数据采集的"最佳眼睛";
- 被动双目 像一位观察入微的画家——被动、节能、户外可用,是户外远距离数据采集的"最佳眼睛"。
三双"眼睛"没有谁取代谁。一套成熟的 EGO 数采方案,往往是"近场结构光 + 中距离 iToF + 远距离双目"的组合——三双眼睛各看一段,合起来才是机器人学会"看见世界"的完整视野。
而 2026 年这场"具身数据元年",本质上是光,第一次被规模化地"封存"成数据的运动。
下次你看到一台具身机器人稳稳接住一个苹果时,或许可以多花一秒钟想想——它"学会"这个动作的方式,不是被写进代码,而是用一台深度相机,采集成千上万次"光的数据洪流",再让算法从中"学会"看见。
那台深度相机,就是它学会看见世界的眼睛。
而光,从两千万年前人眼进化沉淀下来的"双目深度感知系统",到 2026 年被工程化地"封存"成具身数据元年的数据洪流——这条漫长的路上,"光"一直在做同一件事:让看见,成为可能。
只不过这一次,看见的不只是空间,是机器人学习"看见"的全部记忆。
互动 hook:你的 EGO 数采方案,缺哪一双"眼睛"?
EGO 数采这件事,没有标准答案——只有"最契合场景的妥协"。
选型三连问(欢迎评论区留下你的答案,下期我们挑一个最典型的来拆):
- 你团队的 EGO 数采方案,目前用的是哪一条深度相机路线?(结构光 / iToF / 被动双目 / 多路线组合)
- 你最头疼的场景是哪一类?(近场精密抓取 / 室内避障 / 户外导航 / 多场景组合)
- 如果让你重新选型,你会优先补齐"哪一双眼睛"?
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)