第一章 现象层:2026,"具身数据元年"是怎么被点名的

1.1 三问"具身数据元年"

把时间拨回 2026 年 3 月 30 日。36 氪发了一篇题为《三问"具身数据元年"》的稿子,把这一年正式定调。三个问题分别是:为什么是 2026 年?数据到底缺在哪?谁来建数据基础设施?

稿子给出的核心判断是:当 VLA 架构统一了模型层之后,具身智能的瓶颈已经从"算法有多聪明"转移到了"数据够不够、采得对不对"。模型层的"聪明红利"已经吃完,下一程要拼的是"数据红利"。

这个判断被业内反复印证。CSDN 天企 7 月 23 日的长文《EGO 数采为什么突然火爆?》把它拆成了四个维度——技术驱动、产业需求、成本革命、资本狂潮。这是 2026 年最具传播力的"元年叙事"框架之一。

1.2 四维拆解:为什么是 EGO 数采

CSDN 天企的四维拆解,是理解 EGO 数采为什么"突然火爆"的最简明骨架(综合 CSDN 天企 7/23 长文 + 36 氪 + 知乎 7/27 EGO 新风向 + 6/30《2026 中国具身智能数据采集与数据产业发展展望》解读四源印证):

① 技术驱动——多模态同步

EGO 数采的"第一人称"不是修辞,是工程定义。它要求视觉、力觉、触觉、IMU 等多路传感信号在同一时间基准下同步采集。视觉这条链路里,深度相机是承担"看见空间结构"的核心传感器——RGB 告诉机器人"那是什么",Depth 告诉它"那有多远",IMU 告诉它"我自己在哪"。三者时间戳必须对齐到毫秒甚至亚毫秒级,否则下游的模仿学习算法会因为"时序错位"而学出错误的因果。

② 产业需求——算法跑不通、场景不通用

36 氪三问里点出一个现实痛点:很多团队在实验室里跑通的抓取算法,搬到真实产线或家庭场景就跑不通。根因不是算法不行,是训练数据与真实场景的分布偏差太大。EGO 数采的价值在于:让机器人在真实场景里"以第一人称视角记录自己的交互过程",采集到的数据天然贴合部署分布。

③ 成本革命——便携化与百万小时计划

2026 年的 EGO 数采,已经不是"几百万一套的实验室设备"了。鹿明机器人在 AWE2026 上发布的 FastUMI Ego——全球首款无需建图的第一人称数据采集方案,把数据采集的门槛拉到了"便携可量产"级别。配套的"百万小时数据采集计划"在 2026 年正式启动。这是 EGO 数采从"实验室课题"走向"产业基础设施"的标志事件。

④ 资本狂潮——220 亿美元与 64 座数采中心

2026 上半年,全球具身智能融资突破 220 亿美元;中国一级市场融资 1072 亿元 / 217 笔,超过 2025 年全年(综合知乎 8/6 + 36 氪 + 财富号三源印证)。配套地,全国规划建设的数采中心已达 64 座,覆盖 27 城(6/30《2026 中国具身智能数据采集与数据产业发展展望》解读)。

资本与基础设施同步进场,是"元年"被点名的最后一根钉子。

1.3 行业标杆:奥比中光×蚂蚁灵波

如果说四维拆解是"叙事骨架",那 7 月 17 日奥比中光与蚂蚁灵波联合发布的方案,就是"元年"叙事里第一块被钉死的工程样板。

这个联合方案的核心,是奥比中光 Gemini 330 系列深度相机 + 蚂蚁灵波具身机器人本体,做成了业内第一个被广泛引用的"EGO 数采行业标杆"。它的技术亮点在于——芯片侧深度计算。Gemini 330 系列搭载奥比中光自研的 MX6800 深度引擎芯片,深度计算在相机侧完成,主机只接收已经算好的深度数据,大幅降低了主机算力负载。

这件事的工程意义在于:当机器人本体同时要跑 VLA 大模型 + 运动控制 + 多路传感融合时,主机算力是稀缺资源。深度计算下沉到相机侧,等于把"视觉感知"这一层的算力账单从主机剥离了出去。这是 EGO 数采从"能跑"到"能规模化部署"的关键工程拐点之一


第二章 技术骨架层:EGO 数采的"眼睛",看的是四项硬指标

2.1 EGO 数采对深度相机提出的四项硬指标

把 EGO 数采的"多模态同步"这件事拆到深度相机这一层,工程师真正要看的,是四项硬指标。

指标一:多模态同步精度(RGB + Depth + IMU 时间戳对齐)

EGO 数采不是单路视觉采集,是"视觉 + IMU + 力觉 + 触觉"的多路同步采集。深度相机至少要同步输出 RGB + Depth + IMU 三路信号,且三路时间戳必须能在硬件层面对齐。软件层面的"后对齐"会引入抖动,对下游模仿学习算法是致命的——机器人会从错位的时序里学出错误的因果。

奥比中光 Gemini 330 系列在这一指标上的工程亮点,就是原生 RGB + Depth + IMU 同步输出——不是事后拼接,是硬件级同步。这是它被选为蚂蚁灵波联合方案"行业标杆"的根本原因之一。

指标二:帧率(高速运动场景不掉帧)

EGO 数采覆盖的场景里,有一类是高速运动——机械臂快速抓取、灵巧手操作物体、机器人移动过程中的视觉伺服。这些场景对帧率的要求是 60 FPS 起步,部分场景要到 120 FPS。低帧率会导致运动物体在相邻帧间位移过大,下游光流与位姿估计算法失真。

指标三:精度与测距范围(覆盖近场抓取到中远场导航)

EGO 数采是"全场景数据栈"——既要采集近场精密抓取(0.3-1m,亚毫米级精度),也要采集中距离避障(2-5m,厘米级),还要采集远距离导航(5-20m+)。单一深度相机难以全覆盖,这就是为什么 EGO 数采方案往往需要"多相机组合"。

指标四:算力侧处理(降低主机算力负载)

这条指标在 2026 年变得格外重要。具身机器人本体的算力预算是被 VLA 大模型 + 运动控制 + 多路传感融合"瓜分"的稀缺资源。深度计算如果全压在主机上,会吃掉可观的比例。算力侧处理(depth-on-camera) 已经从"锦上添花"变成"规模化部署的硬约束"。

2.2 深度相机在 EGO 数采里到底承担什么

把四项指标合起来看,深度相机在 EGO 数采里承担的角色,可以这样概括:

它是机器人"看见世界"的物理入口,也是机器人"记住看见"的数据源头。

光从镜头进来,被 CMOS 转成电信号,被深度算法转成空间结构,最后被时间戳"封存"成一份可以反复学习的数据样本。这条链路里,深度相机承担的是"光 → 空间结构 → 数据"的三重转换。

这正是为什么我把今天这篇长文的文风主线,定在"光作为数据洪流"——

8/10 那篇《当光成为尺子》,讲的是光怎么量距离;8/11 那篇全局快门哲学,讲的是光怎么测时间;今天这一篇,讲的是光怎么变成机器人学会"看见世界"的全部记忆

数据洪流,从这里开始涌动。


第三章 路线适配层:结构光、ToF、双目,谁才是 EGO 数采的"最佳眼睛"

3.1 EGO 数采是"多场景数据栈",不是单一场景

承接 8/10《当光成为尺子》的三路线决策框架,我们来看一个被很多团队忽略的关键认知:EGO 数采不是单一场景,是"多场景数据栈"

这意味着——选型工程师不能问"哪一条路线最好",而要问"我的数据采集场景矩阵里,每一条路线各覆盖哪一段"。

把 EGO 数采的典型场景拆开,至少有这么几类:

数据采集场景 典型距离 精度要求 帧率要求 推荐路线 典型相机
灵巧手精密抓取 0.3-1m 亚毫米 ≥60 FPS 结构光 奥比中光 Gemini 330
室内操作台交互 1-3m 毫米级 30-60 FPS 结构光 / iToF Gemini 330 / 图漾 TM421
室内 AGV 避障 2-5m 厘米级 ≥60 FPS iToF 图漾 TM421-E1
室外机器人导航 5-20m+ 厘米级 30 FPS 被动双目 Stereolabs ZED X / 海康 MV-DP
长距离环境感知 20m+ 厘米-分米 30 FPS dToF 激光雷达 / 长基线双目 Ouster / Livox

这张表传递的核心信息是:没有任何一条深度相机路线能单打独斗覆盖 EGO 数采的全场景。一套成熟的 EGO 数采方案,往往是"近场结构光 + 中距离 iToF + 远距离双目"的组合。

3.2 三路线在 EGO 数采场景的适配差异

把 8/10《当光成为尺子》的五维评分(精度/测距/抗光/算力/成本)平移到 EGO 数采语境下,三路线的适配差异会更清晰:

结构光(代表:奥比中光 Gemini 330)

  • 适配场景:室内近场精密抓取数据采集(0.3-3m)
  • EGO 数采核心价值:亚毫米级近场精度,是灵巧手抓取数据采集的首选
  • 短板:户外强光失效,远距离精度衰减——意味着 EGO 数采如果覆盖户外场景,结构光必须搭配双目/iToF

奥比中光 Gemini 330 系列之所以能成为"EGO 数采行业标杆",正是因为它把结构光的"近场高精度"与"AI 模型后处理补洞降噪"做了一次工程融合——配合 LingBot-Depth 模型在边缘做降噪补洞,把结构光原本在弱纹理、反光表面的失效问题做了工程兜底。

iToF(代表:图漾 TM421-E1 / Basler-Sony DepthSense)

  • 适配场景:室内中距离避障、导航数据采集(0.5-10m)
  • EGO 数采核心价值:广谱中距离、帧率高、算力需求低
  • 短板:多路径干扰(墙角、镜面、透明物体)——意味着 EGO 数采如果场景有大量反射面,iToF 数据需要算法补偿

图漾 TM421-E1 iToF 系列在 EGO 数采语境下的位置,是"中距离万金油"——它不是任何一段的冠军,但是中段最稳的那条线。

被动双目(代表:Stereolabs ZED X / 海康机器人 MV-DP)

  • 适配场景:户外、远距离导航数据采集(5-20m+)
  • EGO 数采核心价值:被动感知、户外抗强光、远距离精度
  • 短板:白墙问题(无纹理区域匹配失败)、算力需求高——意味着 EGO 数采如果场景有大量无纹理平面,双目需要搭配主动补光或结构光辅助

Stereolabs ZED X GMSL2 全局快门双目立体相机(30fps 1920×1200,2m 内 ±0.8% 深度精度)是 EGO 数采户外场景的典型选型;海康机器人 MV-DP 系列则是国产被动双目在工业产线级数据采集的代表。

3.3 一个被低估的选型维度:数据采集的"可重复性"

除了上述三路线的物理适配差异,EGO 数采还有一个常被低估的选型维度——数据采集的"可重复性"

EGO 数采不是"采一次就完",是"采一批可以反复学习的数据集"。这意味着同一台深度相机在同一场景下,多次采集的数据必须高度一致——否则下游模仿学习算法会被"传感器自身噪声"干扰,学出"飘忽不定"的动作策略。

这条维度上:

  • 结构光的可重复性最高(主动投射已知图案,每次测量基准一致)
  • iToF 可重复性中等(受多路径干扰影响,每次测量有波动)
  • 被动双目 可重复性受场景纹理影响最大(白墙场景每次匹配结果都可能不同)

这也是为什么奥比中光 Gemini 330 这种"结构光 + AI 补洞"的方案,在 EGO 数采语境下被反复选型的另一个底层原因——结构光的"测量基准稳定"特性,让采集到的数据天然适合做模仿学习的训练样本


第四章 选型对标层:6 款标杆深度相机的 EGO 数采适配矩阵

4.1 六维评分体系

为了让选型工程师有一张可以直接对照的表,我把 EGO 数采语境下的深度相机选型维度收敛为六维:

维度 评分口径 1 分 10 分
多模态同步 RGB + Depth + IMU 硬件级同步能力 软件后对齐 硬件级原生同步
帧率 高速运动场景不掉帧能力 ≤30 FPS ≥120 FPS
精度 近场亚毫米 / 远场厘米能力 分米级 亚毫米级
测距范围 覆盖距离区间 <3m >20m
算力侧处理 depth-on-camera 能力 全压主机 芯片侧完成
数据采集适配度 综合可重复性 + 工程成熟度 不可重复 工业级可重复

4.2 6 款标杆深度相机 EGO 数采适配矩阵

相机 路线 多模态同步 帧率 精度 测距 算力侧 数据采集适配度 综合适配
Gemini 330 结构光 10 8 9 6 9 9 51
RealSense D585 结构光/iToF 混合 9 8 8 7 8 8 48
图漾 TM421-E1 iToF 8 9 7 8 8 8 48
Stereolabs ZED X 被动双目 8 8 7 9 7 7 46
海康 MV-DP 被动双目 8 8 7 8 7 8 46
鹿明 FastUMI Ego 第一人称专用 8 7 7 6 7 9 44

4.3 矩阵解读

  • 奥比中光 Gemini 330 综合得分最高——它的"多模态同步 + 算力侧处理 + 近场精度"三项硬指标全部拉满,是 EGO 数采"室内近场精密抓取"场景的标杆选型。这也是它能成为蚂蚁灵波联合方案"行业标杆"的根本原因。

  • 图漾 TM421-E1 与 RealSense D585 并列第二——前者是 iToF 中距离万金油,后者是结构光/iToF 混合方案。两者在 EGO 数采语境下更适合"中距离避障/导航"场景。

  • Stereolabs ZED X 与海康 MV-DP 并列第三——两者是"户外/远距离导航"场景的首选,但"数据采集适配度"略低,因为被动双目的可重复性受场景纹理制约。

  • 鹿明 FastUMI Ego 是一个特殊存在——它的"数据采集适配度"得 9 分,是因为它是唯一一款专门为第一人称数据采集设计的方案(全球首款无需建图)。它的精度、测距、算力侧指标并不拔尖,但它的"便携化 + 第一人称专用 + 百万小时数据采集计划"定位,让它在"大规模数据采集基础设施"语境下独占一席。


第五章 国产坐标层:从"数据石油"到"数据基础设施"

5.1 国产 EGO 数采的三个坐标

如果说 2026 年的 EGO 数采是一场"数据石油开采"运动,那国产坐标可以分三层来看:

第一层——深度相机硬件("钻头")

  • 奥比中光:结构光 + 自研深度引擎芯片 MX6800(相机侧深度计算),是 EGO 数采"室内近场精密抓取"的钻头
  • 图漾科技:iToF 中距离万金油,是 EGO 数采"中距离避障/导航"的钻头
  • 海康机器人:被动双目工业产线级,是 EGO 数采"工业场景"的钻头

第二层——数据采集方案("采油机")

  • 鹿明机器人 FastUMI Ego:全球首款无需建图的第一人称数据采集方案,"百万小时数据采集计划"启动——这是 EGO 数采从"实验室设备"走向"产业基础设施"的标志
  • 奥比中光 × 蚂蚁灵波联合方案:深度相机 + 具身机器人本体的"行业标杆"

第三层——数据采集硬件底座("油田基础设施")

这一层是常被忽略但至关重要的——EGO 数采的"多模态同步采集",本质上是一个高精度数据采集工程问题。它需要的硬件底座包括:

  • 多通道同步采集(视觉 + 力觉 + 触觉 + IMU 多路时间戳对齐)
  • 高精度 ADC(应变桥路、ICP/IEPE 加速度传感器等微弱信号调理)
  • IMU 与惯导模组(三轴加速度计 + 陀螺仪 + 磁力计 9 轴,姿态解算)

朗锐创新业务板块下的高精度数据采集应用(24-bit Σ-Δ ADC、8/16/32 路同步采集、≥100 kS/s 采样率、USB 3.0/GigE/PCIe 高速数据流上传)与 IMU 与惯导模组(三轴加速度计+陀螺仪+磁力计 9 轴、出厂全温标定、GNSS/INS 松耦合与紧耦合解算),正是 EGO 数采"多模态同步采集"硬件底座的国产承载者之一。

5.2 朗锐智能·萝卜派 DCM3:相机侧深度计算的国产嵌入式平台

把视角从"数据采集硬件底座"再往相机侧推一层——奥比中光 Gemini 330 的"芯片侧深度计算"之所以能工程落地,离不开一颗相机核心主板。

朗锐创新"朗锐智能"业务板块下的萝卜派(RabuPaw)计算模组,有一条产品线叫 DCM3——明确对标奥比中光相机核心主板,面向深度感知与空间智能的嵌入式处理平台。它原生支持多路 MIPI/GMSL 相机接入,硬解码 H.264/H.265,适配双目/深度/多光谱相机模组,预装 TensorRT/CUDA 推理环境。

这条产品线的意义在于——它把"相机侧深度计算"这件事,从"奥比中光 Gemini 330 单点方案"延展到了"国产嵌入式平台的通用能力"。当 EGO 数采方案商需要自研深度相机时,DCM3 是一个可以直接对标奥比中光相机核心主板的国产坐标。

5.3 国产数据基础设施的市场坐标

2026 年的市场数据可以给国产 EGO 数采基础设施一个相对客观的坐标:

  • 全球具身智能融资(综合知乎 8/6 + 36 氪 + 财富号三源印证):2026 上半年突破 220 亿美元,中国一级市场融资 1072 亿元 / 217 笔,超过 2025 全年
  • 数采中心规划(6/30《2026 中国具身智能数据采集与数据产业发展展望》):全国规划 64 座数采中心,覆盖 27 城
  • 数据集占比预测(亿欧智库,7/2):预计 2031 年中国数据集占全球 50%

这个坐标提醒选型工程师:EGO 数采不是短期的工程课题,是 2026-2031 这五年里"数据基础设施"国产化的核心战场。深度相机是"钻头",数据采集方案是"采油机",高精度数据采集硬件底座是"油田"——三层国产化进度,决定了具身智能能不能真正"采到油"。


第六章 :光,从尺子到数据洪流

回到开篇那个动作——8/10 那篇《当光成为尺子》开篇,是"你伸手接住朋友抛来的苹果"。

今天,我想把这个动作再往前推一步——当机器人也要"学会"接住那个苹果时,它需要的不只是看见,而是"记住每一次看见"

光,在 8/10 那篇里是尺子——量出"那有多远";
光,在 8/11 那篇里是时间——按下相机的"暂停键";
光,在今天这篇里是数据洪流——它从镜头涌进来,被 CMOS 转成电信号,被深度算法转成空间结构,最后被时间戳"封存"成机器人学会"看见世界"的全部记忆。

EGO 数采的"眼睛",就是深度相机。它看见的不只是空间,是机器人学习"看见"的每一份样本。

  • 结构光 像一位精准的钟表匠——主动打光,在近场里量到亚毫米,是灵巧手精密抓取数据采集的"最佳眼睛";
  • iToF 像一位稳健的测绘师——每个像素独立测距,中距离广谱,是室内避障、导航数据采集的"最佳眼睛";
  • 被动双目 像一位观察入微的画家——被动、节能、户外可用,是户外远距离数据采集的"最佳眼睛"。

三双"眼睛"没有谁取代谁。一套成熟的 EGO 数采方案,往往是"近场结构光 + 中距离 iToF + 远距离双目"的组合——三双眼睛各看一段,合起来才是机器人学会"看见世界"的完整视野。

而 2026 年这场"具身数据元年",本质上是光,第一次被规模化地"封存"成数据的运动。

下次你看到一台具身机器人稳稳接住一个苹果时,或许可以多花一秒钟想想——它"学会"这个动作的方式,不是被写进代码,而是用一台深度相机,采集成千上万次"光的数据洪流",再让算法从中"学会"看见。

那台深度相机,就是它学会看见世界的眼睛。

而光,从两千万年前人眼进化沉淀下来的"双目深度感知系统",到 2026 年被工程化地"封存"成具身数据元年的数据洪流——这条漫长的路上,"光"一直在做同一件事:让看见,成为可能。

只不过这一次,看见的不只是空间,是机器人学习"看见"的全部记忆。


互动 hook:你的 EGO 数采方案,缺哪一双"眼睛"?

EGO 数采这件事,没有标准答案——只有"最契合场景的妥协"。

选型三连问(欢迎评论区留下你的答案,下期我们挑一个最典型的来拆):

  1. 你团队的 EGO 数采方案,目前用的是哪一条深度相机路线?(结构光 / iToF / 被动双目 / 多路线组合)
  2. 你最头疼的场景是哪一类?(近场精密抓取 / 室内避障 / 户外导航 / 多场景组合)
  3. 如果让你重新选型,你会优先补齐"哪一双眼睛"?

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐