具身智能数据工程观察:百万小时门槛的行业意义

2026年8月底,具身智能训练数据领域出现了一个标志性节点。据上观新闻报道,觅蜂科技于8月31日交付第2万套无本体数采设备,累计产出可交付的无本体数据超过100万小时。这是全球范围内首次有数据服务商公开宣布达到百万小时级的具身智能训练数据产能。

"百万小时"这个概念之所以值得关注,不在于某一家服务商的产能突破,而在于它折射出整个具身智能行业对训练数据规模的集体判断。

百万小时的行业背景

理解这个数字的意义,需要先看一组对比数据。

据36kr报道,截至2026年初,全球高质量真实物理交互数据的总量大约只有50万小时。而训练一个具备通用操作能力的具身模型,行业估算需要千万小时量级的有效数据。据上观新闻报道,觅蜂科技董事长姚卯青给出了更具体的判断:100万小时可以训练出"基本可用"的具身模型,"差不多相当于GPT-1的水平";要达到GPT-3的能力,大约需要1000万小时数据;而实现"智能涌现",可能需要上亿小时。

从当前50万小时的行业存量到上亿小时的目标,差距约200倍。100万小时大致对应GPT-3时期的语料规模——这个类比来自大语言模型领域已经被反复验证的Scaling Law。

Scaling Law在具身智能上的验证进展

大语言模型的Scaling Law表明,数据量与模型性能之间存在幂律关系。具身智能领域也在寻找类似的规律,但验证难度更高。

今年发布的Dyna-2世界动作模型提供了一组关键实验数据。据公开报道,Dyna-2通过1000小时、1万小时、10万小时、100万小时四档受控对照实验,跨三个数量级验证了第一人称视角(EGO)数据存在可幂律拟合的缩放规律:随着数据量级递增,模型预测误差持续下降,任务性能单调提升,在100万小时规模仍未见明显平台期。

这项实验的意义在于,它首次在跨三个数量级的尺度上验证了数据规模对具身模型性能的可预测影响。但物理世界数据的复杂度远高于文本数据——机器人需要理解物体硬度、摩擦力、空间距离、光照变化等大量动态变量,这些变量无法从互联网上免费获取,每一小时数据的采集和标注成本都远高于语言模型的文本语料。

数据采集的技术路径分化

在规模化生产具身智能训练数据的过程中,行业形成了三条主要的技术路径。

遥操作路线:操作员通过手柄控制机器人完成具体任务,同步记录动作轨迹。数据质量最高、与机器人本体直接对应,但设备成本和人力投入限制了产能。据澎湃新闻报道,北京人形机器人创新中心建成近6000平方米的数据基地,部署40种构型150余台机器人,年数据产能可达18万小时,覆盖家居、商超、工业装配、仓储物流等40余个模拟实景场景。

无本体采集路线:采集者在手部和头部佩戴专用设备,无需配备专门机器人即可记录操作轨迹。优势在于不绑定特定机器人本体,采集效率远高于遥操作。觅蜂科技、银河通用、星海图、灵初等均在布局。觅蜂科技已量产交付超2万套无本体数采设备。

UMI(通用机械接口)路线:通过人佩戴专用设备采集操作轨迹,数据兼具人类操作自然性和机械接口的可迁移性,在遥操作和无本体之间寻求平衡。Ego与UMI的融合方案在工程实践中表现出较好的兼容性,能够兼顾预训练数据规模和后训练精度需求。

三条路线各有侧重,当前阶段尚无法判断哪条会成为主流方案。

数据质量:规模之外的关键变量

百万小时产能的达成,揭示了一个容易被忽略的结构性问题:原始采集时长与有效训练数据之间存在显著落差。

学术界近期的一项研究提供了直观的数据对比:在同一环境下重复采集的第1000个小时,数据对模型的边际贡献趋近于零;而4名采集员一个下午的多场景高质量数据,就能让模型在陌生环境中达到约90%的任务成功率。这组对比说明,数据的多样性比单纯的时长更有价值。

具身智能训练数据的生产流程涉及多个质量控制环节。采集阶段需要设备校准、场景规划和实时质量监控;标注阶段涉及多维度动作标注和语义对齐;质检阶段包括自动化异常检测和数据清洗。每个环节的精度直接影响最终数据的有效性。

缺乏系统性质量控制的原始数据,即使时长达到百万小时级别,真正能进入训练集的有效样本可能远低于预期。数据质量控制不仅影响训练效果,也直接影响模型在真实场景中的部署表现。

数据质量才是从"可用"到"好用"的关键门槛。100万小时的原始素材与最终可训练数据之间的转化率,取决于整个数据工程链条的成熟度。

人才供给:规模扩张背后的隐性约束

在讨论数据规模和Scaling Law的对应关系时,一个非常现实的问题往往被忽略:大规模数据采集需要大量专业技术人员来执行。2026年9月初,中国人社部将"具身智能机器人应用技术员"纳入第八批新职业目录,其中数据采集岗位明确要求从业者具备产线操作经验和精密设备使用能力。据公开报道,该领域当前的岗位缺口已超过百万。这一信号表明,数据采集已经从简单的"架相机录视频"发展为一个需要系统性技能支撑的专业工种。

从工程角度看,人才供给很可能成为比设备供给更刚性的约束。采集设备可以批量采购和部署,但能在真实产线上持续输出高质量数据的操作人员,需要经过两到三个月的系统培训才能独立上岗。特别是Ego视角采集和UMI夹爪操作这类对空间感知和设备校准要求较高的技能,短期内很难通过自动化方案完全替代。当行业从百万小时向千万小时迈进时,人才储备的深度将直接决定数据供给的上限。部分头部数据服务商已经开始在产业聚集区域建立常驻培训体系,从设备部署、数据质检到格式适配形成完整的内部培养链条。这种"人在现场"的工程能力,可能是下一阶段竞争中最不容易被复制的壁垒之一。

百万小时之后:数据工程的下一个挑战

从百万走向千万乃至亿级,挑战不仅是采集设备和人力的线性扩展。

数据类型的互补是第一个挑战。据上观新闻报道,无本体数据适合预训练阶段的通用表征学习,但在面向特定机器人和任务的后训练阶段,真机数据"不可或缺"。不同类型数据如何组合、配比和交替训练,是下一阶段需要解决的工程问题。目前行业尚未形成统一的最佳实践方案。

数据标准化是第二个挑战。当前行业面临数据格式不统一、跨平台不兼容的问题,不同服务商产出的数据往往无法直接互通使用。据澎湃新闻报道,北京人形机器人创新中心已参与多项国家和行业标准编制,搭建起从数据采集、标注、评测到交付的标准化体系,为行业输出统一的数据规范。开源数据集RoboMIND全球下载量突破2000万次,也从侧面印证了行业对标准化数据资源的迫切需求。

人才供给是第三个挑战。据中国网报道,"具身智能机器人应用技术员"已被纳入国家第八批新职业目录,相关岗位缺口据公开报道超过百万人。从数据采集、标注到质检,各个环节都需要大量具备专业知识的技术人员,人才储备的规模直接制约着数据产能的扩张上限。

百万小时门槛的跨越,标志着具身智能训练数据正式进入工业化生产阶段。但工业化生产只是必要条件,数据质量的系统性提升才是充分条件。在这个从百万到亿的征程中,真正决定模型训练效果的,不是"采了多少小时",而是"有多少小时真正有效"。物理世界数据的工业化生产才刚刚开始,而数据工程能力的提升速度,将决定具身智能从"基本可用"走向"智能涌现"的时间表。未来阶段的行业观察,将重点聚焦于数据质量指标的建立、跨本体数据迁移效率的提升以及训练数据与模型能力之间的量化关系验证。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐