机器人完成一项操作,看起来像是在回答一个动作问题:下一步,机械臂应该怎么动?

但对于具身智能预训练模型来说,这还远远不够。

拿起杯子、装配零件、整理物品,每一个动作都会改变物体的状态,也会改变机器人下一时刻看到的世界。模型不仅要生成动作,还需要持续理解:当前发生了什么,动作会带来什么变化,哪些变化真正关系到任务能否完成。

如果模型只记住动作轨迹,却没有学会世界如何随行动变化,那么面对新的物体、位置和场景时,它仍然很容易失效。这正是世界模型对于具身智能的意义:让机器人不仅学习动作,还学习动作发生时真实世界如何变化。

但世界模型要理解真实世界,不能只依靠模型架构本身。就好比一个人能很好地融入所处的环境,除了对环境的理解能力不差之外(对应模型架构本身),还需要有一定“阅历”!也就是说:

1、训练数据首先需要足够真实,也需要覆盖足够广的物体、任务、空间和自然动作;

2、模型见过怎样的世界,很大程度上决定了它能够学习怎样的世界规律。见得越多,习得的越多,自然“懂”得也越多!

带着这些问题,我们近日和穹彻智能的团队聊了聊~

穹彻智能近期发布了具身智能预训练模型 Noe-0 的技术预览,给出了一条值得看的路线:如何用100%无本体数据,如何完成具身预训练?这也是国内首个从真实世界数据采集、模型预训练到任务后训练,100%都由无本体数据贯穿的工作。

认真看 Noe-0,可以从这两个关键词入手。

第一个是 具身世界动作模型。Noe-0 以世界模型架构为基础,将对真实环境变化的建模与机器人动作生成放在同一个学习过程中,让对世界变化的理解参与动作规划。

第二个是 全链路无本体数据。这里的“全链路”,指无本体数据从大规模预训练延续到面向具体任务的后训练,使两个阶段保持连续一致的动作分布;“无本体”则意味着采集不依赖机器人本体和固定采集工位,可以进入真实的生活与工作空间,记录人在自然状态下完成操作的过程。前者让预训练获得的自然动作知识更顺畅地进入任务能力形成,后者则为世界模型打开更广泛的真实场景、物体和任务。

围绕这两项核心,穹彻智能还建设了支撑真实世界数据生产、治理和训练交付的 AI 基础设施。

把这些内容放在一起看,这次发布真正值得解读的是一条完整路径:通过全链路无本体数据,为具身世界模型引入更广泛的真实世界经验,再经过预训练、面向具体任务的后训练与真实执行,把这些经验逐步转化为机器人能力。

原文链接:具身开始摆脱遥操作数据依赖,Noe-0 给出了一套全链路“无本体数据”的解法。

在这里插入图片描述

01 世界动作模型,在理解变化的同时生成动作

世界模型关注的是环境如何随时间和行动发生变化。对于机器人而言,这意味着模型不仅要识别当前看到了什么,还要持续理解动作发生后,与任务相关的世界状态将怎样改变。

但能够预测世界变化,并不自动等于能够生成机器人动作。Noe-0 的核心选择,是将真实环境变化的建模与机器人动作生成放进同一个学习过程,由此构建具身世界动作模型。

在具体推理中,Noe-0 接收图像与任务语义,在同一个共享表示中同时进行隐式世界想象与动作规划。这里的世界想象不是动作规划之前独立运行的一道工序,两者在同一时间步并行发生,共同参与动作生成。

两者在同一学习过程中相互约束的意义也正在于此:隐式世界想象为动作规划提供物体状态和环境上下文,帮助模型理解当前动作可能带来的变化;动作信号则反过来约束模型,使其更关注真正影响任务进程的状态变化。

真实环境中始终存在大量视觉变化,但并非每一种变化都与操作有关。通过世界想象与动作规划的相互约束,模型需要从连续观察中分辨哪些变化与当前任务相关,并据此规划下一步动作。

每次动作执行后,新的观察会进入下一轮联合推理,形成“观察—联合推理—执行—再观察”的连续过程。换句话说,Noe-0 不只是在回答“下一步怎么动”,也在行动过程中持续理解“世界正在怎样变化”。

图片

此次技术预览还给出了一组 Noe-0 的预训练 Scaling 实验。

在一组固定验证集下的预训练对照实验中,穹彻分别使用 10%、20% 和 100% 数据量进行训练,验证动作损失随数据量增加呈现有序下降。结果显示,更多真实世界数据能够继续改善模型在同一验证设置下的学习表现。

这组结果呈现出一个清晰信号:对于复杂的真实场景无本体数据,WAM的架构在数据规模扩展后持续获得收益。

图片

但要让具身世界模型沿着这条 Scaling 路径继续提升,关键不只是增加数据量,还要让模型接触足够丰富的真实场景、物体、任务和自然动作。模型能够学习怎样的世界,很大程度上取决于训练数据能够呈现怎样的世界。

02 全链路无本体数据,让预训练更有“真实世界阅历”

具身世界动作模型回答了 Noe-0 如何在同一学习过程中理解世界变化并生成机器人动作。但模型能否学到更广泛的世界规律,还取决于它能够接触怎样的数据。全链路无本体数据要回答的,正是这些足够丰富、自然并且连续的真实世界经验从哪里来。

这里的“全链路”,指同一条无本体数据路线贯穿大规模预训练与具体任务后训练。

预训练是 Noe-0 形成基础能力的核心阶段。要让模型随着数据增长持续获益,数据规模与数据分布需要同时扩展。

对于语言模型,互联网提供了规模巨大、分布广泛的文本。对于具身智能模型,真正有价值的经验却大量存在于物理世界中。

由于物理操作经验无法像文本一样直接从互联网获得,过去一段时间,行业中一种较普遍的做法,是围绕少量固定采集工位组织任务:在可控环境中摆放物体、设置流程并反复记录操作。这类工位能够提供标准、可控的数据,但桌面、物体和任务也更容易重复。如果模型主要从这些工位获取经验,即使采集时长继续增加,新增样本仍可能集中在已有分布中。

真实世界里的操作远不止这些:在厨房处理蔬菜、容器和柔性包装,在办公室整理文具与设备,在工厂操作工具和零件,不同空间都会带来新的物体、布局、材质和动作方式。这些长尾经验很难通过少量预设工位自然覆盖。

在数据侧,穹彻智能选择把采集的锚点放在真实世界。

支撑这一选择的,是穹彻智能自研的便携式、可穿戴数据采集系统 RoboPocket。设备不需要连接复杂的外部传感器,降低了采集对固定场地和复杂布置的依赖,因而能够更方便地进入不同空间和多种真实场景。

在采集过程中,RoboPocket 使用同步的头部与双腕视角,记录人在真实环境中的自然操作过程。头部视角保留任务意图和整体环境,两路手腕视角补充局部接触、手部动作与物体状态变化。

采集过程不依赖机器人遥操作。人可以按照自然方式完成任务,不需要先把动作压缩到某一种机器人本体或固定工位能够复现的范围内。

当采集可以随人进入真实的生活与工作空间,数据分布也随之被打开。不同环境会长期积累各自的包装、工具、容器和日用品,也包含由不同材质、形态、使用状态和空间关系构成的长尾变化。

目前,穹彻智能的数据采集网络已覆盖全国超过 50 个城市,累计采集超过 10 万小时的真实世界数据。

但这里更值得关注的并不是小时数本身。

对于具身预训练而言,Scaling 不只是重复更多次相同动作,而是让模型持续看到更多任务、物体、空间、动作方式和真实世界变化。数据规模的意义,最终要落到经验分布能否不断拓展。

精细装配、工具使用、柔性物体处理、分类归置和多阶段操作,都可以在真实环境中自然产生。模型由此接触到的,不再只是为采集而搭建的标准样本,而是现实世界本身不断变化的任务组合。

在这里插入图片描述

在预训练阶段,大规模分布式无本体数据让 Noe-0 从更广泛的真实经验中学习手部运动、物体状态变化与动作节奏,逐步形成跨任务的基础能力。

进入具体任务的后训练阶段后,穹彻再围绕目标任务采集更聚焦的 RoboPocket 无本体数据,用于任务适配和能力强化。

为什么还要强调两个训练阶段使用同一条数据路线?

如果预训练学习的是自然、连续的人类操作,而任务后训练重新切换为停顿、分段和频繁修正的遥操作轨迹,两个阶段之间就可能出现动作分布变化。预训练已经学到的动作知识,需要重新适应另一种动作表达。

Noe-0 采用全链路无本体数据,重点不在于少用一种采集方式,而在于保持预训练与任务后训练之间的动作分布连续,使任务适配尽量不重新收窄预训练阶段获得的自然动作知识。

世界动作模型决定 Noe-0 如何学习世界与行动;全链路无本体数据则决定模型能够从什么样的经验中学习,以及这些经验如何贯穿能力形成过程。两者共同构成 Noe-0 的技术重点。

03 AI Infra,把无本体数据变成训练资产

全链路无本体数据要真正支撑模型训练,不能只解决“在哪里采”和“怎样采”,还需要解决数据如何稳定进入预训练与任务后训练。

真实世界扩大了数据分布,也把数据生产变成了一个更复杂的系统问题。

当采集人员分布在不同城市,面对不同场景、物体和任务时,固定的质检规则和标注模板很难覆盖所有情况。数据来源越分散、任务类型越丰富,入库、检查、审核、标注、版本和交付的管理难度也会同步增加。

采到数据,只是第一步。

数据是否完整?多视角是否同步?操作是否符合任务目标?哪些片段可以直接进入训练,哪些需要人工判断?一次训练中暴露的问题,能不能追溯到对应任务和数据版本?

如果这些环节无法连接,真实世界经验就很难稳定转化为预训练资产。

围绕 Noe-0,穹彻智能建设了连接端侧采集与云端治理的 AI 基础设施。

RoboPocket 在端侧记录同步、完整的多视角任务数据,同时完成基础质量检查。发现问题后,系统可以第一时间向数据采集员反馈,帮助其及时调整采集过程。数据管理平台 DM3 则在云端连接任务管理、数据入库、质量检查、人工审核、标注审核和数据交付。云端形成的质检与审核结果不会停留在后台,而会反馈到对应任务和数据采集员,帮助其理解问题并改进下一轮采集。

随着任务、物体、场景和动作不断扩展,数据治理面对的不只是更多高频、重复的判断,质检与标注的边界也变得更加复杂。如果这些工作主要依赖人工,所需人力、处理时间和治理成本都会随着数据规模持续增长。

因此,DM3 采用 AI-native 的方式,让 AI 参与任务理解、质量检查、预标注和置信度判断。自动化链路处理规则清晰、置信度较高的样本,人则集中处理难例与长尾问题,以此降低规模化数据治理的成本,并提升处理效率。

DM3 内置的 AI Agent 还可以辅助完成任务审核、任务指导、数据查询、问题处理和消息通知,把分散在不同人员与环节中的信息组织到一条可追踪的流程里。

图片

从端侧采集和任务管理,到云端入库、质检、审核、标注和交付,RoboPocket 与 DM3 将分布式数据生产中的关键环节组织在同一套基础设施中。

这套 AI 基础设施的价值,是让大规模、多样的真实世界数据能够按照统一要求持续处理并稳定交付训练,同时降低治理成本随数据规模同步增长的压力。

04 世界模型 x 全链路无本体数据,最终都要回到预训练能力

Noe-0 的技术路线可以归结为两个相互支撑的重点:具身世界模型与全链路无本体数据。

具身世界动作模型决定 Noe-0 如何在行动中理解世界变化;全链路无本体数据决定模型能够接触多广的任务与环境分布;RoboPocket 与 DM3 则让这些真实世界经验能够规模化生产、治理并进入预训练和后训练。它们最终服务于同一个目标:构建能够持续吸收真实世界经验的具身智能预训练模型。

在与穹彻的进一步交流中,一个更具体的问题被提了出来:当纯视觉的第一视角人手数据、腕部设备、触觉手套等无本体采集方案不断出现,为什么穹彻现阶段仍为 Noe-0 选择 RoboPocket 这一基于 UMI 思路发展出的变体,并保留二指形态?

穹彻并不把二指视为具身智能的最终形态。穹彻判断,随着硬件持续发展,机器人最终会走向更接近人手灵巧性的五指灵巧手;相应的数据采集,也可能更多由人手直接完成,或借助手套、腕部设备等形态记录人的自然操作。

但长期终局与当下的工程选择,是两个不同的问题。对于一套数据采集方案而言,概念被提出,并不等于已经能够工业级交付数据。它还需要在大规模分发后保持稳定、耐用和易用,让不同城市的数据采集人员都能顺利使用,并持续产出质量一致、能够进入训练的数据。

在穹彻看来,从这一标准出发,不同路线仍有各自需要继续解决的问题。纯视觉 Ego 数据在精细动作与接触信息上的准确性仍有提升空间;手套和腕部设备在长期可靠性、易用性、成本与规模化一致性上,也需要更多工程验证。这并不否定它们的长期价值,而是意味着当前的数据生产不能只由形态是否前沿来决定。

RoboPocket 作为 UMI 的一种变体,提供的是一种更适合现阶段的平衡。二指形态结构相对简单、成本更低,也更接近当前能够较快进入真实任务的机器人执行器。同时,这类方案在采集过程中将人的操作约束在二指可以执行的能力范围内,减少人类示范与目标机器人之间的动作差异,使产出的数据更容易被模型学习,也更直接地服务于二指机器人的任务能力。

超过 10 万小时的真实世界数据,也构成了一次对二指能力边界的大规模观察。通过分析二指形态在不同任务、物体和场景中的表现,穹彻穹彻认为,其能够覆盖的商业任务空间比通常想象的更广。在五指灵巧手的成熟度和成本继续改善的过程中,二指形态仍然拥有明确的应用空间。

因此,选择 RoboPocket 这一 UMI 变体,并不是对更灵巧终局的否定,而是一项围绕当前数据质量、工程成熟度、模型迭代效率和商业可行性作出的阶段性判断。如果采集工具本身尚不稳定,数据质量与设备运营就可能先成为瓶颈,模型研发也很难准确区分问题究竟来自数据还是模型。

决定这条路线能否持续演进的,并不是当下选择二指还是多指,而是能否建立一套可以持续扩展的研发体系:从真实世界数据采集、规模化数据治理,到模型预训练、后训练和真实任务验证。当这些能力建立起来,末端形态从二指走向多指,就不再意味着从头重建数据与模型体系,而是沿着已有基础自然延伸。

让数据产生于真实世界,让模型学习真实世界,再让能力回到真实世界,这是穹彻在这一链路上趟出的最宝贵的闭环。

05 参考

项目:Noe-0 Research Preview

穹彻:Noematrix Team|穹彻智能

技术博客:https://lab.noematrix.ai/blog/1-noe-0-research-preview/

重磅!

全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)

推荐阅读

真机强化入门的一套完整教程!pi*0.6复现方案

我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~

具身智能的WAM与世界模型一份完整指南~

一览具身智能的行业全局,从产品经理的角度出发!

VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~

好用,高性价比!面向具身科研领域打造的轻量级机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

从零训练你的足式机器人!让你的足式机器人真正动起来~

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐