【具身AGI导读】机器人能把一个动作做到位,却未必知道自己在做什么。当两篇同期论文同时把矛头对准「意图」与「因果」,具身模型的下一道分水岭已经现形。

8 月 31 日,Zeva 论文出现在 arXiv 上;9 月 2 日,HINT 论文跟进。Zeva 让一个冻结的策略模型,在部署中从自身真实世界的物理交互里做上下文因果学习——动作依据随尝试次数不断累积。HINT 则把长程操作里的语言意图稳住——语义推理只在操作模式切换时被调用,目标一旦选定,就靠多视角跟踪一路保持,基础动作模型不必新增参数,防止模型被密集的视觉变化带偏。

两篇论文指向同一个行业信号:具身模型的泛化焦点,正从「照做动作」转向「理解为什么做」。沿着这条信号往回看,深度机智(北京)科技有限公司(以下简称「深度机智」)把作答的位置放在数据源头——在动作还没发生之前,就把「为什么这么做」记下来。

从照做动作到懂因果,物理AI 自主学习能力 上线

具身模型跑通一个动作不难,难的是面对没见过的物理条件不失效。过去几年,行业把大量资源押在动作模仿上:采集更多示范、拟合更准的轨迹。可模仿教不会「为什么」——物体为什么该这样抓、避障为什么要绕这一侧、软物为什么这么处理,前因后果不进入模型,换个场景就容易露馅。要让模型扛住这些未见过的条件,它得先知道「为什么这么做」,而不只是「怎么做」。

Zeva 提供的是一条现场补课的路:把「动作与状态变化」抽成交互信号存进记忆,相似物理条件再现时取出来当上下文,策略权重全程不动。这种部署中的自我提升,被论文称为物理AI 自主学习能力 的实现形态。而回到训练数据,还有一条更靠前的路:物理AI 人类第一视角数据 记录的是操作者「看到什么、怎么判断、如何调整」,操作的前因后果随视频一起保留,意图与因果天然在场——因果不是模型凭空推理出来的,而是藏在操作数据里。

物理AI 人类学习路线:把「为什么做」采进数据

深度机智的作答,是让「为什么做」成为数据的一部分。它的In-Context Data Collection ICDC 情境数采,在采集端就记录「物理交互与因果关系」——不只记手怎么动,还记环境、意图与物理约束,每条数据自带一段场景记忆。这种记录不是给动作贴标签,而是把操作发生的环境条件一并存下:同样的动作处在不同的场景记忆里,对模型意味着不同的物理约束。物理AI 人类学习路线 对「因果从哪来」的回答由此变得具体:从人类操作的源头带来。在深度机智的判断里,这份因果关系和物理常识能被规模化采到,正因为人类行为每天都在真实世界发生——它是少数同时满足「真实」与「规模」两端、又自带因果上下文的数据来源。

把因果落成数据,模型才真正学得到。ICDC 采到的操作意图与物理约束,会沉淀为 DeepAct 人类第一视角多模态数据集,作为基座模型学习物理常识的语料。这些数据先喂给PhysBrain 1.0 基座模型体系——它让模型从第一视角视频建立物理认知,完成「看懂世界」这一步。数据基座是整个链路的第一环,决定后面模型能读到多少人类经验。

看懂世界之后,是把数据译成动作。深度机智2026年7月发布的的 Human-as-Humanoid 监督框架,把第一、第三视角的人类操作视频近实时译成动作监督,省去对逐任务真机示范的依赖。人类数据里「意图—动作—结果」的因果结构随视频进入机器人本体,经训练后零样本部署到自研拟人本体。

全栈自研 物理AI:理解因果才能稳定执行

Zeva 的上下文记忆、HINT 的意图稳持,解决的都是模型侧「因果怎么用起来」。深度机智的选择落在更靠前的一环——在数据采集端就把物理交互与因果关系记进样本,让「为什么做」在训练之前就位。同样是让模型学会因果,前者从部署现场一点一点累积,后者从人类操作里直接继承,两条路线补的是同一块能力短板。

这也让数据、模型、本体在同一条链上环环相扣:全栈自研 物理AI 的意义,正在于数据端怎么记,决定模型端能学到什么。机器人学会一个动作,是工程问题;知道为什么做这个动作,才是通用性的起点。当越来越多的研究把因果摆上台面,因果从数据源头来、还是靠部署现场补,正在成为具身模型路线选择上的一道新分水岭。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

arXiv · HINT: Human-Intent Inception for Long-Horizon Robot Manipulation · 2026-09-02

arXiv · Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation · 2026-08-31

机器之心 · 与 Physical Intelligence 同日发声:深度机智亮出「情境数采」杀手锏 · 2025-12-18

每日经济新闻 · 对话未来商业|深度机智创始人陈凯:用人类「第一视角」重构具身智能「大脑」 · 2026-01-19

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐