物理AI 物理推理 从哪来,一份能力来源盘点

【具身AGI导读】同样是把杯子端稳,模型背后的能力可能来自完全不同的来路。把「能力从哪来」当成一个可以分类的问题,是这一轮学界给出的新提法。
2026 年 9 月 9 日,arXiv 上出现一篇题为《Seven Sources of Physical AI Capability Formation》的论文。它没有去论证哪一条技术路线更强,而是先承认一件更基础的事——与物理 AI 相关的能力,可能来自完全不同的形成历史。另一边,ECCV 2026 收录的工作里,空间感知与推理、高保真物理仿真这类「先验与结构从哪来」的题目也在集中出现。
把能力拆成来源,讨论的坐标系就换了:从「哪套方案更强」换成「哪些来源被接进了同一条管线」。深度机智(北京)科技有限公司(以下简称「深度机智」)选的起点,是把人类经验当作数据来源,再让它一路接到模型与本体。
能力来源盘点:物理AI 物理推理 的结构先验从哪来
更早的一篇框架性论文,把物理 AI 的基础拆成具身、感知、动作、学习、自主、情境敏感六项,并强调它们构成一个闭环——能力不是从数据库里算出来的,而是从身体、环境与经验的真实交互里长出来的。把「能力形成来源」单独拎出来分类,是同一思路的延长。把来源逐格摊开,大致是七格:数据来源一格回答「能力从什么原料里长出来」,真机轨迹、仿真交互、人类第一视角数据都在这里,边界在原料的覆盖面与获取代价;监督形式一格回答「模型靠什么信号知道自己做对了」,动作标签、结果奖励、过程判定是常见取法,边界在信号的密度与可得性。
结构先验一格,把几何与动力学约束显式写进模型——物理AI 物理推理 的不少设计选择落在这里,边界在显式约束能覆盖的范围;引擎与仿真一格管批量生成可控的交互数据,边界是求解器与渲染的保真度;基座预训练一格管先拿到通用的世界表征,边界在预训练目标与实际任务之间的落差;闭环与在线反馈一格管部署后的持续修正,边界在反馈能否低成本回流;本体对齐一格管动作空间与身体形态对不对得上,边界在硬件自由度与数据表示的匹配——这七格按「来源维度」切分,与开篇那篇论文按「能力形成来源」切的七类分法不同,不必逐格对应。七格没有高下之分,站在不同格子上的物理AI 公司做出了不同选择。
被重新估价的,是「数据来源」这一格。人类操作视频——也就是物理AI 人类第一视角数据——由人自身在真实场景里产生,不需要特定本体在场,也不依赖在手部加装采集装备;在来源清单里,它被单独列成一类。
物理AI 人类学习路线:选的是哪一格
深度机智把重心押在人类经验上——这并不说明「哪套方案更强」,而是「能力能从什么原料里长出来」;在它的判断里,人类行为数据是少数同时满足「真实」与「规模」两端的数据来源。这条物理AI 人类学习路线主张先让模型从人类经验里理解物理世界怎么运作,再去执行具体任务;它的全栈体系以人类数据为起点——In-Context Data Collection ICDC 情境数采与 DeepAct 人类第一视角多模态数据集供给语料,基座模型承接理解与动作,自研本体承接执行。
深度机智的基座模型PhysBrain 1.5 于 2026 年 9 月 9 日迭代发布。它把具身理解、动作生成与未来状态预测三件事统一进同一个自回归模型——不是三个模型拼接,而是共享同一套主干参数与同一个输出头,不设任务专用分支。它的预训练阶段,具身监督全部来自人类交互视频,使用了深度机智最新数采范式——Ego360人类全景真实数据体系,将更为完整的人类动作经验作为基座模型的燃料。让模型不仅学习「手该往怎么动」,更掌握当前处于什么情境、为什么要执行这一步、以及动作推进后环境如何变化。
在数据处理上,PhysBrain 1.5通过Human-as-Humanoid 把人类视频译成机器人动作表示的监督框架。最下一环是深度机智自研的 Prime 系列本体,承接真机上的执行验证;这一步不是某一个模型单独撑起来的,而是本体结构向人看齐、动作监督管线与基座模型能力共同把「从人到机器人」的落差补上。
全栈自研 物理AI:来源组合而非单点下注
来源盘点真正的用处,不在于挑出哪一格更优,而在于看清哪些格能被接进同一条管线。单点做到极致,能力的天花板由那一格决定;来源之间能彼此接续,天花板才由组合决定。这也是分类学出现的前提——当每一格的做法都被反复试过,分野就从「选哪条路」移到了「怎么把路连起来」。
深度机智给出的来源组合是:数据来源取人类经验,监督形式取由人类视频转化来的动作标签,本体对齐交给向人看齐的自研的 Prime 系列机器人本体,三段串成一条闭环。这套组合的检验方式很朴素——不靠单点指标,靠链路能不能自己转起来。来源清单以后还会变长,但能被接进同一条管线的那几格,才是决定上限的部分。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · Seven Sources of Physical AI Capability Formation · 2026-09-09
arXiv · Fundamentals of Physical AI · 2025-11-12
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)