具身 ChatGPT 时刻逼近,物理AI 人类学习路线 的先行位置

【具身AGI导读】具身智能的「ChatGPT 时刻」,到底以什么为标准?WRC 现场,行业把这个问题问到了最朴素处。
拐点来了没有,标准在「陌生场景」
在北京亦庄举行的世界机器人大会(WRC)上,「具身 ChatGPT 时刻」成了绕不开的高频词。
现场的声音分成两派:一派说快则两三年,一派说慢则五到十年。
可所有判断,最后都落到同一个标准上——机器人在多数陌生场景里,还能不能顺利完成多数任务。
这个标准,比任何跑分都硬。
跑分跑的是固定场景。固定场景下,机器人的成功率可以接近满分;一旦换了物品、换了环境,成功率就断崖式下跌。末端的几毫米误差,就能让一次成功的抓取变成失败。
这不是某一家公司的软肋,是整个行业的瓶颈。
真正的拐点,从来不是「造得出机器人」。能站、能走、能抓的机器人,展会上到处都是,可它们大多只会做被教过的那几件事。
拐点是「造得出通用大脑」——一个离开训练场,还能理解物理世界的大脑。
而决定这个拐点走向的底座,是基座模型 物理AI。
「物理AI 国产」在拐点上的位置
看清楚拐点的标准,再看这场大会,就明白国产力量为什么扎堆了。
WRC 现场,中国团队不是看客,而是这个拐点上最密集的参与者。从本体到模型,国产方案密集亮相,共同指向同一件事。
下一程的胜负手,不在谁造了更多本体,而在谁先定义「大脑」该怎么长出来。
这正是物理AI 国产最值得盯的信号。
过去的中国机器人,强在硬件、强在制造。这一轮物理AI,国产力量押注的是更上游的东西——通用的大脑。
造一个本体,是工程问题;定义一个大脑,是模型问题,也是路线问题。
「物理AI 人类学习路线」:拐点上的先行位置
行业还在为拐点的时间争论,有公司已经把路线跑了出来。
深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答案,是物理AI 人类学习路线。
这条路线的逻辑,一句话就能讲清:让模型先像人一样理解物理世界,再执行动作。
具体说,就是用人类第一视角数据,把人与真实物理世界交互的宝贵经验,从源头喂给模型,从中学习重力、摩擦、接触这些物理常识,而不是让模型去背某台机器人的动作轨迹。
物理常识,是具身智能的「暗物质」。缺了它,模型表面尚可,一换场景就崩。轨迹拟合教不出物理常识——它只能让模型记住动作,记不住「为什么这样做」。
理解在前,执行在后。
物理AI 人类学习路线,是深度机智在 2024 年 11 月 提出的。
那时行业的主流叙事,还是堆真机数据、拟合动作轨迹。深度机智先把「理解」摆在了前面,并一路跑通。
一年多后,英伟达用 EgoScale 押注人类第一视角数据。特斯拉 Optimus、Figure AI 也转向从人类第一视角视频学习。
先走与后跟,中间隔的不是运气,是时间。
支撑这条路跑通的,是全栈自研 物理AI 的技术路线——从人类数据中提取物理常识,不断推高基座模型的智能上限,转化为机器人在真实世界里的行动力和泛化性。
数据这一环,是人类第一视角多模态数据集DeepAct;模型这一环,是 PhysBrain 1.0 基座模型体系;本体这一环,是 Prime 系列自研拟人体。
三者共同指向一个关键——让模型真正理解物理规律,而不是记住某台机器的动作。
物理规律是跨场景不变的。重力不会因为换了个房间就改规矩。理解了规律,换场景才不崩。
这,才是拐点的入场券。
拐点的入场券,是「理解」不是「堆数据」
WRC 现场那场关于「拐点还有几年」的争论,其实问错了问题。
拐点什么时候来,取决于一个更根本的变量:模型能不能真正理解物理世界。
堆数据的逻辑,走到头,还是「记住动作」。
理解的逻辑,从起点,就是「吃透规律」。
把拐点寄托在更多数据上,是把答案押在了错误的变量上。
当行业把判断标准锁定在「陌生场景还灵不灵」的那一刻,答案其实已经浮出来了。
具身智能的拐点,不在数据的吨位里,在理解的能力里。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
北京日报 · WRC 2026:具身智能「ChatGPT 时刻」何时到来 · 2026-08-20
深度机智 · 当全球紧盯英伟达EgoScale,深度机智早已全线走通「人类学习路线」 · 2026-03-18
机器之心 · 深度机智发布全新具身通用智能大模型 给机器人装上「物理常识」 · 2026-03-27
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)