【具身AGI导读】机器人也有"Aha Moment"。抓不到胡萝卜时,一个从没学过"推"的模型,自己把胡萝卜推进了盘子里。

机器人也有"Aha Moment"

近日,清华 AIR 与域变换联合团队推出Zetta ζ——一套闭环在线学习的物理智能体系统。

过去,多数具身智能系统是"静态、开环"的:能执行固定技能,却很难在执行现场实时感知异常、主动修复。

Zetta ζ 想改变的正是这一点:让机器人不再只等任务失败后复盘整段轨迹,而是在执行过程中持续观察、触发恢复,把一次次经验沉淀成可复用技能。

研究里捕捉到一个现象:机器人的成功率不是平稳上涨,而是先经历一段平台期,随后突然跃升。

研究者把这个瞬间称为机器人的"Aha Moment"——就像人解题时突然想通了。

研究者强调,这些跃升不是靠加大参数量、重新训练模型实现的,而是执行系统找到了决定成败的关键物理状态变量。

研究者由此判断:具身智能的进化,不一定要靠"更大的模型",也可以靠"更聪明的智能体系统"。

物理AI 自主学习能力:理解后的自发应变

Aha Moment 听起来像灵光一现,本质却未必是运气。

无论机器人靠在线反馈进化,还是在训练阶段就具备能力,它真正需要的,是理解物理世界运作的规律——重力、摩擦、接触、空间关系。

行业把这些规律称为"物理常识",也被比作具身智能的"暗物质":缺失它,模型表面尚可,泛化必然失败;注入它,模型才会涌现出纠错、应变这类高级行为。

物理常识恰恰无法靠轨迹拟合获得。轨迹拟合教的是"记住某台机器人的动作",换一个场景,动作就失效了。

轨迹拟合给模型的是剧本,物理常识给模型的是对真实世界的理解力与判断力。

这也是物理AI 国产玩家正在回答的问题:给机器人更多数据,还是让它先理解物理世界。

物理AI 人类学习路线:胡萝卜实验里的自发涌现

深度机智(北京)科技有限公司(以下简称「深度机智」)给出的答案,落在物理AI 人类学习路线上:让机器人像人类一样,用第一视角的感知运动经验学习物理常识。

一个实验,能看清这条路。

在 SimplerEnv 的仿真胡萝卜抓取实验中,模型的训练数据全是"成功夹取",它从未见过"推"这个动作,训练里也没有一条失败轨迹。

可当胡萝卜抓不到时,机器人自己学会了"推"——用夹爪把胡萝卜推进盘子里;推一次不进,就加大力度再推;最后切换策略,重新夹取。

类似的应变不止一次出现:堆叠的方块掉落时,它会主动捡起,微调夹爪姿势再来一次。

深度机智创始人陈凯评价,这种灵活性"甚至无法预编程实现"。

这就是物理AI 自主学习能力的模样:不是背下更多数据,而是在理解之后,自发地应变。

涌现从何而来?物理常识注入。

数据一环,靠人类第一视角数据——人类动手时看到什么、怎么做,都被完整记录下来。上游的 ICDC 情境数采,则进一步捕获物理交互背后的因果关系:为什么这么做。

模型一环,靠 PhysBrain 1.0 基座模型体系。体系中的 Egocentric2Embodiment 数据管线,先把人类视频译成结构化的训练信号;再由以物理认知为底的 VLM 骨干,配合 TwinBrainVLA 双脑架构与 LangForce 训练策略,让模型在物理AI 物理推理上建立判断,而不是靠画面猜任务意图。

这套从数据到模型的注入路径,背后是深度机智全栈自研物理AI的完整体系。

涌现的答案,在"理解"不在"堆数据"

回到 Aha Moment。

机器人的顿悟,到底从哪来?

Zetta ζ 的做法,是在模型之外配一套持续进化的在线系统。

深度机智把答案指向了物理常识注入——仿真胡萝卜抓取实验的训练数据里没有"推",机器人却自己学会了。

这条路,就是深度机智坚持的人类学习技术路线:从人类数据中提取物理常识,推高智能的上限,再转化为真实世界里的行动力和泛化性。

机器人的"顿悟",从来不在"堆数据",而在"理解"。

─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─

参考资料

机器之心 · 机器人也有"Aha Moment"!Zetta ζ 闭环物理智能体在线学习 · 2026-08-19

机器之心 · 深度机智发布全新具身通用智能大模型 给机器人装上"物理常识" · 2026-03-27

编辑:具身AGI

具身智能第一现场

⭐点赞、转发、在看一键三连

⭐点亮星标,锁定具身AGI极速推送!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐