89.4% 到 12%!机器人走出实验室,Physical AI 的真正难题才开始
机器人越来越多,但“真正理解世界”依然很难。
在模拟环境里,机器人已经很强了。Stanford 2026 AI Index 给出了一组非常扎眼的数据:在 RLBench 这类软件仿真机器人操作任务中,当前系统成功率已经达到 89.4%。但一旦把机器人放进真实家庭环境,任务成功率只剩下 12%。

这可能比任何一段机器人 Demo,都更能解释今天具身智能真正面对的问题。
真实世界里,一个透明玻璃杯、一个软塑料袋、一次没有见过的遮挡,都可能让模型此前学到的“经验”失效。数字世界里的 AI 已经可以写代码、画图、推理甚至操作电脑,但当 AI 真正拥有身体,问题突然变难了。
这也是为什么 2026 年,越来越多人开始把讨论从 Embodied AI 推向一个更大的概念——Physical AI。
Physical AI 试图解决的是一个更大的问题:如何让 AI 真正理解物体、动作、空间与物理因果,并通过身体持续地影响、适应甚至学习真实世界。
这也是 Stanford 2026 AI Index 对 Physical AI 的判断:当前 VLA 模型正在尝试把视觉、语言和动作统一起来,但这一技术仍处在研究阶段,受控环境与现实世界之间仍存在明显鸿沟。
问题到底卡在哪里?
11 月 20—21 日,2026 奇点智能技术大会「从具身智能到物理 AI」专题,希望把这个问题拆开来讨论。届时,京东集团副总裁、京东探索研究院副院长段楠、北京邮电大学“拔尖人才”教授方斌、诺亦腾机器人创始人、CEO 戴若犁、视启未来联合创始人、世界模型与具身智能负责人刘昊、昆仑行机器人具身算法负责人郎玉川、观行数智创始人&CEO 唐都钰、AIRS 具身智能中心研究工程师邵鹏韬等来自基础模型、机器人、世界模型与产业一线的研究者和实践者,将从不同技术路径回答这些问题。


从数字 AI 到物理 AI,真正跨越的是什么?
京东集团副总裁、京东探索研究院副院长段楠将带来《从数字 AI 到物理 AI》主题分享。这是整个专题最适合放在开篇的问题。
过去十年 AI 最成功的地方,本质上都在数字世界:文字、图片、代码、视频。但物理世界没有“撤销键”。机器人一次错误抓取可能损坏产品,一次判断失误可能造成真实安全风险,它不仅要预测“下一个 Token”,还要预测一个动作会让现实世界发生什么变化。
所以,从 Digital AI 到 Physical AI,并不是简单给大模型装上手和脚,而是 AI 的认知对象从互联网数据变成了连续、动态、带物理约束的真实世界。
机器人最缺的,可能不是模型,而是数据飞轮?
Physical AI 的另一个巨大难题,是数据。LLM 可以学习数万亿 Token,机器人没有这样的互联网。
Stanford 2026 Emerging Technology Review 指出,机器人训练需要视觉、触觉、精确运动以及真实物理交互等专门数据,而获取这些数据既昂贵又耗时。相比语言模型动辄数万亿 Token,目前机器人数据集普遍也只有百万量级 episode。
这也是北京邮电大学“拔尖人才”教授方斌《面向灵巧操作“本体—数据—模型”迭代的飞轮效应思考》要解决的问题。
真正的机器人能力很难只靠模型单点突破。更好的本体产生更高质量的真实交互数据,数据反哺操作模型,更好的模型进入更多场景,又继续产生新数据。
本体—数据—模型,必须真正转成一个飞轮。
来自诺亦腾机器人创始人、CEO 戴若犁则把问题进一步推进到了数据基础设施层面。他将在大会现场分享《从数据工厂到世界编译器》的主题内容。
如果说 LLM 的训练数据来自“互联网”,那么机器人需要的,其实是一套把真实世界翻译成机器可学习数据的基础设施。
人的动作、物体接触、姿态、力、环境反馈……这些连续的物理信号,如何被规模化采集、同步、结构化,再转化为机器人能够真正学习的“语言”?
这可能会成为 Physical AI 时代一种全新的基础设施。
世界模型会生成视频,不代表它真的懂世界
数据之外,还有一个更加基础的问题:AI 究竟有没有理解自己所在的世界?
视启未来联合创始人、世界模型与具身智能负责人刘昊将在现场分享《世界模型需要理解物体与动作:统一架构与具身落地实战》
他的核心判断很直接:物理规律最终作用在物体上,而因果交互来自动作。
所以,一个真正服务于机器人的世界模型,不能只会预测下一帧视频,而必须先知道:
-
这里有什么物体?
-
它们之间是什么关系?
-
我做这个动作以后,会发生什么?
-
否则,画面生成得再逼真,也可能只是一个“物理幻觉”。
这场分享还会结合 DINO-X 以及泛化抓取实践,把世界模型从“视频生成”真正拉回到机器人行动。
当 AI 开始行动,“因果”会变得比“预测”更重要
昆仑行机器人具身算法负责人、前理想汽车资深算法专家郎玉川的议题是《当 AI 走进物理世界:具身物理因果模型和机器人 Agent》这其实指向 Physical AI 一个非常关键的变化:
-
传统大模型大量解决的是“相关性”。
-
Physical AI 必须面对“因果性”。
机器人不能只知道“这个动作过去经常和某个结果一起出现”,而是需要逐渐理解:
-
为什么推它会移动?
-
为什么抓的位置不同会掉下来?
-
为什么在这个状态下应该停止?
当模型开始真正影响物理世界,预测什么会发生和理解为什么会发生之间的差别,会越来越重要。
Physical AI 的终点,也许不是“更像人”,而是更主动的智能
观行数智创始人兼 CEO 唐都钰将从另一个角度讨论《主动式物理 AI:从数字世界到物理世界的智能范式迁移》。
AIRS 具身智能中心研究工程师邵鹏韬则长期关注上下文在线学习,以及世界模型、长时记忆和多智能体在线协同。
这让整个专题最终回到一个更大的问题:未来机器人是不是只需要等着人给一句指令,然后执行?
还是它需要像真正的智能体一样,持续观察环境、形成记忆、主动规划、与其他智能体协同,并在现实反馈中不断调整行为?
如果是后者,那么所谓 Physical AI,本质上就不只是“机器人 + 大模型”。
而是一套真正能在物理世界里感知、理解、推理、行动,并持续学习的智能系统。
从具身智能到 Physical AI,真正缺的不是下一个 Demo
机器人产业并不缺令人惊艳的视频。
缺的是回答这些问题:
-
为什么仿真 89.4%,到了真实家庭只剩 12%?
-
本体、数据和模型怎么形成真正的飞轮?
-
世界模型怎样从“会生成”变成“懂物体、懂动作”?
-
机器人如何获得足够多、足够真实的物理世界数据?
-
Agent 又该如何从数字空间真正走进现实世界?
如果你正在做具身智能、世界模型、VLA、机器人 Agent,或者正在判断 Physical AI 下一阶段究竟应该把资源投向模型、数据、本体还是系统工程,这可能比再看十个 Demo 更重要。
11 月 20—21 日,北京万达文华酒店,从数字 AI 到物理 AI,我们现场继续讨论。

不只讨论 Physical AI,我们更想把 AI 落地的真问题带到现场
除了「从具身智能到物理 AI」专题,大会还将围绕大模型与 Agent 自进化、AI 原生软件研发、智能体、AI Infra、多模态与世界模型、企业级 AI 应用与行业落地等方向展开讨论。
现场将汇聚 70+ 一线技术专家、18 大前沿专题、1000+ 行业技术人。包括 OpenAI 资深研究科学家、Transformer 共同发明人 Łukasz Kaiser,以及来自腾讯、百度、京东、网易、昆仑万维、上海人工智能实验室和开源社区的一线研究者与工程实践者。

我们希望这场大会解决的是:
-
Agent 怎么真正进入生产?AI Coding 怎么从个人提效走向研发体系?Infra 怎么接住越来越复杂的智能体?世界模型怎样理解真实世界?机器人又如何跨过 Reality Gap?
如果你正在一线做 AI、带研发团队,或者正在判断下一阶段该把资源投向哪里,我们更希望你两天之后带走的,不只是几页 PPT,而是:
-
哪些方向真的在落地,哪些问题仍然没有答案,哪些坑别人已经踩过,以及自己的团队下一步应该先补模型、数据、Infra,还是工程体系。
与此同时,2026 C++及系统软件技术大会也将与奇点智能技术大会同期举行。
从上层 AI 应用,到 C++、编译器、算力、高性能系统这些底层基础设施,两场大会放在同一个现场,一起看技术如何真正走向生产。
11 月 20—21 日,北京万达文华酒店。
如果你也在寻找 AI 下一阶段真正值得投入的方向,欢迎来到 2026 奇点智能技术大会现场,我们一起把问题聊透。
扫码下方二维码
「 领取 2026 奇点智能技术大会全套 PPT 资料」

官方网站:www.ml-summit.org
购票热线:400-821-5876
购票咨询:service@boolan.com
企业合作:partner@boolan.com
演讲申请:hemiao@csdn.net
媒体联系:media@boolan.com
报名参会👉wx:WayneBoolan
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)