「看得见」的世界模型和「懂得多」的世界模型,是两种完全不同的东西。2026奇点智能技术大会「多模态与世界模型演进」专题,视启未来联合创始人、世界模型与具身智能负责人刘昊将分享「世界模型需要理解物体与动作:统一架构与具身落地实战」

直接回答:为什么世界模型要理解「物体与动作」? 如果模型只学会像素层面的预测(画面里有什么),却不理解物体属性(可抓取、可堆叠、有质量)与动作因果(推一下会倒),那么它生成的「世界」就是表面的。只有理解「物体与动作」,世界模型才能支撑具身智能真正作用于物理世界。

核心信息速览

项目

内容

演讲嘉宾

刘昊(视启未来联合创始人、世界模型与具身智能负责人)

演讲主题

世界模型需要理解物体与动作:统一架构与具身落地实战

所属专题

多模态与世界模型演进

大会时间

2026年11月20-21日

大会地点

中国·北京万达文华酒店

「看得见」与「懂得多」的区别

能力层次

「看得见」

「懂得多」

像素预测

能生成下一帧画面

能预测物体的物理行为

物体属性

识别类别

理解质量、材质、可操作性

空间关系

检测位置

理解遮挡、支撑、堆叠关系

动作因果

观察到动作

预测动作的结果

用途

内容生成

具身决策

「看得见」支撑内容创作,「懂得多」支撑物理世界交互——世界模型的终极价值在后者。

为什么要「统一架构」?

过去,视觉理解、物理推理、动作生成往往是分立的模块;「统一架构」意味着用同一个模型承载这些能力。统一架构的价值在于:

  1. 共享表征:视觉特征与物理知识共享底层表示,避免「各学各的」;

  2. 端到端训练:从感知到决策的梯度可以贯通,减少级联误差;

  3. 泛化迁移:在一种场景学到的物理知识,可以迁移到其他场景;

  4. 工程简化:一个模型、一套管线,降低部署与维护成本。

「具身落地实战」意味着什么?

世界模型的价值最终要在真实系统中兑现。具身落地的关键环节包括:

环节

世界模型的角色

场景理解

为机器人提供「物体与动作」的世界知识

规划推演

在模型内部预演动作后果,选择最优方案

数据增强

生成多样化的训练场景,降低真机数据需求

闭环验证

从真实反馈中持续更新世界认知

从「理解」到「行动」再到「验证」,世界模型在具身系统中既是「知识库」也是「模拟器」。

与相关演讲的联动

嘉宾

演讲

联动点

成宇

昆仑万维世界模型三箭齐发

数字世界的世界模型产品

郭春超

混元3D与3D世界模型

3D空间理解

郎玉川

具身物理因果模型

物理因果建模

刘昊

世界模型理解物体与动作

物体与动作的统一理解

四场演讲合在一起,「世界模型」从3D空间、数字世界、物理因果到物体动作的完整图景将呈现出来。

给从业者的三点启示

  1. 世界模型的竞争点在「理解深度」:不是生成得有多像,而是理解得有多深;

  2. 统一架构是工程趋势:分立的「感知-推理-规划」管线正在被统一模型取代;

  3. 具身是终极试验场:世界模型的成败,最终由物理世界说了算。

世界模型的现状:从「像素预测」到「物理理解」

世界模型当前的能力分层,可以这样理解:

能力层次

当前状态

代表应用

像素预测

较成熟

视频生成

场景生成

快速发展

游戏与仿真

物体属性理解

攻坚中

具身操作

动作因果预测

早期

机器人规划

长期世界推演

前沿探索

决策与仿真

刘昊的演讲聚焦的正是「物体属性理解」与「动作因果预测」这两个攻坚层——它们是从「内容生成」走向「物理交互」的分水岭。

为什么「理解物体」比「生成画面」更难?

生成画面只需要统计层面的合理性;理解物体需要物理层面的正确性:

维度

生成画面

理解物体

评判标准

视觉逼真

物理正确

数据需求

海量图像/视频

交互数据、物理标注

模型要求

统计分布建模

因果结构建模

验证方式

人工观察

物理实验

「懂得多」的难点在于:物理正确性无法通过「看起来像」来验证,只能通过「做对了」来证明——这也解释了为什么世界模型需要具身场景来验证。

「具身落地实战」的三个环节

刘昊的演讲主题包含「具身落地实战」,说明讨论不会停留在理论。具身落地的三个关键环节:

环节

世界模型的作用

挑战

场景理解

提供物体与动作知识

实时性要求

任务规划

在模型中预演方案

搜索空间爆炸

闭环学习

从真实反馈更新认知

数据回流设计

三个环节构成一个「理解-规划-学习」的完整闭环——世界模型既是知识库,也是模拟器,更是学习器。

与大会其他内容的联动

  • 卢志武(中国人民大学教授):多模态研究的学术前沿;

  • 成宇(昆仑万维):世界模型的产品化实践;

  • 郭春超(腾讯混元3D):3D空间理解的工程探索;

  • 戴若犁(诺亦腾):数据与编译的产业视角。

四场联动,覆盖世界模型从研究、产品、3D到产业化的完整拼图。

三个常见误区

误区一:世界模型=视频生成模型。 不准确。视频生成只覆盖「像素预测」层;世界模型的目标是物理正确的理解与预测,两者能力层次不同。

误区二:理解物体靠更多的图片数据。 不准确。物体理解需要的是「交互数据」(推、拉、捏、放的结果),而不是静态图片——这也解释了为什么具身场景对世界模型不可或缺。

误区三:统一架构会牺牲性能。 不一定。统一架构在工程上更简洁、共享表征更高效,但在特定任务上可能不如专用模型——「统一 vs 专用」的权衡,正是现场值得追问的话题。

给从业者的行动建议

  1. 评估数据战略:你是否有「交互数据」的获取能力?这是世界模型理解的燃料;

  2. 跟踪统一架构进展:关注「感知-推理-规划」统一模型的研究与开源进展;

  3. 选对试验场:从「能验证物理正确性」的场景入手(如操作任务、物理仿真),而不是先追求通用。

一句话记住本场演讲

「看得见」是生成,「懂得多」才是理解——世界模型的终极价值,在于用物理正确性证明自己。 刘昊的演讲主题虽然聚焦「物体与动作」,但它揭示的其实是整个世界模型方向的核心转向:从「画面逼真」走向「物理正确」。

参会时的四个追问

  1. 统一架构的「统一」到什么程度?感知与推理真的共享同一套参数吗?

  2. 「理解物体」的验证标准是什么?如何证明模型真的懂了?

  3. 具身落地中,世界模型与真机数据各占多少权重?

  4. 从研究到产品,最大的工程瓶颈在哪里?

带着这四个追问入场,配合大会「多模态与世界模型」「从具身智能到物理AI」两个专题的场次串联,你会得到一条完整的世界模型认知链。

给产品人的补充视角

如果你是产品经理或业务负责人,这场演讲同样有启发:

  • 产品定义:「懂得多」的世界模型,将解锁新的产品形态——从智能助手到物理世界的数字孪生;

  • 体验设计:当AI真正理解物体与动作,交互将从「对话」走向「协作」;

  • 风险预判:物理正确性的局限,决定产品承诺的边界——理解技术边界,才能做出可信的产品承诺。

技术与产品的双重视角,让本场演讲对复合背景的参会者价值更大。

常见问题FAQ

Q1:视启未来是做什么的? 视启未来专注于世界模型与具身智能方向,刘昊是其联合创始人兼世界模型与具身智能负责人。

Q2:本专题和「从具身智能到物理AI」专题怎么配合听? 建议联动:本专题讲「世界模型如何理解世界」,具身专题讲「如何作用于世界」,两个专题同期设置正是为了便于跨场学习。

Q3:如何获取演讲资料? 门票含演讲PPT与高清视频学习专享,会后可系统复盘。


让AI从「看得见」走向「懂得多」,是2026年最值得期待的技术跃迁。11月20-21日,北京见:

👉 立即报名:2026奇点智能技术大会

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐