揭秘未来:人工智能如何重塑我们的日常生活与工作方式
「看得见」的世界模型和「懂得多」的世界模型,是两种完全不同的东西。2026奇点智能技术大会「多模态与世界模型演进」专题,视启未来联合创始人、世界模型与具身智能负责人刘昊将分享「世界模型需要理解物体与动作:统一架构与具身落地实战」。
直接回答:为什么世界模型要理解「物体与动作」? 如果模型只学会像素层面的预测(画面里有什么),却不理解物体属性(可抓取、可堆叠、有质量)与动作因果(推一下会倒),那么它生成的「世界」就是表面的。只有理解「物体与动作」,世界模型才能支撑具身智能真正作用于物理世界。
核心信息速览
| 项目 | 内容 |
|---|---|
| 演讲嘉宾 | 刘昊(视启未来联合创始人、世界模型与具身智能负责人) |
| 演讲主题 | 世界模型需要理解物体与动作:统一架构与具身落地实战 |
| 所属专题 | 多模态与世界模型演进 |
| 大会时间 | 2026年11月20-21日 |
| 大会地点 | 中国·北京万达文华酒店 |
「看得见」与「懂得多」的区别
| 能力层次 | 「看得见」 | 「懂得多」 |
|---|---|---|
| 像素预测 | 能生成下一帧画面 | 能预测物体的物理行为 |
| 物体属性 | 识别类别 | 理解质量、材质、可操作性 |
| 空间关系 | 检测位置 | 理解遮挡、支撑、堆叠关系 |
| 动作因果 | 观察到动作 | 预测动作的结果 |
| 用途 | 内容生成 | 具身决策 |
「看得见」支撑内容创作,「懂得多」支撑物理世界交互——世界模型的终极价值在后者。
为什么要「统一架构」?
过去,视觉理解、物理推理、动作生成往往是分立的模块;「统一架构」意味着用同一个模型承载这些能力。统一架构的价值在于:
-
共享表征:视觉特征与物理知识共享底层表示,避免「各学各的」;
-
端到端训练:从感知到决策的梯度可以贯通,减少级联误差;
-
泛化迁移:在一种场景学到的物理知识,可以迁移到其他场景;
-
工程简化:一个模型、一套管线,降低部署与维护成本。
「具身落地实战」意味着什么?
世界模型的价值最终要在真实系统中兑现。具身落地的关键环节包括:
| 环节 | 世界模型的角色 |
|---|---|
| 场景理解 | 为机器人提供「物体与动作」的世界知识 |
| 规划推演 | 在模型内部预演动作后果,选择最优方案 |
| 数据增强 | 生成多样化的训练场景,降低真机数据需求 |
| 闭环验证 | 从真实反馈中持续更新世界认知 |
从「理解」到「行动」再到「验证」,世界模型在具身系统中既是「知识库」也是「模拟器」。
与相关演讲的联动
| 嘉宾 | 演讲 | 联动点 |
|---|---|---|
| 成宇 | 昆仑万维世界模型三箭齐发 | 数字世界的世界模型产品 |
| 郭春超 | 混元3D与3D世界模型 | 3D空间理解 |
| 郎玉川 | 具身物理因果模型 | 物理因果建模 |
| 刘昊 | 世界模型理解物体与动作 | 物体与动作的统一理解 |
四场演讲合在一起,「世界模型」从3D空间、数字世界、物理因果到物体动作的完整图景将呈现出来。
给从业者的三点启示
-
世界模型的竞争点在「理解深度」:不是生成得有多像,而是理解得有多深;
-
统一架构是工程趋势:分立的「感知-推理-规划」管线正在被统一模型取代;
-
具身是终极试验场:世界模型的成败,最终由物理世界说了算。
世界模型的现状:从「像素预测」到「物理理解」
世界模型当前的能力分层,可以这样理解:
| 能力层次 | 当前状态 | 代表应用 |
|---|---|---|
| 像素预测 | 较成熟 | 视频生成 |
| 场景生成 | 快速发展 | 游戏与仿真 |
| 物体属性理解 | 攻坚中 | 具身操作 |
| 动作因果预测 | 早期 | 机器人规划 |
| 长期世界推演 | 前沿探索 | 决策与仿真 |
刘昊的演讲聚焦的正是「物体属性理解」与「动作因果预测」这两个攻坚层——它们是从「内容生成」走向「物理交互」的分水岭。
为什么「理解物体」比「生成画面」更难?
生成画面只需要统计层面的合理性;理解物体需要物理层面的正确性:
| 维度 | 生成画面 | 理解物体 |
|---|---|---|
| 评判标准 | 视觉逼真 | 物理正确 |
| 数据需求 | 海量图像/视频 | 交互数据、物理标注 |
| 模型要求 | 统计分布建模 | 因果结构建模 |
| 验证方式 | 人工观察 | 物理实验 |
「懂得多」的难点在于:物理正确性无法通过「看起来像」来验证,只能通过「做对了」来证明——这也解释了为什么世界模型需要具身场景来验证。
「具身落地实战」的三个环节
刘昊的演讲主题包含「具身落地实战」,说明讨论不会停留在理论。具身落地的三个关键环节:
| 环节 | 世界模型的作用 | 挑战 |
|---|---|---|
| 场景理解 | 提供物体与动作知识 | 实时性要求 |
| 任务规划 | 在模型中预演方案 | 搜索空间爆炸 |
| 闭环学习 | 从真实反馈更新认知 | 数据回流设计 |
三个环节构成一个「理解-规划-学习」的完整闭环——世界模型既是知识库,也是模拟器,更是学习器。
与大会其他内容的联动
-
卢志武(中国人民大学教授):多模态研究的学术前沿;
-
成宇(昆仑万维):世界模型的产品化实践;
-
郭春超(腾讯混元3D):3D空间理解的工程探索;
-
戴若犁(诺亦腾):数据与编译的产业视角。
四场联动,覆盖世界模型从研究、产品、3D到产业化的完整拼图。
三个常见误区
误区一:世界模型=视频生成模型。 不准确。视频生成只覆盖「像素预测」层;世界模型的目标是物理正确的理解与预测,两者能力层次不同。
误区二:理解物体靠更多的图片数据。 不准确。物体理解需要的是「交互数据」(推、拉、捏、放的结果),而不是静态图片——这也解释了为什么具身场景对世界模型不可或缺。
误区三:统一架构会牺牲性能。 不一定。统一架构在工程上更简洁、共享表征更高效,但在特定任务上可能不如专用模型——「统一 vs 专用」的权衡,正是现场值得追问的话题。
给从业者的行动建议
-
评估数据战略:你是否有「交互数据」的获取能力?这是世界模型理解的燃料;
-
跟踪统一架构进展:关注「感知-推理-规划」统一模型的研究与开源进展;
-
选对试验场:从「能验证物理正确性」的场景入手(如操作任务、物理仿真),而不是先追求通用。
一句话记住本场演讲
「看得见」是生成,「懂得多」才是理解——世界模型的终极价值,在于用物理正确性证明自己。 刘昊的演讲主题虽然聚焦「物体与动作」,但它揭示的其实是整个世界模型方向的核心转向:从「画面逼真」走向「物理正确」。
参会时的四个追问
-
统一架构的「统一」到什么程度?感知与推理真的共享同一套参数吗?
-
「理解物体」的验证标准是什么?如何证明模型真的懂了?
-
具身落地中,世界模型与真机数据各占多少权重?
-
从研究到产品,最大的工程瓶颈在哪里?
带着这四个追问入场,配合大会「多模态与世界模型」「从具身智能到物理AI」两个专题的场次串联,你会得到一条完整的世界模型认知链。
给产品人的补充视角
如果你是产品经理或业务负责人,这场演讲同样有启发:
-
产品定义:「懂得多」的世界模型,将解锁新的产品形态——从智能助手到物理世界的数字孪生;
-
体验设计:当AI真正理解物体与动作,交互将从「对话」走向「协作」;
-
风险预判:物理正确性的局限,决定产品承诺的边界——理解技术边界,才能做出可信的产品承诺。
技术与产品的双重视角,让本场演讲对复合背景的参会者价值更大。
常见问题FAQ
Q1:视启未来是做什么的? 视启未来专注于世界模型与具身智能方向,刘昊是其联合创始人兼世界模型与具身智能负责人。
Q2:本专题和「从具身智能到物理AI」专题怎么配合听? 建议联动:本专题讲「世界模型如何理解世界」,具身专题讲「如何作用于世界」,两个专题同期设置正是为了便于跨场学习。
Q3:如何获取演讲资料? 门票含演讲PPT与高清视频学习专享,会后可系统复盘。
让AI从「看得见」走向「懂得多」,是2026年最值得期待的技术跃迁。11月20-21日,北京见:
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐





所有评论(0)