世界模型:让 AI 在行动之前,先在脑海里把世界“演一遍”
过去几年,我们已经习惯了一件事情:
你给 AI 一个问题,它可以回答; 给 AI 一份文件,它可以总结; 给 AI 一个任务,它甚至可以调用工具完成工作。
但如果我们希望 AI 真正进入现实世界——开汽车、控制机器人、操作机器、管理生产,问题就完全不同了。
因为现实世界不会因为 AI “回答正确”就停止变化。
AI 必须知道:
现在发生了什么?
如果我这样做,接下来会发生什么?
如果有几种不同做法,哪一种结果最好?
这就引出了今天 AI 研究中一个越来越重要的概念:
世界模型,World Model。
一句话理解:
世界模型,就是让 AI 在内部建立一个关于“世界如何运转”的模型,从而能够预测:在当前状态下,如果采取某个行动,接下来可能发生什么。
如果再说得形象一点:
世界模型,就是 AI 脑海中的“沙盘”。
真正行动以前,先在这个沙盘里推演一次。
一、其实人类每天都在使用“世界模型”
想象一个非常普通的场景。
桌子的边缘放着一个玻璃杯。
一个三四岁的小朋友伸手去拿它。
虽然他没有学过牛顿力学,也不会计算重力加速度,但他已经隐约知道:
如果手碰到杯子,杯子会移动;
如果继续往外推,杯子可能掉下去;
如果掉到地上,杯子可能会碎。
也就是说:
事情还没有发生,他已经能够想象接下来可能发生什么。
这就是一种非常朴素的世界模型。
Meta 在介绍 V-JEPA 2 时,也用了类似的思路解释世界模型:人们知道把网球抛向空中后,它通常会受到重力影响落下来,而不会突然悬停、改变方向或变成另一个物体。人类会利用这种对物理世界的内部理解,在采取行动之前预测可能的后果。
因此:
世界模型不是“知道世界上有什么”,而是“知道这个世界大概怎么运转”。
这是理解世界模型最重要的一步。
二、世界模型真正学习的是什么?
可以把世界模型简化成一个过程:
现在 → 行动 → 未来
例如:
现在: 杯子在桌边。
行动: 把杯子向外推。
未来: 杯子可能掉到地上。
再比如自动驾驶:
现在: 前面的汽车突然减速。
行动 A: 我保持当前速度。
预测结果: 距离快速缩短,碰撞风险上升。
行动 B: 我开始减速。
预测结果: 与前车保持安全距离。
所以,一个典型世界模型真正想学的,并不仅仅是“识别汽车”“识别杯子”。
它还希望理解:
物体在哪里;
它们处于什么状态;
世界如何随时间变化;
一个行动会怎样改变世界;
不同未来之间有什么差异。
2026 年一篇针对机器人学习的综合综述,将世界模型概括为对“环境在行动作用下如何演化”的预测性表征,并指出这种模型可以服务于规划、策略学习、模拟、评估和数据生成。研究界目前并没有一个所有人完全一致的狭义定义,因此更适合把“世界模型”理解为一类核心思想,而不是某一种固定神经网络架构。
三、所以世界模型最重要的不是“生成”,而是“推演”
很多人第一次看到 Genie、Sora 之类的演示,会认为:
世界模型是不是就是一个更厉害的视频生成模型?
不完全是。
视频生成只是其中一种可能的表现形式。
真正关键的是:
模型能不能建立一个具有时间连续性、状态变化和行动后果的内部世界。
它可以把这个未来直接“画出来”,生成一段视频;
也可以完全不生成视频,而是在一个人类看不见的数学表征空间中预测未来。
例如 MuZero 并不需要完整地重建未来画面,而是学习对规划最重要的奖励、价值和策略相关信息;它通过学习到的模型进行搜索和规划。
Meta 的 V-JEPA 2 也是类似思路:它把视频编码成抽象的 embedding,然后预测未来的 embedding,而不是必须逐像素重建未来画面。Meta 将其核心能力概括为三个层面:
Understanding——理解现在;
Predicting——预测未来;
Planning——规划行动。
所以,可以得到一个很重要的判断:
会生成逼真的未来,不等于真正理解未来。
一个模型可以生成一段看起来非常真实的视频,但里面的物理规律可能是错误的。
反过来,一个模型可能根本不生成漂亮的视频,却能够非常有效地预测“哪个行动更值得执行”。
从 AI 决策的角度来看,后者可能反而更加重要。
四、世界模型和大语言模型,到底有什么不同?
理解世界模型最容易的方法,就是把它和我们熟悉的大语言模型放在一起看。
传统大语言模型的基础训练目标,可以简单理解为:
根据前面的内容,预测接下来最可能出现的 token。
例如:
“今天乌云密布,看起来马上要……”
模型可能预测:
“下雨了。”
而世界模型更关心的是:
根据世界现在的状态以及采取的行动,预测世界之后可能变成什么状态。
例如:
机器人看到桌上的杯子。
世界模型需要考虑:
“如果机械臂向前移动 10 厘米,会发生什么?”
“如果夹爪在这个位置闭合,能不能抓住?”
“如果抓得太偏,杯子会不会滑下来?”
所以可以做一个非常简化的对比:
| 大语言模型世界模型 | ||
|---|---|---|
| 主要对象 | 语言、符号、多模态信息 | 环境状态及其变化 |
| 典型预测 | 接下来应该出现什么 token | 接下来世界可能怎样变化 |
| 重点 | 知识、语言、推理 | 状态、动态、行动后果 |
| 核心问题 | “接下来应该说什么?” | “如果这样做,会发生什么?” |
| 典型价值 | 沟通、知识处理、推理 | 预测、规划、控制、模拟 |
但这里一定要强调:
这不是一条绝对的分界线。
现代大语言模型和多模态模型本身也可能学习到大量关于世界的知识,甚至表现出某些规划和物理推理能力;世界模型也可能使用 Transformer、多模态模型等相同技术组件。
因此真正的差别不是:
“LLM 完全不理解世界,世界模型才理解世界。”
更准确的说法应该是:
世界模型把“环境如何变化,以及行动产生什么后果”作为核心建模对象。
五、为什么“预测未来”如此重要?
因为只有能够预测未来,AI 才真正有条件进行规划。
比如你准备开车。
前面有三个选择:
向左;
向右;
继续直行。
人类不会把三个选择全部真实执行一次再决定。
我们会在脑海里快速推演:
向左会怎样?
向右会怎样?
直行会怎样?
然后选择一个最合适的行动。
世界模型希望让 AI 获得类似能力:
不需要把每一次试错都发生在现实世界里,而是先在模型内部进行试错。
这正是 Dreamer 系列算法的重要思想。
Dreamer 会学习一个环境模型,然后在这个学习到的模型内部“想象”未来轨迹,并从这些想象出来的未来中学习策略。2025 年发表在《Nature》的 DreamerV3 工作报告称,该算法用统一配置在超过 150 个任务上进行了验证,其核心机制就是利用世界模型预测潜在行动的结果,再由 actor 和 critic 根据这些预测学习如何行动。
所以:
世界模型的真正价值,是把一部分现实世界的试错,搬到 AI 的内部世界。
六、世界模型是怎么工作的?
如果不讨论复杂数学,可以把一个世界模型想象成五个部分。
第一步:看见世界
首先把摄像头、视频、传感器、文字或其他信息输入系统。
例如:
“前面有一辆车。”
“距离大约在缩短。”
“旁边有行人。”
这叫做感知。
第二步:形成一个内部状态
现实世界的信息量太大。
AI 不一定需要记住每一个像素。
它需要提取:
哪些东西重要?
例如开车时,墙上的广告字体可能并不重要;
但车辆的位置、速度、道路结构和行人运动方向非常重要。
所以模型会形成一种压缩后的“世界状态”。
可以把它理解为:
AI 对当前世界形成的一幅内部地图。
第三步:学习世界变化的规律
接下来是世界模型最核心的一步:
如果现在是状态 A,我执行动作 X,下一刻更可能变成什么状态?
例如:
当前车速 60 km/h;
前车减速;
如果继续加速,会发生什么?
如果踩刹车,又会发生什么?
这部分通常被称为 dynamics 或 transition model,也就是环境动态或状态转移模型。
第四步:想象多个未来
有了这个能力,AI 就不必只预测一个未来。
它可以推演:
行动 A → 未来 A;
行动 B → 未来 B;
行动 C → 未来 C。
然后比较这些未来。
V-JEPA 2 在机器人规划实验中采用的思路就很直观:模型从当前状态出发,预测一组候选动作可能产生的结果,然后比较哪些结果更接近目标,再执行其中最好的下一步。
第五步:选择行动
于是整个系统形成一个循环:
观察 → 理解 → 预测 → 比较 → 行动 → 再观察
这就开始接近一个真正可以自主行动的智能体。
七、世界模型的发展,并不是突然出现的
“让机器学习环境模型再进行规划”并不是新思想,但过去几年随着深度学习、视频模型、Transformer、多模态学习和强化学习的发展,它获得了新的规模和表现形式。
几个重要节点可以帮助理解这条技术路线。
2018:World Models
David Ha 和 Jürgen Schmidhuber 的《World Models》成为现代深度学习世界模型研究中的标志性工作之一。
他们让 AI 学习一个压缩的环境表征和环境随时间变化的规律,然后甚至可以让智能体在模型自己生成的“梦境”里训练,再把学到的策略带回真实环境。
这一思想非常重要:
AI 不一定只能从真实世界学习,它还可以从自己学习出来的世界里学习。
2020:MuZero
DeepMind 的 MuZero 又向前走了一步。
AlphaZero 进行规划时知道游戏规则;MuZero 则学习一个与规划相关的环境模型,不需要预先给出完整的游戏动态规则。研究显示,它在围棋、国际象棋、日本将棋以及 Atari 环境中都能够利用学习到的模型进行规划。
它带来了一个很重要的思想:
世界模型不一定需要完美还原整个世界,只需要准确建模“对决策重要的部分”。
2023—2025:DreamerV3
Dreamer 把“在想象中学习”进一步系统化。
模型先学习世界如何变化,然后生成内部的 imagined trajectories,再让策略网络从这些想象轨迹中学习。
DreamerV3 后来发表于《Nature》,报告覆盖了超过 150 个任务。
2024:Genie 2 与 Sora
世界模型开始越来越明显地与大规模视频模型发生交汇。
Google DeepMind 的 Genie 2 被定位为 large-scale foundation world model,可以从输入图像产生可由人或 AI 控制的交互环境。
OpenAI 在 Sora 的技术报告中则提出,大规模视频生成模型可能是构建“通用物理世界模拟器”的一条有前景的路线,同时也明确展示了当时模型在物理一致性方面仍然存在明显局限。
这标志着另一条世界模型路线:
不只是预测一个抽象状态,而是尝试生成整个可观察世界。
2025:V-JEPA 2、Genie 3 与 Cosmos
2025 年,几条路线进一步成熟。
Meta 发布 V-JEPA 2,利用超过百万小时量级的视频进行预训练,然后通过少量机器人动作数据进行 action-conditioned 后训练,使模型可以用于预测和机器人规划。其特点是不要求把未来每一个像素都生成出来,而是在抽象表征空间进行预测。
Google DeepMind 的 Genie 3 则进一步走向实时、交互式世界生成。DeepMind 将它描述为可从文本生成实时交互环境的世界模型,并报告其可以以约 20–24 FPS 运行。
NVIDIA 则推出 Cosmos World Foundation Model 平台,把世界模型明确地与 Physical AI、机器人和自动驾驶联系起来,其思路是先提供一个通用 World Foundation Model,再针对具体物理 AI 场景进行后训练和定制。
2026:世界模型进入真实产业仿真
到 2026 年 2 月,Waymo 发布 Waymo World Model,用生成式世界模型进行自动驾驶仿真。
Waymo 表示,该系统基于 Genie 3 进行面向驾驶场景的适配,可以生成摄像头和 LiDAR 等多传感器输出,并通过驾驶动作、场景布局和语言指令控制模拟环境,用于构造一些现实中难以大量采集的长尾和安全关键场景。
这个案例特别有意义。
因为它展示了世界模型可能从:
“AI 研究中的想象环境”
逐渐走向:
“现实产业中的训练和验证环境”。
八、今天的世界模型,大致可以看成四条路线
如果把目前复杂的研究归纳一下,可以粗略分成四种思路。
第一类:隐空间世界模型
代表:
World Models、Dreamer。
模型把现实压缩成某种 latent representation,然后预测这些内部状态如何变化。
优点是:
不需要生成大量高分辨率像素,因此比较适合决策和强化学习。
核心思想:
不需要把整个世界画出来,只需要在脑中理解它如何变化。
第二类:面向规划的世界模型
代表:
MuZero。
它甚至不追求完整重建环境,而是学习与决策最相关的状态、奖励和价值信息。
核心思想:
不需要知道世界所有细节,只需要知道哪些变化会影响我的决定。
第三类:表征预测世界模型
代表:
JEPA、V-JEPA 2。
它不是重点预测未来每一个像素,而是预测未来更抽象、更有语义的信息。
核心思想:
预测“世界意味着什么”,而不是复制“世界每一个像素长什么样”。
第四类:生成式世界模型
代表:
Genie、Cosmos,以及面向类似方向的大规模视频模型研究。
模型尝试生成一个连续、可控制、甚至可以实时交互的环境。
核心思想:
把 AI 脑海中的世界直接“渲染出来”。
Genie 3 已经展示出实时交互式生成环境的能力,但 DeepMind 同时明确列出了现实地点精确还原、文字生成和长时间连续交互等局限,因此今天距离“一个稳定、完全遵循真实物理规律的通用世界模拟器”仍有明显距离。
九、世界模型和传统模拟器有什么区别?
这也是一个非常容易混淆的问题。
传统物理模拟器通常是:
人类先把规则写进去,然后计算结果。
例如工程师告诉系统:
重力是多少;
材料有什么参数;
物体碰撞遵循什么公式。
模型再根据这些规则计算。
而学习型世界模型更强调:
从大量观察和交互数据中,自己学习世界变化的规律。
所以两者可以简单理解为:
传统模拟器
人告诉机器规则 → 机器模拟世界。
世界模型
机器观察世界 → 学习规律 → 再模拟世界。
现实系统并不一定非要二选一。物理规则、传统数字孪生、数据驱动模型和生成式世界模型完全可能组成混合系统。
NVIDIA 在 Cosmos 的研究说明中就明确把 Physical AI 所需的数字化训练环境拆成“自身/策略模型的数字孪生”和“世界的数字孪生”,并把后者与 World Model 联系起来。
十、为什么 AI 公司现在越来越重视世界模型?
因为 AI 正在从一个:
Information AI
逐渐走向:
Action AI。
过去 AI 的主要工作对象是:
文字;
图片;
知识;
信息。
因此,“回答对”非常重要。
但是机器人、自动驾驶、Physical AI 处理的是:
现实世界。
现实世界有一个非常特殊的性质:
行动会产生后果。
一台机器人抓错一次东西,可能摔坏产品;
自动驾驶做错一次判断,风险可能远高于一句回答错误;
机器控制参数改变,也可能影响整个后续过程。
所以未来 AI 一个越来越重要的问题不再只是:
“正确答案是什么?”
而是:
“如果我这样做,会发生什么?”
而后一个问题,恰恰就是世界模型最擅长解决的方向。
十一、世界模型真正可能改变什么?
1. 机器人
机器人最大的挑战之一,并不是单纯“看到一个杯子”。
而是:
知道杯子在哪里;
知道自己的手在哪里;
知道怎样移动;
预测抓取之后会发生什么;
失败以后知道怎样调整。
V-JEPA 2 已经展示了利用学习到的世界模型进行机器人候选动作预测和零样本规划的研究实例。
2. 自动驾驶
现实道路存在大量极少出现、却非常重要的 long-tail scenarios。
真实世界不可能为了训练 AI,主动制造:
龙卷风;
车辆突然逆行;
特殊障碍物;
非常罕见的交通组合。
世界模型则可以提供另一种路径:
生成这些世界,让自动驾驶系统先在虚拟环境里经历它们。
Waymo 2026 年发布的 World Model 正在探索这样的方向。
3. AI Agent
今天很多 Agent 更像:
边做边判断。
更成熟的世界模型如果能够准确表示数字环境和行动后果,则可能让 Agent 更多地做到:
先推演几条执行路线,再采取行动。
这里需要注意,目前“通用世界模型 + 通用 Agent”的结合仍是快速发展的研究方向,尚不能把它描述为已经成熟解决的问题。
4. 游戏和虚拟世界
传统游戏世界通常需要:
美术;
建模;
物理系统;
关卡设计;
程序逻辑。
而 Genie 这类生成式世界模型展示了另一种可能:
描述一个世界,然后 AI 动态生成一个可以进入和互动的世界。
Genie 2 和 Genie 3 已经展示了从输入描述或视觉条件生成可交互环境的研究能力。
5. 工业与制造
工业领域可以用一个假设场景来理解它的长期价值。
假设未来有一个足够可靠的制造世界模型。
现在:
某批材料进入生产;
环境温湿度确定;
设备处于某种状态;
当前工艺参数为 A。
模型可以先推演:
参数 A → 质量、能耗、效率可能怎样变化?
参数 B → 又可能怎样变化?
参数 C → 后续工序是否会产生新的风险?
然后才决定:
现实世界真正执行哪一种参数。
这类应用目前是否能落地,取决于具体行业的数据质量、传感能力、物理约束、预测精度和安全验证,不能简单认为通用世界模型已经可以直接承担工业控制。
但它体现了一个非常重要的方向:
过去,我们在真实世界试错,然后把经验交给 AI。
未来,我们希望 AI 能先在模型世界里试错,再决定真实世界怎么做。
十二、世界模型距离真正“理解世界”,还有多远?
这里必须保持冷静。
今天的世界模型依然存在很多没有解决的问题。
第一,短期预测容易,长期预测困难
一次预测出现一点误差,下一次预测继续建立在这个误差之上。
时间越长,错误可能越积越多。
Waymo 在介绍其 World Model 时也指出,更长时间的 rollout 在计算成本和保持稳定质量方面更加困难。
第二,看起来真实,不代表物理上正确
AI 可以生成一段非常漂亮的视频。
但:
物体重量可能不对;
碰撞可能不对;
因果关系可能不对;
空间结构可能发生变化。
所以:
视觉真实 ≠ 世界理解。
Meta 在 2025 年发布的物理理解 benchmark 中也显示,即使包括 V-JEPA 2 在内的领先模型,与人在若干物理推理测试上的表现仍存在明显差距。
第三,世界不是只有一个未来
很多现实问题没有唯一答案。
一个人看到汽车靠近,可能停下;
也可能继续走;
也可能向后退。
因此真正好的世界模型不仅要预测:
“未来是什么?”
还要处理:
“未来有哪些可能,以及每一种可能有多大概率?”
这也是现实环境中的不确定性问题。
第四,相关性不等于因果
模型看到过:
A 后面经常出现 B,
并不意味着它真正理解:
A 为什么导致 B。
对于需要可靠干预和控制的系统而言,“预测准确”与“掌握可迁移的因果规律”并不是完全相同的问题。
第五,从视频理解世界,不等于真正拥有身体经验
人类理解:
重量;
阻力;
疼痛;
摩擦;
平衡;
惯性,
不仅来自视觉,也来自大量身体交互。
因此,从互联网视频学习出来的世界模型如何进一步获得可靠的 physical grounding,仍然是机器人和具身智能研究中的核心问题之一。2026 年的机器人世界模型综述仍将泛化、规划、模拟、评估和真实机器人应用列为持续快速发展的研究问题。
十三、理解世界模型,最重要的不是记住技术名词
如果只记住五句话,我建议记住下面五句。
第一句
大语言模型主要学习“信息之间有什么关系”,世界模型更强调“世界状态如何变化”。
第二句
世界模型,就是 AI 脑海里的沙盘。
第三句
它最关键的能力不是生成世界,而是推演世界。
第四句
智能真正重要的一步,不只是知道答案,而是知道行动之后会发生什么。
第五句
世界模型最大的想象空间,是让 AI 把一部分现实世界的试错,搬到模型世界里完成。
十四、从更大的视角看:为什么世界模型可能是 AI 下一阶段的重要方向?
过去十多年,AI 取得巨大突破的一个核心原因,是机器越来越擅长:
识别世界。
看到图片,知道这是一只猫;
看到文字,知道它是什么意思;
看到文件,可以总结里面的内容。
之后的大语言模型让 AI 又获得了一种非常重要的能力:
描述和推理世界。
但如果 AI 要真正成为可以在现实环境中长期工作的智能体,还缺少另外一种关键能力:
预测和影响世界。
所以可以把 AI 的发展非常简化地理解成:
Perception:看见世界
↓
Language & Reasoning:描述和思考世界
↓
World Model:预测世界
↓
Planning:规划行动
↓
Action:改变世界
这也解释了为什么世界模型会与机器人、自动驾驶、具身智能和 Physical AI 越来越紧密地联系在一起。Dreamer、V-JEPA 2、Genie、Cosmos 和 Waymo World Model 虽然采用不同技术路径,但都体现了同一个趋势:让 AI 不再只处理静态信息,而是学习一个会随着时间和行动变化的环境。
结语:从“回答世界”到“预演世界”
如果过去的大模型时代最典型的一句话是:
“你问我,我回答。”
那么世界模型时代更有代表性的一句话可能是:
“你先别做,让我先想想做了之后会怎样。”
真正高级的智能,并不是每一次都要到真实世界碰壁之后,才知道自己做错了。
而是能够:
理解现在;
想象未来;
比较不同未来;
最后再决定行动。
所以,如果一定要用一句话解释什么叫世界模型:
世界模型,就是让 AI 在改变世界之前,先在脑海里把世界“演一遍”。
而从更长期的角度看,它代表的是 AI 能力的一次重要转变:
从“会回答”,走向“会预测”; 从“会预测”,走向“会规划”; 从“会规划”,最终走向“会行动”。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)