世界模型到底解决了什么问题:从 JEPA 到 Genie 的路线梳理
标签:#世界模型 #JEPA #Genie #Dreamer #自监督学习 #具身智能
数据口径:本文事实与数据综合自 Ha & Schmidhuber 2018 年 World Models 论文、LeCun 2022 年立场论文、Meta V-JEPA 2 论文(arXiv:2506.09985)、Google DeepMind Genie 1/2/3 官方博客与论文、DreamerV3 论文(arXiv:2301.04104,Nature 2025)、NVIDIA Cosmos 技术报告(arXiv:2501.03575)等公开资料;涉及第三方转述或厂商自述处单独标注。文中的代码分两类:标注"命令"的以对应开源仓库 README 为准(接口可能随版本变化),标注"伪代码"的仅为理解算法用,不可直接运行。
2026 年,"世界模型"这个词已经被用得很泛:文生视频说自己在做世界模型,自动驾驶和具身智能把它当成标配,连推荐、广告这类场景也开始借用这个说法。词一泛,问题就容易被盖住——它到底解决的是什么问题?
这篇文章不追新模型,只想沿三条路线捋一遍:JEPA、Dreamer、Genie,看它们分别在解决什么问题、又留下了什么问题。三者的分歧其实只有一个——要不要重建像素。
适合读者:听过"世界模型"但没搞清它和 LLM、和强化学习到底是什么关系的人;准备进入具身智能或物理 AI 方向的工程师;以及想弄明白 V-JEPA 2 和 Genie 3 为什么走的是两条路的人。
太长不看版
- 世界模型解决的核心问题只有一个:让智能体不必在真实世界里反复试错,就能预测"我这样做,世界接下来会变成什么样"。
- 它和 LLM 不是一回事:LLM 预测下一个 token,学的是文本的统计结构;世界模型显式建模"动作 → 下一状态"这个条件关系,动作是它的输入。
- 三条路线,三个取舍:
- JEPA(LeCun 一脉):在表征空间做预测,不重建像素,理由是像素里大量细节不可预测、也不影响决策;
- Dreamer(Hafner 一脉):学一个潜在动态模型,然后在模型里"做梦"训练策略,把昂贵的环境交互换成廉价的计算;
- Genie(DeepMind):直接生成可交互的像素世界,把它当训练场和评测底座。
- 起点是 2018 年:Ha & Schmidhuber 用 VAE + MDN-RNN + 控制器证明,策略可以完全在 RNN 生成的"梦"里训练,再迁回真实环境。
- 核心分歧的现状:潜空间预测路线(V-JEPA 2)在实验室环境下证明了不生成像素也能做机器人规划;生成式路线(Genie 3)把实时交互世界推进到了研究预览阶段。两条路都远没到收敛的时候。
- 没解决的问题:长期一致性(生成式模型交互几分钟后会漂移)、因果与相关的混淆、动作空间受限、评测体系不统一。
一、引言:一个问题,三个答案
先把"世界模型"这个包装拆掉,回到智能体面对的根本困难。
一个智能体想在某个环境里达成目标,绕不开三件事:
- 试错太贵或太危险。机器人在真机上摔一次,硬件就有损耗;自动驾驶在真实道路上试错,代价更直接。
- 试错太慢。纯靠交互学习(model-free 强化学习)需要海量样本,很多任务在真实世界里根本攒不够。
- 学到的只是相关性,不是因果。从数据里拟合出的策略,回答不了"如果我当初不刹车,三秒后会怎样"这种反事实问题。
世界模型想做的事情就落在这三点上:给环境建一个内部模型,让智能体先在里面试错、预演、规划,而不是每次都动真格。
方向一致,但怎么做,学界分成了几派。这篇文章要捋的就是这三派:
- JEPA 回答:怎么学一个不纠结像素细节的世界表征;
- Dreamer 回答:怎么用学到的世界模型去训练策略;
- Genie 回答:怎么把这个"世界"直接生成出来,变成可以交互的训练场。
它们不是三个竞品,更像同一道题下的三种解法。
二、先定义:什么叫"世界模型"
一个词被用得太多,定义就会漂。这里给一个可操作的判据——需要说明的是,学界对"世界模型"的定义并不完全统一,下面这套判据是本文为了区分不同路线而采用的。
2.1 两个功能:预测与反事实
判断一个模型是不是"世界模型",看它能不能做两件事:
- 预测:给定当前观测,输出未来状态(未来一帧、一段视频,或未来状态的抽象表示);
- 反事实:给定当前观测和候选动作,输出"执行这个动作之后,世界会变成什么样"。
第二件事是关键:只说"未来会怎样"的叫预测模型,能说"如果我这样做,未来会怎样"的才叫世界模型。因为只有后者能支持规划——比较若干个候选动作的后果,挑一个最接近目标的。
用形式化一点的说法,它要建模的是:
p(下一状态 | 当前状态, 动作)
注意这个条件项里有"动作"。这一点区分了它和很多看起来相似的东西。
2.2 它不是什么
| 容易混淆的东西 | 它学的是什么 | 和世界模型的差别 |
|---|---|---|
| 大语言模型(LLM) | 给定上文预测下一个 token | 学的是文本的统计结构,不显式建模"动作如何改变环境";动作不是它的输入 |
| 视频生成模型 | 给定提示词生成一段视频 | 输出是"看起来合理的画面",不保证接受控制输入、不保证因果一致 |
| model-free 强化学习 | 直接学策略或价值函数 | 不显式学环境动态,只能靠交互撞出经验 |
| 普通时序预测模型 | 给定历史预测未来数值 | 通常没有动作通道,不能做反事实推演 |
OpenAI 在 Sora 的技术报告里把视频生成模型称作"world simulators",这个说法在学界一直有争议。争论的焦点不是模型强不强,而是能不能用控制输入去驱动它、它是否尊重因果,而这两点恰恰是世界模型的判据。所以"文生视频 = 世界模型"这个等式,目前只能算一种愿景,不能算定义。
三、起点:2018 年,一个"做梦"的智能体
把时间拨回 2018 年。Ha 和 Schmidhuber 的论文《World Models》给出了这个方向最早的清晰骨架,由三个部件拼成:
| 部件 | 全称 | 干什么 |
|---|---|---|
| V | Vision(VAE) | 把高维画面压缩成低维潜在向量,降维去噪 |
| M | Memory(MDN-RNN) | 混合密度网络 + RNN,预测下一个潜在状态的概率分布 |
| C | Controller | 一个很小的线性控制器,根据 V 和 M 的输出决定动作 |
这套结构里,最有启发的是 M 的用法。它学会了"给定当前潜状态和动作,下一个潜状态大概长什么样",于是作者做了件当时挺大胆的事:完全不看真实环境,只让 M 自己往外生成潜状态序列,把控制器放在这个"梦"里训练。
在 CarRacing 和 VizDoom 两个任务上,他们验证了一件事:只在梦里训练的控制器,迁移回真实环境后依然能完成任务。这条结论是今天模型基方法的地基——世界模型不必完美,只要它学到的动态足够一致,就足以支撑决策。
论文里还有一处细节后来被反复引用:作者在梦里训练时给 RNN 的采样加了一点"温度"(相当于人为注入不确定性),结果控制器在真实环境里反而更鲁棒。原因很直接:真实环境总会出现模型没见过的状态,训练时见过一点噪声,泛化时就不容易崩。这预示了后面几年的主线——世界模型的价值不只在预测精度,也在于它能否把不确定性表达出来。
这篇论文埋下两条线:用潜在状态做预测(走向 JEPA、Dreamer)和生成式地重建环境(走向 Genie)。后面的章节就沿着这两条线展开。
四、路线 A:JEPA —— 不重建像素的预测
4.1 立论:为什么不该预测像素
2022 年,Yann LeCun 在立场论文《A Path Towards Autonomous Machine Intelligence》里,把矛头指向了生成式方法的一个要害。
他的论证大致是这样:
- 画面里大量信息是不可预测的——树叶怎么抖、水面怎么反光、纹理的每个像素。逼模型去预测这些细节,等于让它把容量花在"看起来真不真"上;
- 更麻烦的是,模型可能学到看起来逼真、但对决策毫无意义的表征。生成得越像,不代表越懂物理;
- 人也并不重建像素。我们看到一个杯子在桌边,脑子里浮现的是"它要掉了",不是一张逐像素的渲染图。
所以他主张:预测应该在抽象的表征空间里做,而不是在像素空间里做。这就是 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)的出发点。
4.2 机制:预测"表示的表示"
JEPA 的训练逻辑不复杂:把一张图(或一段视频)切成上下文块和目标块,再用上下文块去预测目标块的表示。
和生成式方法的关键差别在监督信号的性质:
| 方法 | 预测目标 | 监督信号 |
|---|---|---|
| 生成式(如自编码器、扩散模型) | 像素值 | 重建损失,逐像素对齐 |
| JEPA | 目标块的表征 | 在编码器空间里对齐,不碰像素 |
这样做有个技术风险叫"表征坍塌"——模型可能把所有输入都编码成同一个向量,预测任务轻松达成但毫无信息量。JEPA 的应对是让目标编码器(target encoder)用上下文编码器的指数移动平均(EMA)来更新,并配合停止梯度,避免两个编码器"串通"。
I-JEPA(2023)先在图像上跑通,V-JEPA(2024)把它扩展到视频,V-JEPA 2(2025)是这条线目前最完整的一步。
4.3 V-JEPA 2:两阶段训练,直通机器人规划
Meta 2025 年 6 月发布的 V-JEPA 2 把这条路线推到了能落地做规划的程度。它的训练分两段:
阶段一:无动作的自监督预训练。 用超过 100 万小时的互联网视频加约 100 万张图像做预训练。这一步不需要任何动作标签,模型学的是运动、物体动力学、交互模式的表征。
阶段二:动作条件的后训练。 冻结视频编码器,在它之上训练一个新的动作条件预测器,用的是公开的 Droid 数据集里不到 62 小时的无标注机器人视频。产出的 V-JEPA 2-AC 就能做规划了:给定一个图像形式的目标,模型模拟候选动作会导致的未来状态,选一个最接近目标的,整个过程放在模型预测控制(MPC)循环里,每一步重新规划。
按 Meta 公开的口径,在没见过的新物体、没去过的实验室、未采集过数据的机器人上,零样本拾取放置任务的成功率在 65%–80% 之间。
口径说明:以上预训练视频时长(超过 100 万小时)、Droid 数据时长(不到 62 小时)与成功率均引自 arXiv:2506.09985 及 Meta 官方博客;成功率是论文报告区间,实际表现随任务和环境而异。
用伪代码看 JEPA 的训练目标,核心就三行:
# 伪代码:JEPA 的预测目标(batch 维度已省略)
ctx_emb = context_encoder(context_block) # 上下文块 -> 表征
tgt_emb = target_encoder(target_block) # 目标块 -> 表征(EMA 更新,停止梯度)
pred = predictor(ctx_emb, target_position) # 在表征空间里预测目标块的表示
loss = l2_loss(pred, tgt_emb) # 注意:损失算在表征上,不是像素上
注意这段里从头到尾没有出现一个像素——这是 JEPA 与生成式世界模型最本质的分界。
五、路线 B:Dreamer —— 在"梦里"训练策略
如果说 JEPA 关心的是"怎么学好表征",Dreamer 关心的就是"怎么用好这个世界模型"。它来自 Danijar Hafner 一脉,从 PlaNet(2018)一路迭代到 DreamerV3。
5.1 RSSM:把状态拆成"确定 + 随机"
Dreamer 的世界模型叫 RSSM(Recurrent State-Space Model,循环状态空间模型),它的设计是把潜在状态拆成两部分:
| 状态 | 符号 | 作用 | 怎么得到 |
|---|---|---|---|
| 确定性状态 | h | 记住历史,聚合时序依赖 | GRU 递推:h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) |
| 随机性状态 | z | 表达当前时刻的不确定性 | 从分布里采样 |
拆开的理由很实际:环境的演化里,一部分是可预测的历史(我上一秒做了什么),一部分是当下才出现的随机性(这一步的噪声)。用 GRU 管前者,用随机变量管后者,预测起来更稳。
训练时用后验 q(z | h, o),因为它能看到真实观测;而在想象时只能用先验 p(z | h),因为那时候没有观测可看。两者之间的 KL 散度就是训练信号:逼先验尽量贴近后验,模型才能在"闭着眼睛"时也预测得准。
5.2 想象训练:把环境交互换成计算
世界模型练好之后,Dreamer 做了一件和 2018 年那篇论文一脉相承的事:策略完全在世界模型里训练。
流程是:
1. 从经验回放里取一个起点 (h_0, z_0)
2. 让策略在潜在空间里"想象"一条轨迹:
a_t = π(h_t, z_t) # 策略选动作
h_{t+1} = f(h_t, z_t, a_t) # 确定性递推
z_{t+1} ~ p(z_{t+1} | h_{t+1}) # 先验采样(不看真实观测)
r_t ~ p(r_t | h_t, z_t) # 预测奖励
3. 用想象出来的奖励算回报,更新策略和价值网络
关键差别在想象这一步:只跑先验和 GRU,不跑编码器,也不接触真实环境。策略和价值的更新完全发生在想象里,真实交互只用于训练世界模型、搜集新数据,好处是同一批真实数据可以被反复"想象"利用,样本效率高。不过别误会,策略更新不碰环境,不等于整个训练不需要环境——世界模型本身仍然要靠真实交互来学,省下的是"用数据"的效率。
5.3 DreamerV3:一套超参打天下
DreamerV3 是这条线目前最重要的成果,论文发表在 Nature 2025。它解决的痛点很具体:强化学习算法过去每换一个领域就要重新调参,从游戏到机器人,超参、奖励尺度、正则化都要重配一遍。
DreamerV3 的答案是加三项鲁棒性技术(symlog 变换、百分位归一化、KL 平衡),配一套固定超参数,在超过 150 个任务上直接开箱使用。最常被引用的一个结果是:它是第一个不依赖人类数据、也不需要课程设计,就从零在 Minecraft 里采到钻石的算法。
这个结果之所以被反复提起,是因为任务本身不简单:Minecraft 采钻石要在开放世界里做稀疏奖励下的长期探索,动作空间复杂,而且得从像素直接学起。此前的工作要么依赖人类演示数据,要么依赖专家设计的课程。
复现路径(命令,以官方仓库 README 为准):
git clone https://github.com/danijar/dreamerv3
cd dreamerv3
pip install -e .
# 跑一个视觉控制任务,感受"固定超参 + 想象训练"的流程
python dreamerv3/train.py \
--logdir ~/logdir/dmc_cartpole_swingup \
--configs dmc_vision \
--task dmc_cartpole_swingup
跑一遍不必盯着分数,重点是看清这套分工:策略优化发生在想象里,真实交互主要用来训练和校正世界模型。日志里能看出先后关系——世界模型的损失先收敛,之后同样数量的真实交互能换来更多策略提升,这正是"样本效率"的来源。
六、路线 C:Genie —— 生成一个能交互的世界
JEPA 和 Dreamer 都不生成画面。Genie 走的是另一条路:既然世界模型要当训练场,那为什么不直接把这个"世界"生成出来?
6.1 Genie 1(2024):从视频里学会"可玩"
Genie 1 是 Google DeepMind 2024 年 2 月发布的基础世界模型,论文口径是 11B 参数、在约 20 万小时公开互联网游戏视频上训练。它能做到一件此前没人做到的事:给一张图或一段描述,生成一个可以逐帧交互的环境。
它由三个部件构成:
- 视频分词器:把视频帧压成离散 token;
- 潜在动作模型(Latent Action Model):从相邻两帧的变化里,反推出一个"隐含动作"——这解决了训练数据里没有动作标签的问题,模型自己把动作空间学出来;
- 动力学模型:给定隐含动作,自回归地预测下一帧。
「潜在动作模型」是这里最巧妙的一环。互联网视频没有标注"这一帧按了哪个键",但只要相邻帧之间发生了变化,就存在某种"动作"。模型自己把这些变化归纳成一组离散的潜在动作,于是无标注视频也能训练出可交互环境。
6.2 Genie 2 → Genie 3:从能玩到实时
| 版本 | 时间 | 关键能力 |
|---|---|---|
| Genie 1 | 2024.02 | 从单张图/文本生成可交互的 2D 环境;潜在动作模型;11B 参数 |
| Genie 2 | 2024.12 | 从单张图像提示生成可玩的 3D 世界;生成时长和一致性提升 |
| Genie 3 | 2025.08 | 实时交互:文本提示生成可导航世界,720p、20–24 fps,一致性维持几分钟;支持用文本触发世界事件(改天气、生成物体);接入 SIMA 智能体 |
Genie 3 有两处值得单独说。
一是它走的是逐帧生成的路线,而不是 NeRF、高斯泼溅那类"先重建场景再渲染"的思路:画面逐帧生成,却能在长轨迹上维持几何和光照的稳定。DeepMind 把这种一致性描述为模型自发涌现的,而不是靠显式 3D 表示约束出来的。
二是它被明确定位成智能体的训练场。有了可导航、可控、还带事件变量的世界,智能体就可以在上面跑反事实实验:同一场景下换个动作,看结果怎么变。DeepMind 在发布博客里把这一步和"通往 AGI 的课程"直接挂钩。
但它的限制同样明确,而且都是官方自己列出来的:
- 动作空间有限:能移动、能触发事件,但精细操作(比如用手搬东西)还不行;
- 多智能体交互困难:目前无法模拟多个独立智能体之间的复杂互动;
- 不是精确数字孪生:生成的场景是"神似"而非"还原",不能当地理精确的仿真用;
- 会话有时长:官方称一致性只能维持"几分钟",之后会退化;
- 只有研究预览:仅对一小批研究者和创作者开放,没有公开权重和推理代码。
七、三条路线放一起看
把三条线并排摆出来,分野就清楚了。
| 维度 | JEPA(V-JEPA 2) | Dreamer(V3) | Genie(3) |
|---|---|---|---|
| 预测空间 | 表征(潜空间) | 潜状态(h + z) | 像素(可交互世界) |
| 是否重建像素 | 否 | 预测在潜状态空间;训练期含观测重建 | 是(生成就是输出) |
| 动作从哪来 | 后训练阶段用少量真实机器人数据 | 智能体自己与环境交互产生 | 从无标注视频里反推潜在动作 |
| 主要用途 | 表征学习、规划 | 策略学习(RL) | 生成训练场、闭环评测 |
| 数据需求 | 海量无标注视频 + 少量动作数据 | 与环境的交互经验 | 海量无标注视频 |
| 部署成本 | 低(不出像素) | 中(想象不碰环境) | 高(逐帧生成) |
| 关键局限 | 精细场景表征退化;规划仍依赖 MPC | 长程想象受模型误差累积限制 | 动作空间窄、会话短、未开放 |
| 是否开源 | 是(MIT) | 是 | 否 |
这张表其实在说同一件事:三条路线给出不同答案,是因为它们想拿世界模型干的事不一样。要理解和规划,就不必在像素上花力气,表征够用(JEPA);要训练策略,就需要一个能稳定 rollout 的模型,潜状态最划算(Dreamer);要当训练场和考场,就必须让智能体真的"看见"世界的反馈,像素生成省不掉(Genie)。
所以"JEPA 和 Genie 谁对"这个问题本身就问错了。分歧真正落在一点上:预测像素到底是在浪费容量,还是在提供不可或缺的监督信号。LeCun 站前者;生成式这一路线的实践则说明,当目标本身就是产出一个能给人看、能给智能体训练的环境时,像素生成就是目的,不是浪费。
八、所以,世界模型到底解决了什么问题
把三条线合起来看,世界模型真正解决的是四件事:
- 样本效率。把"在真实环境里试错"换成"在模型里试错"。Dreamer 的策略更新发生在想象中,真实交互集中用于训练世界模型,样本效率的提升正是模型基方法相对 model-free 最根本的优势。
- 反事实推演。给定候选动作预测后果,让规划从"匹配历史数据"变成"推演如果这样会怎样"。常规的监督学习和 LLM 缺少"动作 → 下一状态"的显式建模接口,做这类推演要么靠提示词模拟,要么另接一个动态模型。
- 无监督地利用视频。互联网上最多的数据是视频,而视频没有动作标签、没有奖励。JEPA 的自监督目标、Genie 的潜在动作模型,都是在解决"如何把无标注视频变成可用知识"这个问题。
- 数据与评测底座。Genie 3 这类模型能生成真实世界不存在的场景,官方把它定位成长尾数据的来源和智能体评测的场地。但别忘记,它生成的是"神似"而非物理精确的世界。
它没解决的问题同样清楚:
- 长期一致性。生成式世界模型在多步 rollout 后会漂移,Genie 3 的一致性只能维持"几分钟",就是这一限制的直接体现;潜空间模型的长程预测同样受误差累积限制。
- 因果与相关。当前模型学到的多数是"画面上的统计规律",而非物理因果。反事实推理要可靠,需要更强的因果建模,不是更多数据。
- 动作空间与控制精度。Genie 3 能导航但做不了精细操作;V-JEPA 2-AC 能做拾取放置,但走的是 MPC 规划而不是端到端控制。
- 评测不统一。理解、预测、规划三件事各有各的榜单,没有一套公共体系能同时衡量三者。
- 路线的取舍没有共识。生成式与非生成式之争,从 2022 年 LeCun 的立场论文到现在,仍然是开放问题。
九、想上手?给一条现实路径
世界模型的门槛不低,但可以按下面这条线先跑起来。能执行的命令和仅供理解算法的伪代码会分开标注,别拿伪代码去训练。
9.1 先跑通一条最短路径:V-JEPA 2
git clone https://github.com/facebookresearch/vjepa2
cd vjepa2
# 依赖安装、权重下载与推理脚本以官方 README 为准
这一步的目标是看到"预测发生在表征空间"具体是什么样子:你会拿到视频片段的嵌入,而不是生成的画面。把嵌入拿出来做检索或分类,能直观感受到 JEPA 的表征质量。
9.2 再跑通一次 DreamerV3 的训练
git clone https://github.com/danijar/dreamerv3
cd dreamerv3
pip install -e .
python dreamerv3/train.py \
--logdir ~/logdir/dmc_cartpole_swingup \
--configs dmc_vision \
--task dmc_cartpole_swingup
重点看两件事:世界模型的损失曲线,和策略回报曲线。前者收敛后,后者才会开始爬——这个先后顺序本身就是"先学世界、再学行为"的可视化。
9.3 从架构上理解生成式路线
Genie 系列没有开源,但 NVIDIA 的 Cosmos 提供了同类能力的开源权重(Predict / Transfer / Reason 三族),可以作为生成式世界模型的动手入口。下面是调用结构的伪代码(类名与模块路径以官方仓库为准,此处只表达"输入提示视频、输出后续帧"这一调用形态):
# 伪代码:生成式世界模型的调用结构(非真实 API,接口名请以官方 README 为准)
model = load_world_model("nvidia/Cosmos-Predict1-7B") # 加载世界基础模型
model.eval()
with torch.no_grad():
# 输入:一段提示视频 prompt_video(+ 可选的文本/控制意图)
# 输出:模型"想象"出的后续若干帧
future_video = model.generate(prompt_video=prompt_video, num_frames=24)
这段结构能说明生成式路线为什么贵:每生成一帧都要过一遍主干网络,这是它难以做到实时的主要成本来源,也是 Genie 3 只开放研究预览的原因之一。
9.4 拿它评测:物理推理基准
Meta 随 V-JEPA 2 一并发布了三个测"物理理解"的基准,可以用来做横向比较:
| 基准 | 测什么 |
|---|---|
| IntPhys 2 | 区分物理上可能 / 不可能的事件 |
| MVPBench(最小视频对) | 用最小变化的视频问答,避免模型靠捷径答题 |
| CausalVQA | 因果推理,含反事实与预期 |
Meta 在发布时指出,当前模型在这些基准上与人类仍有明显差距。这说明"看起来会预测"和"真的懂物理"之间还有距离。
十、避坑指南
| 坑 | 说明 |
|---|---|
| 把文生视频等同于世界模型 | 不能接受控制输入、不保证因果一致的生成模型,最多算"世界模拟器的雏形",别直接当决策组件用 |
| 用重建损失评价世界模型好坏 | 像素重建得像,不代表对决策有用。JEPA 的立论正是建立在对重建损失的批评上,评价要看下游任务 |
| 在像素空间硬做长期预测 | 多步 rollout 必然漂移,长程规划要在抽象空间做,或加显式的一致性约束 |
| 忽略模型误差累积 | 在模型里"想象"得越久,偏离真实动态越远。Dreamer 用有限的想象步长控制这件事,这个超参不能随便放大 |
| 以为零样本就是不要数据 | V-JEPA 2-AC 的零样本,前提是 100 万小时视频预训练 + 不到 62 小时机器人数据,只是不需要目标环境的专属数据 |
| 拿 Genie 当数字孪生 | 官方明确说明生成场景是"神似"而非地理精确,也别指望它模拟多智能体交互 |
| 假设模型学到了因果 | 当前多数模型学的是相关性。要做反事实,必须单独设计验证,别默认它"懂物理" |
| 把伪代码当训练脚本 | 本文标注"伪代码"的段落只表达算法结构,直接复制进训练脚本会报错 |
十一、总结与展望
回到开头那个问题:世界模型到底解决了什么?
它解决的是"不真正下场,也能知道自己的动作会把世界带向哪里"。这件事对规划、策略学习、数据生成都是前置条件,所以各个方向都想用,也正因为如此,"世界模型"这个词才变得含糊。
从 2018 年到现在,三条路线各自啃下了问题的一部分:JEPA 说明预测可以不做在像素上,表征空间里的自监督学习足以支撑机器人规划;Dreamer 说明策略优化可以主要在世界模型里完成,样本效率的提升来自算法结构而非调参;Genie 说明像素级、可交互、实时的世界在工程上可行,还能直接当智能体的训练场。
接下来值得盯的是三个具体问题:潜空间模型能否把长期一致性再往上推一个量级,生成式模型能否把动作空间从"导航"扩展到"操作",以及两条路线会不会在某个中间形态上合流——比如训练期用生成式提供监督、推理期退化到潜空间。
在那之前,判断可以务实一点:别问哪个模型是"真的世界模型",而要问你的任务需要它预测什么、以什么代价预测。需要规划就看表征质量,需要控制就看 rollout 稳定性,需要数据就看生成的可控性。
参考资源:
- Ha & Schmidhuber, World Models(2018,NeurIPS):arXiv:1803.10122 + 项目页 worldmodels.github.io
- Yann LeCun, A Path Towards Autonomous Machine Intelligence(2022,立场论文,OpenReview)
- Meta V-JEPA 2:arXiv:2506.09985 + GitHub: facebookresearch/vjepa2 + Meta AI 官方博客
- Google DeepMind Genie:Genie: Generative Interactive Environments(arXiv:2402.15391);Genie 2 与 Genie 3 官方博客(deepmind.google)
- DreamerV3:arXiv:2301.04104(Mastering Diverse Domains through World Models,Nature 2025)+ GitHub: danijar/dreamerv3
- NVIDIA Cosmos:arXiv:2501.03575 + GitHub: NVIDIA/Cosmos
- 物理推理基准:IntPhys 2、MVPBench、CausalVQA(facebookresearch 开源)
- 本文为概念与路线层面的梳理,涉及的数据与结论请以各机构论文、官方博客为准;文中命令与接口以对应开源仓库最新版本为准
版本记录:
- v1.2(2026-09):润色文字,降低模板感。去掉"有一句话可以概括这张表"“值得对着多看两秒”“这里要提一句”"值得记住"等套路化导语;把排比三连(“证明了…证明了…证明了”)改为行文;收敛过密加粗;打散重复的"不是 A,而是 B"句式;无信息增删,事实与结论与 v1.1 一致
- v1.1(2026-09):复核事实与表述。修正 Dreamer 部分"策略训练完全不碰环境"的误导性说法(补明世界模型本身仍需真实交互);删除无出处的"人类准确率 85%–95%“精确数字,改为 Meta 的定性表述;修正 Genie 3 处误引"论文”(Genie 3 无论文,仅官方博客);将 Genie 3 的"不依赖显式 3D 表示"改为对公开描述的转述;澄清"Dreamer 不碰环境/不增加真实交互量"等错误结论;把 Cosmos 代码段明确标注为伪代码,去掉未经核实的类名与导入路径;补充定义不统一的说明与若干过度断言的保守化改写
- v1.0(2026-09):首版,覆盖世界模型定义、2018 年起点、JEPA / Dreamer / Genie 三条路线、路线对比、问题总结与上手路径
关注我,持续拆解大模型与物理 AI 的关键技术——用看得懂的方式讲清原理,用能上手的路径带你入门。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)