标签:#世界模型 #JEPA #Genie #Dreamer #自监督学习 #具身智能
数据口径:本文事实与数据综合自 Ha & Schmidhuber 2018 年 World Models 论文、LeCun 2022 年立场论文、Meta V-JEPA 2 论文(arXiv:2506.09985)、Google DeepMind Genie 1/2/3 官方博客与论文、DreamerV3 论文(arXiv:2301.04104,Nature 2025)、NVIDIA Cosmos 技术报告(arXiv:2501.03575)等公开资料;涉及第三方转述或厂商自述处单独标注。文中的代码分两类:标注"命令"的以对应开源仓库 README 为准(接口可能随版本变化),标注"伪代码"的仅为理解算法用,不可直接运行。

2026 年,"世界模型"这个词已经被用得很泛:文生视频说自己在做世界模型,自动驾驶和具身智能把它当成标配,连推荐、广告这类场景也开始借用这个说法。词一泛,问题就容易被盖住——它到底解决的是什么问题?

这篇文章不追新模型,只想沿三条路线捋一遍:JEPA、Dreamer、Genie,看它们分别在解决什么问题、又留下了什么问题。三者的分歧其实只有一个——要不要重建像素。

适合读者:听过"世界模型"但没搞清它和 LLM、和强化学习到底是什么关系的人;准备进入具身智能或物理 AI 方向的工程师;以及想弄明白 V-JEPA 2 和 Genie 3 为什么走的是两条路的人。


太长不看版

  • 世界模型解决的核心问题只有一个:让智能体不必在真实世界里反复试错,就能预测"我这样做,世界接下来会变成什么样"。
  • 它和 LLM 不是一回事:LLM 预测下一个 token,学的是文本的统计结构;世界模型显式建模"动作 → 下一状态"这个条件关系,动作是它的输入。
  • 三条路线,三个取舍
    • JEPA(LeCun 一脉):在表征空间做预测,不重建像素,理由是像素里大量细节不可预测、也不影响决策;
    • Dreamer(Hafner 一脉):学一个潜在动态模型,然后在模型里"做梦"训练策略,把昂贵的环境交互换成廉价的计算;
    • Genie(DeepMind):直接生成可交互的像素世界,把它当训练场和评测底座。
  • 起点是 2018 年:Ha & Schmidhuber 用 VAE + MDN-RNN + 控制器证明,策略可以完全在 RNN 生成的"梦"里训练,再迁回真实环境。
  • 核心分歧的现状:潜空间预测路线(V-JEPA 2)在实验室环境下证明了不生成像素也能做机器人规划;生成式路线(Genie 3)把实时交互世界推进到了研究预览阶段。两条路都远没到收敛的时候。
  • 没解决的问题:长期一致性(生成式模型交互几分钟后会漂移)、因果与相关的混淆、动作空间受限、评测体系不统一。

一、引言:一个问题,三个答案

先把"世界模型"这个包装拆掉,回到智能体面对的根本困难。

一个智能体想在某个环境里达成目标,绕不开三件事:

  1. 试错太贵或太危险。机器人在真机上摔一次,硬件就有损耗;自动驾驶在真实道路上试错,代价更直接。
  2. 试错太慢。纯靠交互学习(model-free 强化学习)需要海量样本,很多任务在真实世界里根本攒不够。
  3. 学到的只是相关性,不是因果。从数据里拟合出的策略,回答不了"如果我当初不刹车,三秒后会怎样"这种反事实问题。

世界模型想做的事情就落在这三点上:给环境建一个内部模型,让智能体先在里面试错、预演、规划,而不是每次都动真格。

方向一致,但怎么做,学界分成了几派。这篇文章要捋的就是这三派:

  • JEPA 回答:怎么学一个不纠结像素细节的世界表征;
  • Dreamer 回答:怎么用学到的世界模型去训练策略;
  • Genie 回答:怎么把这个"世界"直接生成出来,变成可以交互的训练场。

它们不是三个竞品,更像同一道题下的三种解法。


二、先定义:什么叫"世界模型"

一个词被用得太多,定义就会漂。这里给一个可操作的判据——需要说明的是,学界对"世界模型"的定义并不完全统一,下面这套判据是本文为了区分不同路线而采用的。

2.1 两个功能:预测与反事实

判断一个模型是不是"世界模型",看它能不能做两件事:

  1. 预测:给定当前观测,输出未来状态(未来一帧、一段视频,或未来状态的抽象表示);
  2. 反事实:给定当前观测和候选动作,输出"执行这个动作之后,世界会变成什么样"。

第二件事是关键:只说"未来会怎样"的叫预测模型,能说"如果我这样做,未来会怎样"的才叫世界模型。因为只有后者能支持规划——比较若干个候选动作的后果,挑一个最接近目标的。

用形式化一点的说法,它要建模的是:

p(下一状态 | 当前状态, 动作)

注意这个条件项里有"动作"。这一点区分了它和很多看起来相似的东西。

2.2 它不是什么

容易混淆的东西它学的是什么和世界模型的差别
大语言模型(LLM)给定上文预测下一个 token学的是文本的统计结构,不显式建模"动作如何改变环境";动作不是它的输入
视频生成模型给定提示词生成一段视频输出是"看起来合理的画面",不保证接受控制输入、不保证因果一致
model-free 强化学习直接学策略或价值函数不显式学环境动态,只能靠交互撞出经验
普通时序预测模型给定历史预测未来数值通常没有动作通道,不能做反事实推演

OpenAI 在 Sora 的技术报告里把视频生成模型称作"world simulators",这个说法在学界一直有争议。争论的焦点不是模型强不强,而是能不能用控制输入去驱动它、它是否尊重因果,而这两点恰恰是世界模型的判据。所以"文生视频 = 世界模型"这个等式,目前只能算一种愿景,不能算定义。


三、起点:2018 年,一个"做梦"的智能体

把时间拨回 2018 年。Ha 和 Schmidhuber 的论文《World Models》给出了这个方向最早的清晰骨架,由三个部件拼成:

部件全称干什么
VVision(VAE)把高维画面压缩成低维潜在向量,降维去噪
MMemory(MDN-RNN)混合密度网络 + RNN,预测下一个潜在状态的概率分布
CController一个很小的线性控制器,根据 V 和 M 的输出决定动作

这套结构里,最有启发的是 M 的用法。它学会了"给定当前潜状态和动作,下一个潜状态大概长什么样",于是作者做了件当时挺大胆的事:完全不看真实环境,只让 M 自己往外生成潜状态序列,把控制器放在这个"梦"里训练。

在 CarRacing 和 VizDoom 两个任务上,他们验证了一件事:只在梦里训练的控制器,迁移回真实环境后依然能完成任务。这条结论是今天模型基方法的地基——世界模型不必完美,只要它学到的动态足够一致,就足以支撑决策。

论文里还有一处细节后来被反复引用:作者在梦里训练时给 RNN 的采样加了一点"温度"(相当于人为注入不确定性),结果控制器在真实环境里反而更鲁棒。原因很直接:真实环境总会出现模型没见过的状态,训练时见过一点噪声,泛化时就不容易崩。这预示了后面几年的主线——世界模型的价值不只在预测精度,也在于它能否把不确定性表达出来。

这篇论文埋下两条线:用潜在状态做预测(走向 JEPA、Dreamer)和生成式地重建环境(走向 Genie)。后面的章节就沿着这两条线展开。


四、路线 A:JEPA —— 不重建像素的预测

4.1 立论:为什么不该预测像素

2022 年,Yann LeCun 在立场论文《A Path Towards Autonomous Machine Intelligence》里,把矛头指向了生成式方法的一个要害。

他的论证大致是这样:

  • 画面里大量信息是不可预测的——树叶怎么抖、水面怎么反光、纹理的每个像素。逼模型去预测这些细节,等于让它把容量花在"看起来真不真"上;
  • 更麻烦的是,模型可能学到看起来逼真、但对决策毫无意义的表征。生成得越像,不代表越懂物理;
  • 人也并不重建像素。我们看到一个杯子在桌边,脑子里浮现的是"它要掉了",不是一张逐像素的渲染图。

所以他主张:预测应该在抽象的表征空间里做,而不是在像素空间里做。这就是 JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)的出发点。

4.2 机制:预测"表示的表示"

JEPA 的训练逻辑不复杂:把一张图(或一段视频)切成上下文块和目标块,再用上下文块去预测目标块的表示。

和生成式方法的关键差别在监督信号的性质:

方法预测目标监督信号
生成式(如自编码器、扩散模型)像素值重建损失,逐像素对齐
JEPA目标块的表征在编码器空间里对齐,不碰像素

这样做有个技术风险叫"表征坍塌"——模型可能把所有输入都编码成同一个向量,预测任务轻松达成但毫无信息量。JEPA 的应对是让目标编码器(target encoder)用上下文编码器的指数移动平均(EMA)来更新,并配合停止梯度,避免两个编码器"串通"。

I-JEPA(2023)先在图像上跑通,V-JEPA(2024)把它扩展到视频,V-JEPA 2(2025)是这条线目前最完整的一步。

4.3 V-JEPA 2:两阶段训练,直通机器人规划

Meta 2025 年 6 月发布的 V-JEPA 2 把这条路线推到了能落地做规划的程度。它的训练分两段:

阶段一:无动作的自监督预训练。 用超过 100 万小时的互联网视频加约 100 万张图像做预训练。这一步不需要任何动作标签,模型学的是运动、物体动力学、交互模式的表征。

阶段二:动作条件的后训练。 冻结视频编码器,在它之上训练一个新的动作条件预测器,用的是公开的 Droid 数据集里不到 62 小时的无标注机器人视频。产出的 V-JEPA 2-AC 就能做规划了:给定一个图像形式的目标,模型模拟候选动作会导致的未来状态,选一个最接近目标的,整个过程放在模型预测控制(MPC)循环里,每一步重新规划。

按 Meta 公开的口径,在没见过的新物体、没去过的实验室、未采集过数据的机器人上,零样本拾取放置任务的成功率在 65%–80% 之间。

口径说明:以上预训练视频时长(超过 100 万小时)、Droid 数据时长(不到 62 小时)与成功率均引自 arXiv:2506.09985 及 Meta 官方博客;成功率是论文报告区间,实际表现随任务和环境而异。

用伪代码看 JEPA 的训练目标,核心就三行:

# 伪代码:JEPA 的预测目标(batch 维度已省略)
ctx_emb = context_encoder(context_block)          # 上下文块 -> 表征
tgt_emb = target_encoder(target_block)            # 目标块 -> 表征(EMA 更新,停止梯度)
pred    = predictor(ctx_emb, target_position)     # 在表征空间里预测目标块的表示
loss    = l2_loss(pred, tgt_emb)                  # 注意:损失算在表征上,不是像素上

注意这段里从头到尾没有出现一个像素——这是 JEPA 与生成式世界模型最本质的分界。


五、路线 B:Dreamer —— 在"梦里"训练策略

如果说 JEPA 关心的是"怎么学好表征",Dreamer 关心的就是"怎么用好这个世界模型"。它来自 Danijar Hafner 一脉,从 PlaNet(2018)一路迭代到 DreamerV3。

5.1 RSSM:把状态拆成"确定 + 随机"

Dreamer 的世界模型叫 RSSM(Recurrent State-Space Model,循环状态空间模型),它的设计是把潜在状态拆成两部分:

状态符号作用怎么得到
确定性状态h记住历史,聚合时序依赖GRU 递推:h_t = f(h_{t-1}, z_{t-1}, a_{t-1})
随机性状态z表达当前时刻的不确定性从分布里采样

拆开的理由很实际:环境的演化里,一部分是可预测的历史(我上一秒做了什么),一部分是当下才出现的随机性(这一步的噪声)。用 GRU 管前者,用随机变量管后者,预测起来更稳。

训练时用后验 q(z | h, o),因为它能看到真实观测;而在想象时只能用先验 p(z | h),因为那时候没有观测可看。两者之间的 KL 散度就是训练信号:逼先验尽量贴近后验,模型才能在"闭着眼睛"时也预测得准。

5.2 想象训练:把环境交互换成计算

世界模型练好之后,Dreamer 做了一件和 2018 年那篇论文一脉相承的事:策略完全在世界模型里训练

流程是:

1. 从经验回放里取一个起点 (h_0, z_0)
2. 让策略在潜在空间里"想象"一条轨迹:
   a_t = π(h_t, z_t)              # 策略选动作
   h_{t+1} = f(h_t, z_t, a_t)     # 确定性递推
   z_{t+1} ~ p(z_{t+1} | h_{t+1}) # 先验采样(不看真实观测)
   r_t ~ p(r_t | h_t, z_t)        # 预测奖励
3. 用想象出来的奖励算回报,更新策略和价值网络

关键差别在想象这一步:只跑先验和 GRU,不跑编码器,也不接触真实环境。策略和价值的更新完全发生在想象里,真实交互只用于训练世界模型、搜集新数据,好处是同一批真实数据可以被反复"想象"利用,样本效率高。不过别误会,策略更新不碰环境,不等于整个训练不需要环境——世界模型本身仍然要靠真实交互来学,省下的是"用数据"的效率。

5.3 DreamerV3:一套超参打天下

DreamerV3 是这条线目前最重要的成果,论文发表在 Nature 2025。它解决的痛点很具体:强化学习算法过去每换一个领域就要重新调参,从游戏到机器人,超参、奖励尺度、正则化都要重配一遍。

DreamerV3 的答案是加三项鲁棒性技术(symlog 变换、百分位归一化、KL 平衡),配一套固定超参数,在超过 150 个任务上直接开箱使用。最常被引用的一个结果是:它是第一个不依赖人类数据、也不需要课程设计,就从零在 Minecraft 里采到钻石的算法

这个结果之所以被反复提起,是因为任务本身不简单:Minecraft 采钻石要在开放世界里做稀疏奖励下的长期探索,动作空间复杂,而且得从像素直接学起。此前的工作要么依赖人类演示数据,要么依赖专家设计的课程。

复现路径(命令,以官方仓库 README 为准):

git clone https://github.com/danijar/dreamerv3
cd dreamerv3
pip install -e .

# 跑一个视觉控制任务,感受"固定超参 + 想象训练"的流程
python dreamerv3/train.py \
  --logdir ~/logdir/dmc_cartpole_swingup \
  --configs dmc_vision \
  --task dmc_cartpole_swingup

跑一遍不必盯着分数,重点是看清这套分工:策略优化发生在想象里,真实交互主要用来训练和校正世界模型。日志里能看出先后关系——世界模型的损失先收敛,之后同样数量的真实交互能换来更多策略提升,这正是"样本效率"的来源。


六、路线 C:Genie —— 生成一个能交互的世界

JEPA 和 Dreamer 都不生成画面。Genie 走的是另一条路:既然世界模型要当训练场,那为什么不直接把这个"世界"生成出来?

6.1 Genie 1(2024):从视频里学会"可玩"

Genie 1 是 Google DeepMind 2024 年 2 月发布的基础世界模型,论文口径是 11B 参数、在约 20 万小时公开互联网游戏视频上训练。它能做到一件此前没人做到的事:给一张图或一段描述,生成一个可以逐帧交互的环境

它由三个部件构成:

  • 视频分词器:把视频帧压成离散 token;
  • 潜在动作模型(Latent Action Model):从相邻两帧的变化里,反推出一个"隐含动作"——这解决了训练数据里没有动作标签的问题,模型自己把动作空间学出来;
  • 动力学模型:给定隐含动作,自回归地预测下一帧。

「潜在动作模型」是这里最巧妙的一环。互联网视频没有标注"这一帧按了哪个键",但只要相邻帧之间发生了变化,就存在某种"动作"。模型自己把这些变化归纳成一组离散的潜在动作,于是无标注视频也能训练出可交互环境。

6.2 Genie 2 → Genie 3:从能玩到实时

版本时间关键能力
Genie 12024.02从单张图/文本生成可交互的 2D 环境;潜在动作模型;11B 参数
Genie 22024.12从单张图像提示生成可玩的 3D 世界;生成时长和一致性提升
Genie 32025.08实时交互:文本提示生成可导航世界,720p、20–24 fps,一致性维持几分钟;支持用文本触发世界事件(改天气、生成物体);接入 SIMA 智能体

Genie 3 有两处值得单独说。

一是它走的是逐帧生成的路线,而不是 NeRF、高斯泼溅那类"先重建场景再渲染"的思路:画面逐帧生成,却能在长轨迹上维持几何和光照的稳定。DeepMind 把这种一致性描述为模型自发涌现的,而不是靠显式 3D 表示约束出来的。

二是它被明确定位成智能体的训练场。有了可导航、可控、还带事件变量的世界,智能体就可以在上面跑反事实实验:同一场景下换个动作,看结果怎么变。DeepMind 在发布博客里把这一步和"通往 AGI 的课程"直接挂钩。

但它的限制同样明确,而且都是官方自己列出来的:

  • 动作空间有限:能移动、能触发事件,但精细操作(比如用手搬东西)还不行;
  • 多智能体交互困难:目前无法模拟多个独立智能体之间的复杂互动;
  • 不是精确数字孪生:生成的场景是"神似"而非"还原",不能当地理精确的仿真用;
  • 会话有时长:官方称一致性只能维持"几分钟",之后会退化;
  • 只有研究预览:仅对一小批研究者和创作者开放,没有公开权重和推理代码。

七、三条路线放一起看

把三条线并排摆出来,分野就清楚了。

维度JEPA(V-JEPA 2)Dreamer(V3)Genie(3)
预测空间表征(潜空间)潜状态(h + z)像素(可交互世界)
是否重建像素预测在潜状态空间;训练期含观测重建是(生成就是输出)
动作从哪来后训练阶段用少量真实机器人数据智能体自己与环境交互产生从无标注视频里反推潜在动作
主要用途表征学习、规划策略学习(RL)生成训练场、闭环评测
数据需求海量无标注视频 + 少量动作数据与环境的交互经验海量无标注视频
部署成本低(不出像素)中(想象不碰环境)高(逐帧生成)
关键局限精细场景表征退化;规划仍依赖 MPC长程想象受模型误差累积限制动作空间窄、会话短、未开放
是否开源是(MIT)

这张表其实在说同一件事:三条路线给出不同答案,是因为它们想拿世界模型干的事不一样。要理解和规划,就不必在像素上花力气,表征够用(JEPA);要训练策略,就需要一个能稳定 rollout 的模型,潜状态最划算(Dreamer);要当训练场和考场,就必须让智能体真的"看见"世界的反馈,像素生成省不掉(Genie)。

所以"JEPA 和 Genie 谁对"这个问题本身就问错了。分歧真正落在一点上:预测像素到底是在浪费容量,还是在提供不可或缺的监督信号。LeCun 站前者;生成式这一路线的实践则说明,当目标本身就是产出一个能给人看、能给智能体训练的环境时,像素生成就是目的,不是浪费。


八、所以,世界模型到底解决了什么问题

把三条线合起来看,世界模型真正解决的是四件事:

  1. 样本效率。把"在真实环境里试错"换成"在模型里试错"。Dreamer 的策略更新发生在想象中,真实交互集中用于训练世界模型,样本效率的提升正是模型基方法相对 model-free 最根本的优势。
  2. 反事实推演。给定候选动作预测后果,让规划从"匹配历史数据"变成"推演如果这样会怎样"。常规的监督学习和 LLM 缺少"动作 → 下一状态"的显式建模接口,做这类推演要么靠提示词模拟,要么另接一个动态模型。
  3. 无监督地利用视频。互联网上最多的数据是视频,而视频没有动作标签、没有奖励。JEPA 的自监督目标、Genie 的潜在动作模型,都是在解决"如何把无标注视频变成可用知识"这个问题。
  4. 数据与评测底座。Genie 3 这类模型能生成真实世界不存在的场景,官方把它定位成长尾数据的来源和智能体评测的场地。但别忘记,它生成的是"神似"而非物理精确的世界。

它没解决的问题同样清楚:

  • 长期一致性。生成式世界模型在多步 rollout 后会漂移,Genie 3 的一致性只能维持"几分钟",就是这一限制的直接体现;潜空间模型的长程预测同样受误差累积限制。
  • 因果与相关。当前模型学到的多数是"画面上的统计规律",而非物理因果。反事实推理要可靠,需要更强的因果建模,不是更多数据。
  • 动作空间与控制精度。Genie 3 能导航但做不了精细操作;V-JEPA 2-AC 能做拾取放置,但走的是 MPC 规划而不是端到端控制。
  • 评测不统一。理解、预测、规划三件事各有各的榜单,没有一套公共体系能同时衡量三者。
  • 路线的取舍没有共识。生成式与非生成式之争,从 2022 年 LeCun 的立场论文到现在,仍然是开放问题。

九、想上手?给一条现实路径

世界模型的门槛不低,但可以按下面这条线先跑起来。能执行的命令和仅供理解算法的伪代码会分开标注,别拿伪代码去训练。

9.1 先跑通一条最短路径:V-JEPA 2

git clone https://github.com/facebookresearch/vjepa2
cd vjepa2
# 依赖安装、权重下载与推理脚本以官方 README 为准

这一步的目标是看到"预测发生在表征空间"具体是什么样子:你会拿到视频片段的嵌入,而不是生成的画面。把嵌入拿出来做检索或分类,能直观感受到 JEPA 的表征质量。

9.2 再跑通一次 DreamerV3 的训练

git clone https://github.com/danijar/dreamerv3
cd dreamerv3
pip install -e .

python dreamerv3/train.py \
  --logdir ~/logdir/dmc_cartpole_swingup \
  --configs dmc_vision \
  --task dmc_cartpole_swingup

重点看两件事:世界模型的损失曲线,和策略回报曲线。前者收敛后,后者才会开始爬——这个先后顺序本身就是"先学世界、再学行为"的可视化。

9.3 从架构上理解生成式路线

Genie 系列没有开源,但 NVIDIA 的 Cosmos 提供了同类能力的开源权重(Predict / Transfer / Reason 三族),可以作为生成式世界模型的动手入口。下面是调用结构的伪代码(类名与模块路径以官方仓库为准,此处只表达"输入提示视频、输出后续帧"这一调用形态):

# 伪代码:生成式世界模型的调用结构(非真实 API,接口名请以官方 README 为准)
model = load_world_model("nvidia/Cosmos-Predict1-7B")   # 加载世界基础模型
model.eval()

with torch.no_grad():
    # 输入:一段提示视频 prompt_video(+ 可选的文本/控制意图)
    # 输出:模型"想象"出的后续若干帧
    future_video = model.generate(prompt_video=prompt_video, num_frames=24)

这段结构能说明生成式路线为什么贵:每生成一帧都要过一遍主干网络,这是它难以做到实时的主要成本来源,也是 Genie 3 只开放研究预览的原因之一。

9.4 拿它评测:物理推理基准

Meta 随 V-JEPA 2 一并发布了三个测"物理理解"的基准,可以用来做横向比较:

基准测什么
IntPhys 2区分物理上可能 / 不可能的事件
MVPBench(最小视频对)用最小变化的视频问答,避免模型靠捷径答题
CausalVQA因果推理,含反事实与预期

Meta 在发布时指出,当前模型在这些基准上与人类仍有明显差距。这说明"看起来会预测"和"真的懂物理"之间还有距离。


十、避坑指南

说明
把文生视频等同于世界模型不能接受控制输入、不保证因果一致的生成模型,最多算"世界模拟器的雏形",别直接当决策组件用
用重建损失评价世界模型好坏像素重建得像,不代表对决策有用。JEPA 的立论正是建立在对重建损失的批评上,评价要看下游任务
在像素空间硬做长期预测多步 rollout 必然漂移,长程规划要在抽象空间做,或加显式的一致性约束
忽略模型误差累积在模型里"想象"得越久,偏离真实动态越远。Dreamer 用有限的想象步长控制这件事,这个超参不能随便放大
以为零样本就是不要数据V-JEPA 2-AC 的零样本,前提是 100 万小时视频预训练 + 不到 62 小时机器人数据,只是不需要目标环境的专属数据
拿 Genie 当数字孪生官方明确说明生成场景是"神似"而非地理精确,也别指望它模拟多智能体交互
假设模型学到了因果当前多数模型学的是相关性。要做反事实,必须单独设计验证,别默认它"懂物理"
把伪代码当训练脚本本文标注"伪代码"的段落只表达算法结构,直接复制进训练脚本会报错

十一、总结与展望

回到开头那个问题:世界模型到底解决了什么?

它解决的是"不真正下场,也能知道自己的动作会把世界带向哪里"。这件事对规划、策略学习、数据生成都是前置条件,所以各个方向都想用,也正因为如此,"世界模型"这个词才变得含糊。

从 2018 年到现在,三条路线各自啃下了问题的一部分:JEPA 说明预测可以不做在像素上,表征空间里的自监督学习足以支撑机器人规划;Dreamer 说明策略优化可以主要在世界模型里完成,样本效率的提升来自算法结构而非调参;Genie 说明像素级、可交互、实时的世界在工程上可行,还能直接当智能体的训练场。

接下来值得盯的是三个具体问题:潜空间模型能否把长期一致性再往上推一个量级,生成式模型能否把动作空间从"导航"扩展到"操作",以及两条路线会不会在某个中间形态上合流——比如训练期用生成式提供监督、推理期退化到潜空间。

在那之前,判断可以务实一点:别问哪个模型是"真的世界模型",而要问你的任务需要它预测什么、以什么代价预测。需要规划就看表征质量,需要控制就看 rollout 稳定性,需要数据就看生成的可控性。

参考资源

  • Ha & Schmidhuber, World Models(2018,NeurIPS):arXiv:1803.10122 + 项目页 worldmodels.github.io
  • Yann LeCun, A Path Towards Autonomous Machine Intelligence(2022,立场论文,OpenReview)
  • Meta V-JEPA 2:arXiv:2506.09985 + GitHub: facebookresearch/vjepa2 + Meta AI 官方博客
  • Google DeepMind Genie:Genie: Generative Interactive Environments(arXiv:2402.15391);Genie 2 与 Genie 3 官方博客(deepmind.google)
  • DreamerV3:arXiv:2301.04104(Mastering Diverse Domains through World Models,Nature 2025)+ GitHub: danijar/dreamerv3
  • NVIDIA Cosmos:arXiv:2501.03575 + GitHub: NVIDIA/Cosmos
  • 物理推理基准:IntPhys 2、MVPBench、CausalVQA(facebookresearch 开源)
  • 本文为概念与路线层面的梳理,涉及的数据与结论请以各机构论文、官方博客为准;文中命令与接口以对应开源仓库最新版本为准

版本记录

  • v1.2(2026-09):润色文字,降低模板感。去掉"有一句话可以概括这张表"“值得对着多看两秒”“这里要提一句”"值得记住"等套路化导语;把排比三连(“证明了…证明了…证明了”)改为行文;收敛过密加粗;打散重复的"不是 A,而是 B"句式;无信息增删,事实与结论与 v1.1 一致
  • v1.1(2026-09):复核事实与表述。修正 Dreamer 部分"策略训练完全不碰环境"的误导性说法(补明世界模型本身仍需真实交互);删除无出处的"人类准确率 85%–95%“精确数字,改为 Meta 的定性表述;修正 Genie 3 处误引"论文”(Genie 3 无论文,仅官方博客);将 Genie 3 的"不依赖显式 3D 表示"改为对公开描述的转述;澄清"Dreamer 不碰环境/不增加真实交互量"等错误结论;把 Cosmos 代码段明确标注为伪代码,去掉未经核实的类名与导入路径;补充定义不统一的说明与若干过度断言的保守化改写
  • v1.0(2026-09):首版,覆盖世界模型定义、2018 年起点、JEPA / Dreamer / Genie 三条路线、路线对比、问题总结与上手路径

关注我,持续拆解大模型与物理 AI 的关键技术——用看得懂的方式讲清原理,用能上手的路径带你入门。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐