世界模型到底是什么?一文理清Sora、3DGS与JEPA三条技术路线
一、概念
世界模型是人工智能构建的对外部物理世界的内在表征,模型通过学习现实世界的视觉、空间、物理规则,能够预测环境在动作作用下未来的状态变化。核心目标不是单纯生成图像 / 视频,而是理解世界的底层规律,实现智能体在虚拟环境中做规划、推理与决策。

人在做出行为的时候会预判行为之后的结果,是因为在人脑中进行了一定的推演。
能否让人工智能也具有这种能力?让智能体在行动之前先“看到未来”
简单理解:AI 在大脑里搭建一个虚拟世界,可以模拟事物会如何变化。
最早历史
《Dyna,An Integrated Architecture for Learning, Planning, and Reacting》
提出 Dyna 架构的设计思路:学习行动策略,同时学习 model of the world
《World Model》
世界模型
=观察世界 vision
+预测世界 memory
+控制世界 control
二、世界模型的三层概念分层

第一层:思想与范式(底层,核心理念)
Goal: Achieving human-like intelligence
包含三大核心能力:
- 表示世界:对外部环境建立内部抽象表征,理解物体、空间、关系;
- 预测未来:基于当前状态,推演行动之后环境会如何变化(想象、幻想);
- 在世界里规划和行动:利用预测结果,挑选动作序列,完成任务。
一句话总结:定义世界模型到底要具备什么样的智能能力,回答 “世界模型的内核是什么”。
第二层:表现形式(中层,载体形态)
主题:世界生成
就是世界模型用什么载体去表达、生成这个虚拟世界:
- 可以是视频生成模型(如 Sora,生成像素画面)
- 可以是 3D 场景、NeRF/3DGS 场景、点云环境
- 也可以是低维隐状态、符号化环境
一句话总结:世界模型长什么样、用什么形式来构建虚拟环境,回答 “世界模型如何具象化表达世界”。
第三层:目的(顶层,应用目标)
主题:智能体训练
世界模型最终的用途:作为智能体的 “虚拟仿真沙盒”。
- 智能体在世界模型构建的虚拟环境中试错、探索、训练;
- 不用频繁在真实物理世界交互,大幅降低真实环境采样成本;
- 为机器人、具身智能、自动驾驶智能体做预训练与规划。
一句话总结:世界模型用来干什么,回答 “构建世界模型最终的目标”。
三、分支1:基于视频生成的世界模型
代表工作
OpenAI Sora、Google Genie
核心思路
在海量 2D 视频数据上训练,从连续帧中学习视觉时序规律、物体运动、光影变化,直接生成连贯的视频片段,以 2D 画面作为对世界的表征。
优势
- 训练数据充足(互联网视频资源庞大),落地速度快;
- 输出结果为视频,人类直观可观测,评估门槛低;
- 擅长生成丰富的纹理、光影、动态场景。
局限性
模型学到的更多是表层视觉统计规律,偏向 “影视级画面”,不具备显式的 3D 空间几何、体积、物理参数。
无法可靠理解物体深度、遮挡关系;
缺少真实物理约束,容易出现物体结构崩坏、物理悖论;
不适合需要精确空间度量的机器人、自动驾驶任务。
四、分支2:基于 3D 生成的世界模型
代表工作
World Labs Marvel (李飞飞)
核心思路
显式建模场景的空间几何、体积、深度信息,输出带空间结构的 3D 表征(NeRF、高斯泼溅、网格等),而不是单纯 2D 像素。模型学习物体本身的空间属性与物理属性。
优势
- 拥有结构化的空间表征,具备真实物理基础;
- 可以精确得到物体尺寸、位置、遮挡、体积;
- 适配机器人抓取、自动驾驶、具身智能等任务 —— 这类任务必须依靠精准空间理解做规划。
局限性
- 高质量 3D 标注数据稀缺,采集成本远高于普通视频;
- 渲染、重建 3D 场景计算开销巨大,算力成本高;
- 生成完整大场景的速度较慢,可视化结果的纹理细节有时弱于视频模型。
五、分支2-2:杨立昆的JEPA
出自杨立昆 2022 年《A Path Towards Autonomous Machine Intelligence》,定位是构建世界模型(World Model)的核心自监督学习框架,用来和自回归 LLM、像素重建类生成模型做路线对抗。

1. 对现有生成式范式的批判
- 无论是自回归预测 token,还是 MAE、扩散模型重建像素:强迫模型预测大量无关、随机的底层细节(噪声、纹理、微小光影),浪费算力;
- 像素 / Token 空间预测会学到 “平均模糊”,难以捕捉世界的抽象因果结构;
- 这类模型很难做多步规划、物理常识推理,只学到表面统计关联,不是对世界的内在理解。
一句话:预测像素 / 原始信号是不必要;智能不需要重建所有细节,只需要预测对决策有用的抽象状态。
2. JEPA 最核心思想:在嵌入(表征)空间做预测,而不是原始信号空间
1.用编码器把观测(当前帧 / 当前片段)x、待预测目标(未来帧 / 被遮挡区域)y分别编码成抽象嵌入 (s_x, s_y);
2.训练预测器:从(s_x)预测(s_y),损失只作用在嵌入向量上,永远不重建像素、token 等原始数据Meta AI;
3.模型自动过滤掉无关细节,只学习场景的语义、几何、因果、物理结构。
3. 天然支持世界的不确定性
现实世界一个状态后面可以有多种合理未来,不是单一确定结果。JEPA 可以用隐变量建模多种可能的抽象未来表征,不会像像素生成那样被迫输出模糊平均值,适配物理世界的多可能性推演,为规划做基础Meta AI。
4. 学习目标:得到可用于规划与推理的世界模型
JEPA 不是一个端到端生成模型,它的目标是学习一个内部世界模型:
- 能预测动作带来的抽象后果;
- 智能体可以在这个表征空间里做想象、搜索、规划;
- 这是类动物 / 人类智能的基础:人脑中想象未来,并不会脑补每一个像素细节,只推演关键状态变化。
5. 配套的完整自主智能系统设想(杨立昆更大框架)
JEPA 只是其中「世界模型」模块,整套系统包含感知、世界模型、代价模块、行动器、短期记忆、配置器六个可微模块;AI 通过世界模型预测行动后果,基于代价函数做规划决策,而不是靠海量文本的下一个 token 预测GitHub。
6. 和对比学习的区别
对比学习:拉近相似样本、推开不相似样本,目标是匹配表征;
JEPA:在表征空间做条件预测,捕捉不同时刻 / 不同视图之间的因果依赖关系,能力更强,适合时序、视频、机器人场景。
极简一句话总结 JEPA 核心
不预测像素,只预测抽象语义表征;让模型学习世界内在结构,构建可规划推理的世界模型,作为 LLM 之外通往自主智能的另一条路线。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)