一、概念

世界模型是人工智能构建的对外部物理世界的内在表征,模型通过学习现实世界的视觉、空间、物理规则,能够预测环境在动作作用下未来的状态变化。核心目标不是单纯生成图像 / 视频,而是理解世界的底层规律,实现智能体在虚拟环境中做规划、推理与决策。

在这里插入图片描述

人在做出行为的时候会预判行为之后的结果,是因为在人脑中进行了一定的推演。
能否让人工智能也具有这种能力?让智能体在行动之前先“看到未来”

简单理解:AI 在大脑里搭建一个虚拟世界,可以模拟事物会如何变化。

最早历史

《Dyna,An Integrated Architecture for Learning, Planning, and Reacting》

提出 Dyna 架构的设计思路:学习行动策略,同时学习 model of the world

《World Model》

世界模型
	=观察世界 vision
	 +预测世界 memory
	 +控制世界 control 

二、世界模型的三层概念分层

在这里插入图片描述

第一层:思想与范式(底层,核心理念)

Goal: Achieving human-like intelligence

包含三大核心能力:

  1. 表示世界:对外部环境建立内部抽象表征,理解物体、空间、关系;
  2. 预测未来:基于当前状态,推演行动之后环境会如何变化(想象、幻想);
  3. 在世界里规划和行动:利用预测结果,挑选动作序列,完成任务。

一句话总结:定义世界模型到底要具备什么样的智能能力,回答 “世界模型的内核是什么”

第二层:表现形式(中层,载体形态)

主题:世界生成

就是世界模型用什么载体去表达、生成这个虚拟世界:

  • 可以是视频生成模型(如 Sora,生成像素画面)
  • 可以是 3D 场景、NeRF/3DGS 场景、点云环境
  • 也可以是低维隐状态、符号化环境

一句话总结:世界模型长什么样、用什么形式来构建虚拟环境,回答 “世界模型如何具象化表达世界”

第三层:目的(顶层,应用目标)

主题:智能体训练
世界模型最终的用途:作为智能体的 “虚拟仿真沙盒”。

  • 智能体在世界模型构建的虚拟环境中试错、探索、训练;
  • 不用频繁在真实物理世界交互,大幅降低真实环境采样成本;
  • 为机器人、具身智能、自动驾驶智能体做预训练与规划。

一句话总结:世界模型用来干什么,回答 “构建世界模型最终的目标”

三、分支1:基于视频生成的世界模型

代表工作

OpenAI Sora、Google Genie

核心思路

在海量 2D 视频数据上训练,从连续帧中学习视觉时序规律、物体运动、光影变化,直接生成连贯的视频片段,以 2D 画面作为对世界的表征。

优势

  1. 训练数据充足(互联网视频资源庞大),落地速度快
  2. 输出结果为视频,人类直观可观测,评估门槛低;
  3. 擅长生成丰富的纹理、光影、动态场景。

局限性

模型学到的更多是表层视觉统计规律,偏向 “影视级画面”,不具备显式的 3D 空间几何、体积、物理参数。
无法可靠理解物体深度、遮挡关系;
缺少真实物理约束,容易出现物体结构崩坏、物理悖论;
不适合需要精确空间度量的机器人、自动驾驶任务。

四、分支2:基于 3D 生成的世界模型

代表工作

World Labs Marvel (李飞飞)

核心思路

显式建模场景的空间几何、体积、深度信息,输出带空间结构的 3D 表征(NeRF、高斯泼溅、网格等),而不是单纯 2D 像素。模型学习物体本身的空间属性与物理属性。

优势

  1. 拥有结构化的空间表征,具备真实物理基础;
  2. 可以精确得到物体尺寸、位置、遮挡、体积;
  3. 适配机器人抓取、自动驾驶、具身智能等任务 —— 这类任务必须依靠精准空间理解做规划。

局限性

  1. 高质量 3D 标注数据稀缺,采集成本远高于普通视频;
  2. 渲染、重建 3D 场景计算开销巨大,算力成本高;
  3. 生成完整大场景的速度较慢,可视化结果的纹理细节有时弱于视频模型。

五、分支2-2:杨立昆的JEPA

出自杨立昆 2022 年《A Path Towards Autonomous Machine Intelligence》,定位是构建世界模型(World Model)的核心自监督学习框架,用来和自回归 LLM、像素重建类生成模型做路线对抗。
在这里插入图片描述

1. 对现有生成式范式的批判

  • 无论是自回归预测 token,还是 MAE、扩散模型重建像素:强迫模型预测大量无关、随机的底层细节(噪声、纹理、微小光影),浪费算力;
  • 像素 / Token 空间预测会学到 “平均模糊”,难以捕捉世界的抽象因果结构;
  • 这类模型很难做多步规划、物理常识推理,只学到表面统计关联,不是对世界的内在理解。

一句话:预测像素 / 原始信号是不必要;智能不需要重建所有细节,只需要预测对决策有用的抽象状态。

2. JEPA 最核心思想:在嵌入(表征)空间做预测,而不是原始信号空间

1.用编码器把观测(当前帧 / 当前片段)x、待预测目标(未来帧 / 被遮挡区域)y分别编码成抽象嵌入 (s_x, s_y);
2.训练预测器:从(s_x)预测(s_y),损失只作用在嵌入向量上,永远不重建像素、token 等原始数据Meta AI;
3.模型自动过滤掉无关细节,只学习场景的语义、几何、因果、物理结构

3. 天然支持世界的不确定性

现实世界一个状态后面可以有多种合理未来,不是单一确定结果。JEPA 可以用隐变量建模多种可能的抽象未来表征,不会像像素生成那样被迫输出模糊平均值,适配物理世界的多可能性推演,为规划做基础Meta AI。

4. 学习目标:得到可用于规划与推理的世界模型

JEPA 不是一个端到端生成模型,它的目标是学习一个内部世界模型:

  • 能预测动作带来的抽象后果;
  • 智能体可以在这个表征空间里做想象、搜索、规划;
  • 这是类动物 / 人类智能的基础:人脑中想象未来,并不会脑补每一个像素细节,只推演关键状态变化。

5. 配套的完整自主智能系统设想(杨立昆更大框架)

JEPA 只是其中「世界模型」模块,整套系统包含感知、世界模型、代价模块、行动器、短期记忆、配置器六个可微模块;AI 通过世界模型预测行动后果,基于代价函数做规划决策,而不是靠海量文本的下一个 token 预测GitHub。

6. 和对比学习的区别

对比学习:拉近相似样本、推开不相似样本,目标是匹配表征
JEPA:在表征空间做条件预测,捕捉不同时刻 / 不同视图之间的因果依赖关系,能力更强,适合时序、视频、机器人场景。

极简一句话总结 JEPA 核心

不预测像素,只预测抽象语义表征;让模型学习世界内在结构,构建可规划推理的世界模型,作为 LLM 之外通往自主智能的另一条路线。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐