【AI 前沿】李飞飞 World Labs 发布 Atlas:多模态世界模型,几张照片即可生成可交互 3D 世界

摘要:9 月 1 日,李飞飞创立的 World Labs 正式发布新一代世界模型 Atlas——一个「多模态自回归扩散 Transformer」架构的全能模型,官方 slogan 是「建模世界,移动相机,模拟空间和时间」。官方宣称它是「全球首个多模态世界模型」:仅凭几张图片就能生成带像素级相机控制的 1 分钟 1440p 视频,用几张照片重建可探索的 3D 场景并输出点云/3D Gaussian 显式表示,还能为机器人模拟出训练所需的 RGB 与深度数据。本文带你读懂 Atlas 是什么、它和 Sora 这类视频生成模型有何本质区别,以及它为何被视为具身智能 Real-to-Sim 的关键一步。


一、背景:为什么「世界模型」突然火了?

过去两年我们熟悉的 AI 视频生成(Sora、可灵、Runway……)本质上是像素预测:模型学会「下一帧长什么样」,但未必理解画面背后的几何关系、物理规律和空间结构——相机不动还好,一旦要求复杂运镜,画面常常变形穿帮。

世界模型(World Model)想解决的是另一件事:让模型理解「世界本身」。2026 年 6 月,李飞飞亲自下场定义世界模型的三个层次:

类型角色通俗理解
渲染器 Renderer生成画面画得好看
规划器 Planner决定行动想得清楚
模拟器 Simulator建模世界规律世界本身怎么运转

李飞飞明确指出:最关键的是模拟器——它承担世界本身的几何、物理与动力学,是渲染和行动共同依赖的基础。这也是她创办的 World Labs 一路加码的方向:7 月收购机器人仿真公司 SceniX,7 月底公开 Real-to-Sim-to-Real 系统,9 月初 Atlas 正式亮相。

World Labs 是谁? 李飞飞(“AI 教母”、斯坦福教授)2024 年创办的"空间智能"公司,目标是构建能感知、生成、推理并与 3D 世界交互的模型。公司累计融资 12.3 亿美元:2024 年成立轮 2.3 亿美元(a16z、英伟达等),2026 年 2 月追加 10 亿美元轮(英伟达、AMD、富达、Autodesk——其中 Autodesk 单笔 2 亿美元,其 AutoCAD/Maya/Revit 产品线直接对应建筑与影视市场)。资本结构本身就是行业信号:芯片厂商 + 设计软件巨头同时押注同一家世界模型公司。

二、Atlas 是什么:一张图说清定位

Atlas 是 World Labs 于 2026 年 9 月 1 日发布的新一代世界模型,官方以「全球首个多模态世界模型」自居(注意:这是官方宣称口径,尚待独立验证)。它的官方 slogan 直白地划出了与普通视频生成的边界:

建模世界(Model worlds),移动相机(Move cameras),模拟空间和时间(Simulate space and time)。

一句话概括:Atlas 不是在学习「下一帧」,而是在学习「一个可移动相机观察的三维世界」。

李飞飞本人将其视作 World Labs 的「里程碑式」成果,并在社交平台置顶;英伟达机器人主管 Jim Fan 评价其为「机器人领域 Real-to-Sim 的一大步」。

三、核心能力:四大金刚

3.1 相机控制生成(Camera-Control Generation)

输入 1~6 张图片并指定相机轨迹(推近、环绕、摇移……),Atlas 就能生成带像素级相机控制的视频,最长 1 分钟、1440p 分辨率

与传统视频生成的关键差异:这里不是「AI 自己挑运镜」,而是你指定相机路径,模型按轨迹渲染出空间一致的结果——因为相机几何(位姿)是模型的原生输入类型,而不是靠文本提示「转个镜头」去猜。官方自报的评测中,相机轨迹越复杂,Atlas 相对传统视频模型的优势越明显。

3.2 空间重建(Spatial Reconstruction)

基于输入图像,Atlas 可以重建真实世界场景——典型场景用 2~3 张图即可保真,官方表示最多可接受 100+ 张输入(看得越多、想象越少)。它能做到:

  • 生成新视角下的图像帧;
  • 输出显式 3D 表示——点云 / 3D Gaussian Splats(官方说明:与 World Labs 的 Marble 采用同一套 3D 表示,便于与生态产品自然集成)。

官方演示还包括:斯坦福校园仅用 2~25 张地面照片就能生成航拍视角路径;3~5 台手机相机拍摄同一场景即可做出「子弹时间」环绕效果。

3.3 时空模拟(Space-Time Simulation)

输入一段视频,Atlas 能同时建模其中的空间与时间:转换已有视频的观察视角、制作戏剧性的运镜效果——相当于给已有素材一个「虚拟导演」。

3.4 图像生成(Image Generation)

文本 → 图片与 360° 全景图;能遵循复杂 Prompt、准确渲染画面中的文字,并覆盖大量不同视觉风格。

官方特意强调:图像生成并非 Atlas 的主攻方向——它只是「每个图像都是一扇通往可能世界的窗口」的自然副产品,真正的重点是世界建模。

四、技术拆解:多模态自回归扩散 Transformer

Atlas 的技术架构值得单独展开——它把大语言模型与扩散模型的思路做了统一。

4.1 多模态:一切锚定在三维空间

Atlas 原生处理多种数据类型:文本、图像、相机位姿、3D 深度图。视频被表示为「图像序列」,且每一张图像和每一幅深度图都对应一个明确的相机位姿

关键设计:所有输入都会被锚定在三维空间中,形成空间上下文(spatial context),模型再基于该上下文生成多模态输出。这也是「世界模型」和「视频模型」最本质的分野——空间是模型的先验,而不是像素的附庸

4.2 自回归:一切任务都是「序列」

Atlas 操作的是由元素组成的序列,每个元素可以属于任意模态。生成每个新输出时,都以序列中已有的内容为条件。

这种设计的妙处:每种任务本质上都是一种不同类型的序列——前面是输入、后面是输出。拍照补全 3D 是序列,视频运镜是序列,文本生图也是序列。统一了任务范式,自然就能在一个模型里支持多任务。

4.3 扩散:Rectified Flow 生成

Atlas 是一个 Rectified Flow(校正流) 潜空间扩散模型,通过逐步去噪生成输出。扩散模型擅长建模图片/视频这类高维连续数据;推理时只需调整去噪步数,即可在速度与质量之间自由权衡

4.4 Transformer:稳健底座 + 双生态复用

Transformer 在世界模型领域已被证明是稳健架构。而 Atlas 的工程实现同时吃到了两个生态的红利:

  • LLM 生态:KV Cache、缓存感知路由、解耦式服务等推理加速技术;
  • 生成模型生态:扩散蒸馏、无分类器引导(CFG)、移位噪声调度、更先进的 VAE。

4.5 评测与 Scaling

研究团队在两大关键任务上做了定量评估(以下为 World Labs 自报数据,供参考):

相机控制生成——人类评分胜率(Atlas 胜出比例,越高越好):

对比基线Atlas 胜率
MiniMax H375%
Gemini Omni Flash81%
Happy Horse 1.186%
FLUX 393%
Seedance 2.594%

稀疏视角 3D 重建——平均 AbsRel 点图误差(官方口径 ×10⁻³,越低越好;评测集含 DTU/ETH3D/KITTI 等):

模型AbsRel 误差(×10⁻³)
Atlas25.3
Pi3X28.7
π³ (Pi3)34.7
VGGT-Ω 1B36.4
Depth Anything 339.3
MapAnything47.7

需要说明:以上基准是官方自报(第三方人类评分 + 官方自行复现的对比基线);Atlas 的参数量、训练数据与算力规模目前均未见公开。但官方强调,Atlas 从设计之初就为 Scaling 做好准备——团队表示已观察到能力随规模扩大继续提升的有利证据。

五、杀手级应用:给机器人造训练场

Atlas 最受关注的应用落在**具身智能(Embodied AI)**上。机器人行业的最大瓶颈是:缺乏廉价、可控、可规模化的训练经验——真实机器人数据采集成本极高,且难以覆盖多样场景。

Atlas 打通了这样一条路径:

真实照片/视频
   │  输入几张照片
   ▼
3D 空间重建(显式 3D 表示)
   │
   ▼
机器人传感器视图(逼真 RGB + 深度数据)
   │
   ▼
多样化的可变化模拟环境 = 训练场

只需给 Atlas 几张照片,它就能生成逼真的 RGB 和深度数据,机器人得以在更多不同的模拟空间中训练和测试——这正是英伟达 Jim Fan 所说的 Real-to-Sim(真实到仿真)一大步,也是李飞飞团队 7 月底发布的 Real-to-Sim-to-Real 系统闭环的关键一环。

对影视行业同样意义重大:传统特效需要数百个机位采集、人工建模,而 Atlas 用几张照片就能补全可探索的三维场景——「几张照片替代数百机位」的说法由此而来。

六、行业视角:空间智能派的底气与冷静声音

把 Atlas 放回行业坐标系,更能看清它的位置。当前"理解世界"有三条技术路线之争:

路线代表主张
生成派OpenAI Sora(自称"世界模拟器")大规模视频像素预测可习得物理规律
表征派Yann LeCun(I-JEPA/V-JEPA)生成式预测是"像素幻觉",应预测抽象状态表征
空间智能派World Labs(Marble/Atlas)构建持久、可编辑、物理一致的显式 3D 空间

批评者常指出:Sora 能生成连贯视频,却无法响应动作干预——更像"概率记忆"而非因果建模;而 Atlas 把相机位姿当原生输入、输出显式 3D 表示,正是冲着"机器可用(可测量)"去的。但 Atlas 想够到自家分类里的"模拟器"一级(须维护世界状态、含物理、供外部程序读写),目前公开评测只覆盖了相机条件生成与 3D 重建——流体、布料等复杂物理仍是全行业未解难题。

学界也有冷静声音:MIT CSAIL 场景表示组负责人 Vincent Sitzmann 今年 7 月对媒体表示,"像素训练通向物理智能"仍是一个赌注,远未尘埃落定。

七、现在能用吗?与生态的关系

  • 访问:Atlas 目前处于早期访问(early access)阶段,优先面向合作伙伴;官方博客也开放了「Request early access」申请入口,开发者可提交申请等待联系(个人用户尚无法直接体验,具体开放节奏以官方公告为准)。
  • 生态定位:World Labs 官方表示,Atlas 将成为未来版 Marble 以及 World Labs 其他产品的底层模型——它更像是「地基」,而不是一个孤立 demo。World Labs 此前产品线:2025 年 10 月发布学习式渲染器 RTFM,2025 年 11 月推出首款商用产品 Marble(文本/图像生成可探索 3D 世界,3D Gaussian 渲染、可导出游戏引擎),2026 年 1 月推出 World API 开发者通道。

八、总结

  1. Atlas 是 World Labs 于 2026-09-01 发布的新一代世界模型,定位从「生成视频」升级到「生成可观察的世界」(「全球首个多模态世界模型」为官方宣称);
  2. 架构上是多模态自回归扩散 Transformer:空间锚定 + 序列化任务 + Rectified Flow 生成 + Transformer 底座,从零预训练;
  3. 四大能力:像素级相机控制生成(1 分钟 1440p)、空间重建(点云/3D Gaussian)、时空模拟、图像/全景图生成;
  4. 官方自报评测领先:相机控制人类评分胜率 75%~94%,3D 重建误差低于多个专业基线(参数量/训练规模未公开);
  5. 最大价值在具身智能:为机器人 Real-to-Sim 提供廉价可规模化的训练场,也降低影视三维场景制作门槛。

世界模型赛道刚拉开帷幕——Atlas 之后,空间智能会如何改变内容生产与机器人行业,值得持续关注。


参考链接


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐