李飞飞团队发布世界模型Atlas:扔进几张照片,生成接近现实的3D场景
2026年9月2日,AI圈被一则消息刷屏——李飞飞创办的World Labs正式发布了新一代世界模型Atlas。官方博客的标题平静地写着“Atlas: A World Model for Spatial Intelligence”,但社交媒体上早已炸开了锅:“全球首个多模态世界模型”“几张照片省掉几百个机位”“导演要失业了”……


这些标签夸张吗?也许。但Atlas所展现的能力,确实让人看到了AI从“生成画面”走向“生成世界”的质变。

Atlas生成的子弹时间画面(来源:World Labs)
一、Atlas是什么?一个能“理解空间”的AI
按照World Labs官方的定义,Atlas是一个面向空间智能的全模态世界模型(omni world model) 。它从零开始完成预训练,能够原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一套模型中完成世界生成、空间重建和时空模拟三大任务。
技术架构上,Atlas是一个多模态自回归扩散Transformer。文本、图像、视频、3D数据等各种输入都会被锚定在三维空间中,形成一个“空间上下文”(Spatial Context),然后模型根据这个上下文生成多模态输出。

类比一下大语言模型:LLM把输入编码成context,再基于context生成后续token。Atlas的流程相同,区别在于,进入context的每一张图像都被锚定在三维空间中的一个具体位置——它带着相机位姿一起进来。
换句话说,大语言模型靠“上文接下文”来理解文本,Atlas则靠“给每张图片绑死三维坐标和深度”来理解空间。这不是在画面上做文章,而是在三维空间里做文章。
二、技术:多模态自回归扩散Transformer拆解
Atlas的架构融合了大语言模型和视频生成模型两条技术线的精华。拆开来看:
多模态(Multimodal) :Atlas可以原生处理文本、图像、相机位姿、3D深度图等多种数据类型,视频被表示为图像序列。每一张图像和每一幅深度图,都对应一个明确的相机位姿。
自回归(Autoregressive) :Atlas操作的是一个由多种模态元素组成的序列,每次生成新的输出,都会以前面已经存在的序列内容作为条件。每个任务本质上只是一种不同类型的序列排列——前面是输入,后面是输出。
扩散模型(Diffusion) :Atlas采用Rectified Flow(校正流)模型,通过逐步去噪来生成输出。推理时只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。
Transformer:作为基础架构,保证了对现代硬件的适配。
这套设计让Atlas可以同时吃到LLM侧的推理优化(KV Cache、缓存感知路由、解耦式服务等)和视频侧的算法进展(扩散蒸馏、无分类器引导、移位噪声调度、先进VAE架构等)。
三、四大“炸场”能力
1. 相机控制生成:让运镜从“玄学”变“科学”
以前用视频生成模型,想在Prompt里控制镜头运动基本靠运气——“镜头缓慢向左拉升、绕着人物微仰角旋转”——回车之后全凭老天保佑。
Atlas的做法完全不同:直接把相机位姿参数当作底层原生输入。你要什么角度、什么轨迹、走多快?直接给坐标。只要丢进去1到6张普通照片,定好运镜轨迹,Atlas就能生成最长1分钟、1440p分辨率的大片。
更令人惊叹的是它的空间“脑补力”——输入一张只拍到机器人正面的照片,Atlas能把背影完整补出来;给一张泳池边角照,它能脑补出隔壁没拍到的草坪和远山。

仅凭单张图像,Atlas即可生成任意角度的视图
更惊人的是,你甚至可以往空间上下文里放两张毫不相关的参考图,指定它们在三维空间中的相对位置,Atlas会生成一个在两者之间平滑过渡的世界——它自己想象出门廊、走道和转角。

Atlas能想象出门道、走廊、角落等过渡空间,将原本不相关的画面串联起来
在盲测对比中,Atlas对竞品的胜率惊人:MiniMax H3达75%,Gemini Omni Flash达81%,阿里HappyHorse 1.1达86%,FLUX 3达93%,字节Seedance 2.5达94%——且运镜轨迹越复杂优势越大。

2. 空间重建:告别“扛设备转几十圈”
传统的3D高斯泼溅或点云扫描,需要扛着专业设备围着目标转几十圈,拍几百上千张照片。Atlas再次颠覆了这一流程——只需2到25张游客视角的地面平拍照片,就能还原出完整的3D场景。
重建结果不只是一组新的图片。Atlas可以输出点云和3D Gaussian Splatting。在DTU、ETH3D、ScanNet等公开数据集上,Atlas的稀疏视角重建误差(AbsRel ×10⁻³)达到了25.3。

World Labs官方有句精辟的总结:“The more it sees, the less it imagines.”(它看见的越多,需要“想象”的就越少。)

Atlas使用3到5个机位即可生成3D视角画面(来源:World Labs)
3. 时空模拟:让视频“可进入、可操控”
Atlas不仅能生成静态的3D世界,还能同时建模空间和时间。它可以转换已有视频的观察视角,制作戏剧性的视觉效果。
而最深远的意义在于——为机器人创建虚拟训练环境。仅需喂Atlas几张照片,它就能生成逼真的RGB和深度数据,让机器人能在更多不同的模拟空间中进行训练和测试。

拍几张地面照片,Atlas就能生成俯视图
4. 图像生成:文生图与360°全景
Atlas可以根据文字生成图片和360度全景图,能够遵循复杂提示词、渲染文字,并覆盖多种视觉风格。不过,这并非World Labs强调的主要方向。
四、理论奠基:李飞飞的“世界模型宣言”
Atlas的发布并非凭空而来。2026年6月4日,李飞飞与World Labs团队发布了一篇题为《世界模型的功能分类》的长文,系统拆解了当时被广泛使用却释义混乱的“世界模型”概念。
在这篇被媒体称为“世界模型宣言”的文章中,李飞飞提出了一个清晰的功能分类框架:
-
渲染器(Renderer) :输出供人观看的像素画面
-
仿真器(Simulator) :输出贴合客观规律的环境状态
-
规划器(Planner) :输出智能体的动作指令
她指出,当下大量被冠以“世界模型”之名的产物,内涵截然不同——能生成绚丽但物理上不可能的火焰的视频模型、能即兴创作游戏的语言模型、能精准模拟燃烧过程的物理引擎,如今都被装进“世界模型”同一个筐里。
更重要的是,她提出三类模型底层共用同一套世界知识,当前最重要的趋势是三者边界正不断消融,最终将走向能够灵活切换输出形式的大一统世界基础模型。
“语言让机器能够谈论世界。而世界模型,将让机器最终能够理解、想象、推理并与世界互动。”
Atlas正是这一理念的技术落地——它同时具备渲染(生成视频)、仿真(重建3D场景)和模拟(为机器人生成训练数据)的能力。
五、学术版图:从Atlas到PointWorld、TrAct
Atlas是World Labs的产品化成果,而在学术界,李飞飞团队同样在持续输出重磅研究。
PointWorld(CVPR 2026)是一个大规模预训练的3D世界模型,将状态和动作统一在共享的3D空间中表示为3D点流。给定一个或少量RGB-D图像和一系列低层级机器人动作指令,PointWorld能预测对应动作的逐像素3D位移。它基于约200万条轨迹、500小时的真实与模拟数据训练,推理速度达到实时(0.1秒)。单个预训练检查点即可让Franka机器人执行刚体推动、变形物体操作、关节物体控制和工具使用等任务。

TrAct(2026年8月上线arXiv)则由李飞飞与吴佳俊联手,试图打通机器人的“动作控制”和世界模型的“预测画面”之间的语言障碍。机器人控制器输出的是十几二十个低维数字(末端位姿、关节角等),而世界模型需要输出的是数百万像素的画面。TrAct的解法是在中间配一位“同声传译”——用视觉轨迹(Visual Tracks) 作为中间接口。实验结果表明,TrAct将模拟环境中的任务成功率从27%提升到55%,真实环境从49%提升到76%。

六、开源生态与社区反响
虽然Atlas本身尚未开源(仅向部分合作伙伴开放早期访问),但世界模型领域的开源生态正在蓬勃发展。
InSpatio-World是首个开源的4D世界模型,由浙江大学章国锋教授团队开发。它能将一段普通视频转化为可探索、可导航、可回溯的动态世界。其核心是“State-Anchored World Modeling”技术——锚定世界状态,确保生成结果在时空上保持一致。模型参数13亿,单GPU运行速度达24 FPS,在李飞飞牵头的WorldScore-Dynamic榜单中位列实时方法第一。项目采用Apache 2.0许可证,已在GitHub上开源(github.com/inspatio/inspatio-world)。
英伟达机器人主管Jim Fan在评价Atlas时指出:“这是机器人领域Real-to-Sim的一大步”。这一评价精准点出了Atlas乃至整个世界模型方向的战略价值——让AI不仅会“看”世界,更要会“理解”和“模拟”世界。
七、结语:从“生成画面”到“生成世界”
李飞飞曾在她的“世界模型宣言”中引用维特根斯坦的名言:“世界即所发生的一切”。她指出,大语言模型让机器学会了遣词造句和逻辑推理,但物理世界运行的底层逻辑完全不同——光线如何落在物体表面、不在相机拍摄视角下的花园是什么模样、物体受外力后如何运动。
Atlas的出现,标志着AI正在从“生成画面”走向“生成世界”。它不再满足于输出一段好看的视频,而是试图在内部构建一个可理解、可操作、可模拟的三维空间。无论是对影视创作、机器人训练,还是对AI理解物理世界这一终极目标,这都是一次值得被记录的跃迁。
正如李飞飞本人所说:“Atlas为从视觉特效到机器人的众多应用场景打开了大门”。这扇门背后,是一个AI真正开始“理解”空间的新时代。
相关资源速览:
-
Atlas官方博客:https://www.worldlabs.ai/blog/atlas
-
World Labs官网:https://www.worldlabs.ai
-
Marble体验平台:https://marble.worldlabs.ai
-
PointWorld项目:https://point-world.github.io
-
TrAct论文:https://arxiv.org/html/2608.24101v1
-
InSpatio-World开源项目:https://github.com/inspatio/inspatio-world
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)