拍一张照,AI替你补出整个世界;扫一遍墙,机器人就能在里面自主导航。这不是科幻,是上周刚刚发布的Atlas。

想象一个场景:你用手机随手拍了张家里客厅的照片,然后把它丢给一个AI。

几秒后,它不仅"看懂"了照片里的空间——它还把整个房间的背面、侧面、俯视角,全部凭空生成出来了。连你沙发背后那一块从未入镜的墙,它都猜得八九不离十。

再进一步:它把你的客厅变成了一个可以让机器人在里面自主行走的3D模拟环境。机器人的摄像头视角、物体的碰撞边界、地板的材质反光——全都有。

图片

你没有买任何设备。你没有用专业相机。你只拍了一张照片。

这不是某个渲染软件在"合成"画面——AI真的理解了这个空间存在的逻辑,然后把没拍到的部分,想象出来了。

01

PART

AI 下一个大战场

空间智能

这就是World Labs上周发布的Atlas。而World Labs的创始人,是李飞飞——ImageNet 教母,斯坦福AI实验室前主任,被很多人认为是当代最重要的AI科学家之一。

过去几年,我们见证了语言AI的爆炸式增长。GPT、Claude,一个比一个能聊、能写、能推理。但有一件事它们始终做不好:

它们看不懂空间。

给它们一张照片,它们能描述里面有什么;但你问它"镜头往左移30度,画面会变成什么"——它蒙了。它没有空间感,没有三维的概念,它活在一个没有深度的世界里。

这不是小问题。因为现实世界的几乎所有物理任务,都发生在三维空间里:

  • 机器人

    要在现实场景里行动,它必须理解空间。它需要知道障碍物在哪、路径怎么走、抓取点在哪个角度。

  • 影视与游戏

    虚拟拍摄、实时渲染、特效合成——整个行业在等一个能真正懂3D的AI。

  • 建筑与设计

    从图纸到空间,从照片到可交互模型,这条链路需要真正的空间理解。

  • 科学仿真

    药物分子、材料结构、物理场景——模拟世界,需要AI先学会理解世界。

李飞飞在创立World Labs时说了一句话,大意是:语言只是智能的一部分,空间理解才是智能真正的根基。人类婴儿学会说话之前,先学会的是看和感知三维世界。

Atlas,就是她对这个判断押下的一注。

02

PART

世界模型 Atlas 能做什么

人话版本

官方技术文档说Atlas是"多模态自回归扩散Transformer"。这句话90%的人看了没感觉。我们换一种方式讲。

Atlas的核心能力,可以用四个场景来理解:

场景一:一张照片,长出一个世界

你给Atlas一张图,它帮你"补全"这张图背后隐藏的整个三维空间。

传统AI视频生成

你输入"镜头向左移",它猜一个大概的画面,经常穿帮、变形、逻辑错乱。你控制不了它要往哪走,更像在拉老虎机。

ATLAS 的方式

你输入精确的摄像机参数——角度、位移、焦距。Atlas把这些当作原生输入,生成的画面和原始图片的三维结构严丝合缝。你是导演,不是赌徒。

在官方测试里,他们让人类评分员比较Atlas和其他顶级视频模型的镜头跟随能力。结果是:

对战 Seedance 2.5 94% 选择 Atlas

对战 FLUX 3 93% 选择 Atlas

对战 Happy Horse 1.1 86% 选择 Atlas

对战 Gemini Omni Flash 81% 选择 Atlas

图片

关键数字

相机路径越复杂,Atlas的优势越大。这说明它真的在"理解"三维空间,而不是在用统计规律"猜"画面。

场景二:随手几张照片,还原现实场景

给Atlas两三张普通照片,它能重建出这个场景的三维结构——包括你从没拍到的角度、高空俯视的样子、甚至地下室的猜测。

他们用斯坦福大学的主广场做了个演示:从地面视角,只给了25张普通照片。Atlas生成了从高空俯瞰整个广场的飞行画面,教堂、草坪、建筑群的空间关系全对了。

这件事有多难?3D重建是计算机视觉里研究了几十年的"老大难"问题。过去的方案要么需要特殊设备,要么需要成百上千张密集拍摄的照片,还要复杂的后处理。Atlas用几张手机照片,就超越了那些专门为3D重建训练的专用模型。

图片

 场景三:用三部手机,拍出"子弹时间"

还记得《黑客帝国》里那个经典的"子弹时间"镜头吗?时间静止,摄像机围着人物旋转360度。那个效果,当年要用100多台相机同时拍摄,再合成。

World Labs的工程师们,用3到5部普通手机,加上夹子和三脚架,重现了这个效果。

不需要专业摄影师,不需要专用设备,一个背包就能装下整套"拍摄系统"。

Atlas从三到五个视角的视频中,重建出完整的空间结构,然后允许你在任意角度重新播放这段时间。时间冻结,镜头自由移动——这就是"时空仿真"。

场景四:用手机扫一遍,给机器人造一个训练世界

这个场景,可能是Atlas最有颠覆性的应用。

训练机器人需要大量的模拟环境。以前,搭建一个真实感强的机器人仿真场景,需要专业设备扫描、手工建模、大量标注,耗时数周,成本极高。

Atlas的方案:用手机录一段视频,24帧,扫完整个房间。Atlas自动重建出高保真的三维场景,然后——机器人就可以在里面导航了。不仅如此,Atlas还能生成机器人身体摄像头视角的图像,模拟抓取、移动、交互,甚至允许你随意修改场景里的物体位置、光照、背景。

03

PART

这意味着什么?

模型框架

机器人的"老师",从昂贵的现实实验,变成了AI生成的虚拟世界。训练数据的规模可以指数级扩张,成本却断崖式下降。这是让机器人真正走进家庭和工厂的关键一步。

它是怎么做到的——那句"多模态自回归扩散Transformer"拆解

好,我们现在可以聊点技术了。但我们不用黑板,用厨房。

想象一个极其厉害的厨师。他同时精通中餐、日料、法餐——他不是三个厨师,是同一个人。他理解的是"食物和烹饪"本身的逻辑,而不是某一种菜系的死记硬背。

图片

Atlas就是这样一个"全能厨师"。

  • 多模态(Multimodal)

    Atlas能同时处理文字、图片、视频、3D深度图、摄像机姿态——这些都是它的"食材"。关键是,它把所有这些输入统一放进一个"空间上下文"里处理,而不是分开走不同的管道。

  • 自回归(Autoregressive)

    每一步输出,都以之前所有输出为条件。就像写文章时,你脑子里始终记着前面写了什么。Atlas生成画面的每一帧,都"记得"整个空间的三维逻辑。

  • 扩散(Diffusion)

    生成过程是从噪声逐步"去噪"到清晰图像,天然擅长处理图像和视频这种高维连续数据,而且可以灵活权衡速度和质量。

  • Transformer架构

    大模型的标准底座,擅长处理并行计算,能充分利用现代GPU的算力,也更容易受益于未来的工程优化。

最关键的创新,是空间上下文(Spatial Context)这个概念。

图片

普通的大语言模型有"上下文"——它记住你们聊了什么。Atlas把这个概念扩展到三维空间:每一张输入图片,都被锚定在三维坐标里,形成一个空间地图。Atlas根据这张"空间地图"来生成新视角——而不是靠猜。

规模定律也成立

更大的训练计算量 → 更强的能力。团队在开发过程中训练了一系列越来越大的模型,每一代都有可观的能力跃升。这意味着Atlas还有巨大的提升空间——它只是刚刚开始

04

PART

与你的关系

AI 与物理世界结合

如果你是工程师,你可能已经在想:这东西能接API吗?

答案是:Atlas现在在早期访问阶段,开放了API接入申请,并且有一个叫Spark的JavaScript SDK正在开发中。换句话说,这不是一个PPT里的概念,是一个可以接的工具。

如果你不写代码,但你用手机拍视频、做内容,或者只是对"AI能做什么"感到好奇——你也值得理解这件事的意义:

三年前的AI视频生成

输入文字,它吐出一段模糊的、经常前后不一致的、你完全控制不了的视频。像对着自动贩卖机乞讨。

图片

现在的ATLAS

输入照片或视频,精确控制摄像机路径,生成的画面里有真实的三维逻辑。你是在导演一部电影,不是在开盲盒。

我们正在从"AI帮你生成内容",走向"AI帮你理解和重建现实世界"。这是两个完全不同的量级。

一个能理解空间的AI,意味着什么?

意味着你家里的扫地机器人不再只是在地板上画圈,它真的知道沙发在哪。意味着建筑设计师可以用手机扫一遍工地,直接得到精确的三维模型。意味着偏远地区的医疗影像,可以被AI从少量图片中重建出三维结构,辅助诊断。

意味着,机器人进入家庭的时间线,可能要提前了。

图片

05

PART

李飞飞的赌注

AI 空间感知能力

李飞飞20年前坚持做ImageNet——那时候所有人觉得她在浪费时间,数据集有什么用?后来,ImageNet直接引爆了深度学习革命。

现在,她把空间智能定义为"AI的下一个核心战场"。她的判断是:语言只是人类智能的一小部分,真正的智能来自于与物理世界的交互。

图片

而交互,需要空间感。

Atlas是她这个判断的第一个大规模兑现。它不只是一个生成视频的工具,它是一个真正理解"世界如何运作"的模型——能生成世界、重建世界、也能仿真世界。

值得关注的问题

Atlas目前还在早期访问阶段,还没有向公众全面开放。规模化部署的成本、生成速度、以及对复杂真实场景的泛化能力,都还需要时间验证。但这个方向,几乎所有人都在押注——OpenAI、Google、Meta,都在做类似的事。World Labs能不能在这场竞争里站稳脚跟,值得持续关注。

AI正在重新学习看这个世界

从语言,到图像,到视频,再到三维空间——每一步,AI都在更接近真实的物理世界。Atlas不是终点,是一个信号:空间智能的时代,已经开始了。

更多transformer,VIT,swin tranformer
参考头条号:人工智能研究所
v号:人工智能研究Suo, 启示AI科技

 动画详解transformer  在线视频教程


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐