李飞飞团队发布世界模型Atlas:AI开始“预测新视角“,空间智能时代要来了?
当全行业还在比拼"谁能预测下一个Token"时,李飞飞团队已经换了一条赛道:不预测文字,不预测画面,而是预测"你换个角度看世界,会看到什么"。
9月1日,由"AI教母"李飞飞创办的空间智能公司World Labs发布了新一代世界模型Atlas,官方称之为"全球首个多模态世界模型"。这个模型想用同一个基础模型,同时完成视频生成、3D重建和时空模拟三件事,把AI从"看懂世界"推向"理解空间"。
一、从"预测Token"到"预测新视角"
大语言模型的核心是预测下一个Token,视频生成模型的核心是预测下一帧画面,而Atlas的核心动作只有一个:换一个位置,继续看。给它几张照片,它要理解这些画面在空间里是什么关系,然后告诉你——从另一个位置看过去,世界应该长什么样。
这种能力被李飞飞团队称为"新视角预测"(New View Prediction),被看作是通往空间智能的终极原语。空间智能,就是AI对三维世界的理解能力:物体在哪里、彼此什么关系、从别的角度看会是什么样。这是人类与生俱来的能力,却是AI长期缺失的一块。
二、从零训练:不走视频模型的"老路"
与很多人预想的不同,Atlas并不是在现有视频模型或3D模型上改造而来的。World Labs从零开始对它进行预训练,让文本、图像、视频和3D数据从训练起步阶段就融合在一起,最终共享同一个"空间上下文"。
技术上,Atlas采用多模态自回归扩散Transformer架构。它能够借助共享的空间上下文,在三维空间中与已见信息保持连贯一致,甚至能"推想"视野之外的内容——也就是说,哪怕你只看到房间的一角,它能补全整个空间的想象。
三、机器人训练场:两段手机视频就够了
Atlas最落地的应用方向之一,是机器人仿真训练。传统机器人训练往往需要昂贵的3D扫描建模,而World Labs的演示显示:用两段手机视频,每段只取24帧,就能重建两处大型空间,再让不同机器人沿不同路线在其中移动,生成机器人第一视角的画面和深度信息。
这意味着,把现实环境快速搬进仿真系统,门槛被大幅降低了。灯光、物体、摆放位置和机器人视角,都能从一段普通视频里"长"出来,机器人训练的成本和速度有望迎来质变。
四、世界模型,为什么值得如此关注?
世界模型,简单理解就是让AI在"头脑里"建立一个关于世界的模型:理解了规则,才能预测下一步会发生什么。这也是为什么业界认为世界模型是通往AGI的核心能力之一。
李飞飞在a16z的对谈中多次强调"空间智能"。Atlas发布后,国内外对世界模型的押注明显加速:OpenAI的Sora 2.0在做物理级视频生成,xAI推出可模拟城市交通与工业产线的世界模型,国内也有团队沿着"从真实世界起步"的路线反向逼近通用世界模型。无论是云端大模型还是端侧芯片,都开始把"空间理解"当作新的兵家必争之地。
总结
从预测Token到预测下一帧,再到预测新视角,AI的学习目标正在从"语言逻辑"向"物理世界"进发。Atlas未必是终点,但它标志着一个清晰的分水岭:AI不再满足于"像人一样说话",而是开始学着"像人一样看世界"。空间智能,很可能就是下一代AI的主战场。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)