世界模型混战:从李飞飞到字节京东,谁能先落地?
2026年9月,世界模型赛道突然变得拥挤。
高德发布3D原生城市世界模型ABot-Earth 0.7,京东开源实时可交互世界模型JoyAI-Echo WM,李飞飞的World Labs推出多模态世界模型Atlas,字节跳动被曝由张一鸣亲自督军筹备实时空间视频生成模型,宇树科技则用世界-动作大模型让机器人完成了全自主搏击。
密集的发布节奏,让“世界模型谁能先落地”成为一个绕不开的问题。
一个概念,多种解法
这些公司口中的“世界模型”,指向的并非同一件事。
李飞飞的Atlas,核心是“空间智能”。它不再只生成二维画面,而是将相机位姿和三维深度信息作为原生输入,在统一的空间上下文中处理文本、图像和视频。官方演示中,仅用2到25张普通照片即可重建斯坦福Main Quad的完整三维场景,并生成任意视角的漫游视频。目标落地场景包括影视制作、游戏原型、数字孪生和机器人仿真训练。World Labs将其定位为“全球首个多模态世界模型”,部分合作伙伴已获得抢先体验资格。
字节跳动的项目,关键词是“实时”和“低延迟”。据报道,该模型基于视频生成模型Seedance构建,目标是在每秒20帧下实现约0.05秒的低延迟,让用户通过语音或动作实时创建可交互的3D虚拟世界。张一鸣将该空间视频模型视为一个“飞轮”,一端连接字节大模型和云计算资源,另一端则是抖音等内容平台及VR硬件Pico。世界模型被列为字节AI全年四大命题之首,但知情人士也透露,发布时机尚不确定,相关计划可能调整。
宇树科技的UnifoLM-X2-1.0,走的是“世界-动作”路线。其展示的人形机器人全自主搏击,全程未依赖外部遥控或预设脚本,验证了世界模型驱动机器人实时预测、规划和动态交互的可行性。这是宇树补齐“大脑”短板的关键信号。王兴兴提出的具身智能“ChatGPT时刻”标准是“在80%的陌生环境中完成80%的任务”,目前远未达到。
京东的JoyAI-Echo WM,强调“实时可交互”。模型能根据用户视角变化持续生成世界,并同步生成720P视频和环境音、语音,支持第一/第三人称及多轮连续交互。在WBench Navigation评测中,EchoWM与四步因果流式版本位列前两名。
高德的ABot-Earth 0.7,本质是地图的升维。输入一张卫星图像或一段文字描述,模型仅用10分钟即可在一块消费级GPU上生成公里级3D城市场景,效率比传统模式提升1000倍。高德扫街榜宣布梅赛德斯-奔驰成为全球首个汽车合作伙伴,生态合作已经启动。
炒作与务实并存
“世界模型”概念确实存在被滥用和透支的风险。当前该领域缺乏统一的学术定义,导致“万物皆可世界模型”。亿欧智库的报告指出,世界模型并不等同于视频生成工具,它是面向物理世界的AI基础底座,当前产业正脱离纯学术原型阶段,进入技术验证与场景落地并行推进的窗口期。
资本层面,2026年前7个月,中国一级市场世界模型相关概念累计涌入资金666亿元,58家企业获得融资,占赛道公司总量的91%。这种与落地进度不完全匹配的资金涌入速度,难免让人警惕泡沫。
但头部公司的动作表明,技术方向本身有实际价值。真正值得关注的,不是谁在“发布”世界模型,而是谁在用世界模型解决自己业务里真实、具体的物理世界问题。高德有海量时空数据,京东有真实物流场景,字节有Pico和内容生态,宇树有机器人硬件,李飞飞有Real-to-Sim的明确目标。它们的世界模型,都长在各自的业务地基上。
从“生成画面”到“构建空间”
一个清晰的趋势是:世界模型正在从“生成画面”走向“构建可交互、可预测的空间”。
亿欧智库的报告将当前技术路线归纳为显式物理派与隐式学习派两大流派。显式物理派优先保证几何、力学结果精准,更适配智能驾驶、数字孪生等对物理精度要求高的场景;隐式学习派从海量真实数据中学习物理规律,更适配人形机器人这类复杂具身任务。
李飞飞的Atlas将三维深度和相机位姿作为原生输入,字节追求实时低延迟的交互体验,宇树让机器人自主决策攻防,京东强调多轮连续交互——这些技术路径的共同点,是让AI不仅“看懂”世界,还能“进入”世界并与之互动。这与更早的AI生成内容有本质区别:生成一段视频,AI只需理解像素的统计规律;构建一个可交互的世界,AI需要理解空间结构、物理规律和因果关系。
在 Gartner 曲线上,它站在哪里
根据 Gartner 2026 年 9 月发布的中国技术成熟度曲线,世界模型处于“技术萌芽期”,与 AI 基础设施并列。作为对照,处于“期望膨胀期”的是具身智能和 AI 智能体,它们距离生产成熟期的预估时间为 2-5 年。世界模型连这个时间表都尚未进入。
这意味着它距离成熟落地还有相当距离,当前更多是技术验证和概念探索阶段。李飞飞 Atlas 的限邀访问、字节项目的“发布时机不确定”、京东和高德各自在自有场景中摸索——这些动作放在 Gartner 的框架里看,都是萌芽期的典型表现:大家都在试,但还没有人真正跑通。
类比:2010 年前后的增强现实
如果要找一个已经成熟的类比,最贴切的是 2010 年前后的增强现实(AR)。
AR 当时同样处于技术萌芽期:技术已经存在,演示令人兴奋,但所有人都在问同一个问题——“它到底用来干什么?”当年的 AR demo 从手机滤镜到工业维修指导,定义混乱到几乎失去意义。今天“世界模型”同样被用于指代视频生成、3D 重建、物理仿真、机器人规划等截然不同的东西。
两者的核心困境也相同:技术展示与真实需求之间存在断裂。AR 当时有大量炫酷 demo,但用户看完后普遍的反应是“挺酷,然后呢?”世界模型同样如此——李飞飞的 Atlas 能重建 3D 场景,字节追求实时低延迟交互,宇树让机器人自主搏击,但这些演示与普通人日常生活的距离,和当年 AR 演示与日常生活的距离一样远。
唯一的差别是:AR 至少有一个“自然形态”——眼镜或手机屏幕,交互方式是“看”。用户不需要被解释“AR 是什么”。世界模型连这个层面的共识都没有。它可能是一个仿真引擎,可能是一个机器人训练场,可能是一个游戏工具,也可能最终被更大的模型吸收掉。AR 是“知道长什么样但不知道用来干什么”,世界模型是“连长什么样都还没定”。
谁能先落地
回到标题的问题:谁能先落地?
从落地路径的清晰度来看,高德和京东的答案最明确。高德有海量时空数据和奔驰这样的具名合作伙伴,ABot-Earth 的效率提升(1000倍)直接服务于地图产品的体验升级;京东有真实的物流场景和机器人采购需求,JoyAI-Echo WM 的交互能力直接对应仓储、分拣、配送中的操作需求。两者的世界模型都嵌入在已有业务中,落地不依赖外部市场成熟。
宇树处于“技术验证完成、等待场景放大”的位置。全自主搏击证明了世界模型驱动机器人的可行性,但从演示到“80%陌生环境完成80%任务”的ChatGPT时刻,还有明显距离。它的落地节奏取决于人形机器人整体产业的成熟速度。
李飞飞和字节的路径指向未来,但确定性更低。Atlas 瞄准的影视、游戏、数字孪生场景需要内容产业的生产流程改造,Real-to-Sim 的机器人仿真训练则需要机器人产业同步成熟。字节的项目甚至还未确定发布时间,其成败高度依赖 Pico 硬件生态和抖音内容生态能否形成飞轮。
世界模型赛道正进入“概念泛化与业务验证并存的混战期”。泡沫会存在于那些只有演示、没有场景的项目中,而有真实数据和场景支撑的探索,则在为这个新方向积累真正的工程经验。
用 Gartner 的语言来回答最初的问题:世界模型确实还处在萌芽期,但头部公司的探索有真实业务地基,属于“有根基的萌芽”,而非纯粹的空转。 它离期望膨胀期的喧嚣还有一段距离,更不用说幻灭和复苏了。
至于谁能先落地,答案可能不在技术本身,而在谁的业务场景最先被验证。高德和京东有现成的场景,宇树有现成的硬件,李飞飞和字节有现成的生态——但“有”不等于“跑通”。时间会给出答案。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)