深度 | 机器人开始「造世界」:巨头不买数据改造数据,世界模型会抽干 Figure 们的护城河吗|深度分析

这是一篇深度研究,不是新闻简报。基于 11 个来源的交叉验证。 核心观点:当真实物理数据又贵又难采,李飞飞、Genesis、Nvidia 正在押注一条更便宜的路线——直接在虚拟世界里「造」数据来训练机器人。方向是对的,但「用仿真世界练熟的手,能不能在真实世界也稳」这条最硬的结果,目前还没有人跑通。我判断,这不会替代真实数据,而是会演变成「仿真 + 真实」的混合打法。 证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

封面

一、巨头们不买数据了,开始「造」世界

上一期深研拆过机器人的数据战:Figure 砸重金自建 Index 数据集、去采集真实物理数据。但这一期我想看一条更反直觉、也更便宜的路线正在崛起——既然真实物理数据那么贵,为什么不直接在计算机里「造」一个物理世界,让机器人在里面把动作练熟?

这条路线叫 世界模型(World Model)与物理仿真。核心主张很明确:与其让工程师花一年清干净一条产线去采数据,不如用一个能生成「可控、符合物理、可无限重复」虚拟世界的模型,批量生产机器人需要的「物理语料」。

进入 2026 下半年,这条赛道走到资本和产品同时爆发的拐点。李飞飞创办的 World Labs 7 月接连出手——收购专注空间智能的 SceniX、发布「Real-to-Sim-to-Real(真实到仿真再到真实)」的 R2S2R 训练引擎——把一家「生成 3D 世界」的公司,正式改造成「训练机器人」的平台。[A] 曾经的学术开源项目 Genesis,则发布 Genesis World 1.0 与 GENE-26.5,从纯科研变成背靠公司的商业化仿真平台。

分量被严重低估了。上一轮具身智能军备竞赛,抢的是「谁手里有物理数据」;世界模型玩家则提出一个釜底抽薪的问题:如果「数据」本身可以被廉价合成,那上一轮花几百亿建数据工厂的公司,护城河是不是正在被偷偷抽干?[D]

二、技术深潜:世界模型不是「生成视频」,是「可交互的物理模拟器」

很多人把世界模型等同于 AI 生成视频(比如 Sora 那种),这其实是两码事。

今年 6 月,World Labs 发了一篇被圈内视为「行业谱系奠基」的论文,把所谓「世界模型」按功能劈成三类:渲染器(只会生成’像’的视频,算对像素算错物理)、模拟器(生成’符合物理’的世界)、规划器(在模拟中决策,最稀缺未证明)。[A] 这个分类的潜台词很尖锐:绝大多数号称世界模型的产品,其实只是高级一点的渲染器;真正能拿来训练机器人的模拟器与规划器,寥寥无几。

上图:世界模型的功能谱系中,只有模拟器与规划器层级能服务机器人训练。

Genesis 提供了「仿真的物理底座怎么造」的活教材——它把刚体、有限元、MPM、布料/流体等传统分属不同库的物理求解器揉进同一个场景共享状态,再用编译层把 Python 写的内核代码,JIT 编译成 CUDA、AMD、Apple、Vulkan 等各种后端。[A] 30k 开源的体量,让它成了物理仿真圈最流行的底座。但必须诚实澄清:Genesis 当前主打的是「物理仿真」,不是严格意义的「生成式世界模型」——它更接近模拟器,而非渲染器/规划器。[D]

企业级版本看 Nvidia。Cosmos 3 被官方称为「首个原生具备推理、世界生成与动作生成的 omni-model」,做四件事:视觉推理、策略模型构建(作为世界动作模型的骨干)、世界仿真、合成视频数据生成。[A] 它和 Omniverse 的分工被官方点破:Omniverse 提供仿真环境,Cosmos 生成训练数据。Nvidia 的算盘尤其清晰——LLM 时代它卖「训练大模型的铲子」,物理 AI 时代它想卖「造物理数据的铲子」;Cosmos 开放权重却封闭生态,想用好它,计算还是得跑在自家芯片上。[D]

上图:Nvidia Cosmos 3 的生态闭环——Omniverse 提供环境,Cosmos 生成数据,最终所有计算回流到 Nvidia 芯片。

但这里必须泼一盆冷水。DeepMind 的 Genie(11B 参数)常被引为生成式世界模型代表,能无监督地从互联网视频学出可交互虚拟世界——很漂亮。[A] 但诚实地讲,Genie 论文里完全没有机器人策略改进的验证,动作是无监督的「潜在动作」,不是物理指令,作者也只说这是 future work。 从「生成可玩的世界」到「用世界训练能上产线的机器人」,隔着的正是最难的一档「规划器」,而这一档目前没人拿出可复现的实证。

2026 年 8 月 arXiv 上,世界模型论文仍在堆积(CLAP、Riemann-1.0、WALL-SS)[A],但「仿真世界训出的策略成功迁移到真实机器人」这条最硬的结果依然稀缺。我的判断:世界模型用于感知增强、碰撞检测、合成数据扩充已经有效,但用于端到端策略的 sim2real,仍是未证明的前沿。[D]

三、竞争分析:四种路线,一场「数据从哪来」的终极分歧

阵营代表玩家核心产品技术路线关键证据
空间智能World Labs(李飞飞)Marble + World API + R2S2R生成式 3D → 仿真训练2026-02 新一轮融资
物理仿真Genesis AIWorld 1.0 + GENE-26.5多物理求解 + Python 编译29.8k star
平台型(卖铲子)NvidiaCosmos 3 + OmniverseWFM 平台 + 合成数据Cosmos 3 官方
实时生成DecartOasis 3 + Lucy 2.5实时视频/世界生成$4B 估值(2026-05)[B]

上表:世界模型/物理仿真赛道的四类玩家对比,「数据从哪来」是分水岭。

World Labs 的信号意义最强。梳理它 2026 年的节奏:1 月上 World API、4 月出 Spark 2.0 流式 3D、5 月 Marble 迭代——但最关键的转折在 7 月:先收购 SceniX,紧接着发布 R2S2R,还跟 a16z 录了一期《为什么训练机器人不像训练 LLM》的播客。[A] 三个动作串起来,读出来的是战略宣言:世界模型的终局不在生成好看的 3D 场景,而在成为机器人训练的「第二数据集」。R2S2R 的名字把野心写透了——真实采集太贵,先用少量真实数据建仿真锚点,在仿真里练熟,再迁移回真实。[A]

Genesis 则是这条赛道从「学术热情」走向「资本化」的缩影。它凭「统一多物理 + Python 编译」的技术迅速圈粉(29.8k star),由法国公司 Genesis AI 运营,Waitlist 挂着、官网明确「目标客户部署计划在 2026 年底」。[A] 它踩在开源 vs 商业化的钢丝上:一边 Apache 2.0 真开源,一边接企业客户——一旦商业化深入,就要回答经典难题:免费版足够好时,谁还为企业版付费?[D]

但要泼第二盆冷水:这条赛道远未到赢家局。Decart($4B 估值)做的是实时驱动/自动驾驶世界生成,和物理求解仿真不是一种东西;Nvidia 生态强但闭源绑定重;World Labs 与 Genesis 都还在产品初期。[B] 目前没有任何一家能同时证明两件事:既可量产生成物理可靠的虚拟世界,又能让虚拟世界训出的策略稳定迁移到真实机器人。分开看都有进展,合起来没人跑通。[D]

上图:世界模型/仿真赛道 2026 年节奏,7 月是信号最密集的拐点。

四、生态与落地:谁真在用仿真训练机器人,中国又在追什么

这条赛道的底层逻辑之所以吸金,是因为它击中一个效率痛点:真实物理数据的采集是「线性、昂贵、不可并行」的,而仿真数据生成是「可并行、可无限、几乎免费」的。Nvidia 官方背书正是这套——「从文本/图像/视频/动作生成无限可能的未来」,冲着把数据成本降两个数量级去。

但落地卡在一道现实门槛:「仿真数据质量的最后一公里」。对感知(视觉辨识、碰撞检测)和可控域的操作基线,sim2real 已足够好;但对接触密集、可形变物体、长时程任务,仿真和现实之间的「域差」依然让策略迁移脆弱。[D] 换句话说,仿真造数据在「让机器人学会看」上便宜有效,在「让机器人学会摸、学会拧」上还差得远——这也解释了为什么 Figure 们宁愿砸重金建真实数据工厂,因为他们的任务库恰好落在仿真最难补的那一段。

中国在这次竞赛里的位置很微妙。手上的牌更多集中在硬件与本体端:未来不远机器人约半年 3 轮融资约 10 亿元、投资方含字节跳动与汇川技术、已向 500 户家庭卖出机器人;范式 PhanthyMotus 与优必选等发起的「生态共建」计划;宇树放出「多机器人共用一个大脑」的长镜头 demo。但值得注意的是,本周热门首页里,看不到「世界模型/仿真」成为主线——中国的资本和叙事,明显更集中在「真硬件 + 数据采集」,而不是「世界模型 + 仿真」。

这给了我一个有意味的观察:这一波,中国选了「采真实数据」,硅谷选了「造虚拟世界」——两条路线谁对,要等双方都在真实产线上见真章。[D](注:关于「2026 上半年中国具身智能融资超 900 亿」的说法,本报告未能从可靠一手来源独立核验,仅作行业背景,不作关键论据。)

五、战略影响:世界模型会不会抽干「数据护城河」的底

把镜头拉远,这条赛道真正的冲击,是对「具身智能护城河」的釜底抽薪。

对垂直整合的本体厂(Figure、智元等),这是最直接的威胁。 上一期说 Figure 靠「自建工厂 + Index 真实数据集」构筑护城河;但若世界模型 + 仿真真能把物理数据成本打到接近零,那 Figure 引以为傲的数据资产,稀缺性会随仿真能力提升而稀释。护城河的价值,取决于替代它的数据来源贵不贵——仿真越强,真实数据溢价越低。[D]

对 Nvidia,世界模型是最顺手的第二增长曲线。 当「造物理数据」和「造大模型」一样成为核心算力消耗,Nvidia 就同时保住训练端和仿真端两条收入。Cosmos 的「开放权重、封闭生态」正是为此——免费下模型可以,但真要规模化造数据,还得租我的 GB200。[D]

对中国,世界模型是「卡脖子」风险的另一面。 国产 GPU 与大模型训练早就被重视,但世界模型/物理仿真对「高质量合成数据 + 强物理引擎 + 大规模 GPU」的依赖,是相对被忽视的软肋。当硅谷把「造世界的铲子」也变成 Nvidia 生态主导的基础设施,中国即便硬件本体端再强,也面临「训练数据引擎」再次被卡的风险。[D]

上图:世界模型对产业链的四个冲击面——成本、护城河、芯片生态、地缘软肋。

六、我的判断:世界模型是「第二战场」,但不是任何人宣称的「终局」

第一,我判断「用仿真替代真实数据」方向是对的。 真实物理数据「线性、昂贵、不可并行」的瓶颈是实打实的,任何能把数据成本降下来的技术路线,长期必然胜出。[D] 但「方向对」不等于「今天就能用」——目前没有任何一家证明了「仿真训出的端到端策略稳定迁移到真实机器人」这条最硬的结果。方向对、成果未证明,这是最真实的状态。

第二,我赌「仿真 + 真实数据」的混合路线,不赌「纯仿真替代」。 未来真正的赢家,不会是「只要仿真」或「只要真实数据」二选一,而是能把两者按任务难度动态调配的玩家——感知类任务多用便宜的仿真,接触密集类任务舍得烧真实数据。谁手里同时有「好仿真引擎」和「高质量真实数据」并且建起 R2S2R 那样的闭环,谁才笑到最后。[D] Figure 们和 World Labs 们,迟早发现彼此是互补而非替代。

第三,先不下结论的是「世界模型到底什么时间能真正上产线」。 论文在堆积、融资在升温、企业在喊话,但「规划器」那档的可行性和 sim2real 的稳定性都没有可复现的实证。[D] 我原以为世界模型只是锦上添花的 demo,现在看各国资本都在真金白银地下注——它至少是值得严肃对待的第二战场,只是要成为真正的第一战场、改写 Figure 们的数据护城河,还得先解决一个硬问题:让虚拟世界里练熟的手,在真实世界里也稳得住。


参考来源

  1. World Labs — Building Worlds That Train Robots (R2S2R)
  2. World Labs — A Functional Taxonomy of World Models
  3. Genesis — GitHub 仓库(README)
  4. Nvidia — Cosmos 3 世界基座模型
  5. DeepMind — Genie(arXiv:2402.15391)
  6. Decart — Wikipedia
  7. 量子位 — 2026 具身智能生态报道

AI 辅助深度研究,人工视角解读。 每日更新。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐