深度 | 世界模型成物理AI新战场:千亿融资进场,真机数据不再是唯一答案
深度 | 世界模型成物理AI新战场:千亿融资进场,真机数据不再是唯一答案

这是一篇深度研究,不是新闻简报。基于 18 个来源的交叉验证。
核心观点:2026 年物理 AI 的资本与研发重心,正从「造机器人」转向「造世界模型」——英伟达、谷歌、李飞飞、LeCun 和中国厂商在四条路线上对赌,赌的是同一个问题:世界模型能否替代海量真机数据,成为机器人的新算力层。
证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断
一、钱正在从「机器人」流向「世界模型」
2026 年一季度全球物理 AI 融资超 64 亿美元,中国以 33 亿美元、126 笔交易领先,约为美国的 2.7 倍。[B] 更值得注意的是细分赛道:仅世界模型一个方向,开年融资就超 13 亿美元——李飞飞的 World Labs 以约 10 亿美元融资把估值推到 50 亿(14 个月翻 5 倍),LeCun 的 AMI Labs 种子轮也被报道超 10 亿美元(口径不一)。
上一代具身智能靠「试错式强化学习 + 海量真机数据」,但数据缺口大得吓人:互联网语料相当于约 10 万年的「人类经验」,全行业最大的机器人数据集却只有约 100 万条轨迹。[B] 世界模型被当成填补缺口的合成数据引擎。我判断,世界模型能否成为机器人的新算力层,是今年物理 AI 真正的胜负手。[D]
二、技术深潜:世界模型如何变成数据引擎
传统 VLA 把「图像 + 语言」直接映射到动作,依赖真机数据;世界模型则先学会「世界如何运转」——预测下一帧、下一段轨迹。复旦 OpenMOSS 的综述把两者统一为「World Action Model(WAM)」:预测和动作要在同一个策略里联合学习。[B]
世界模型在两个环节放大数据价值。预训练侧:英伟达 DreamZero 给出关键证据——12 分钟的第一人称人类视频,让机器人在未见过的任务上策略表现提升超 42%。[C] 数据生成侧:智源的 VISTA 用「世界模型规划 + GoalVLA 执行」分层解耦,只花 2 小时真机数据就在分布外任务上做到 69% 成功率(没接 subgoal 的 π0 只有 14%);上海AI实验室的 InternVLA-A1.5 则用「潜在未来推理」让模型不调视频生成器也能预见下一步。[B]
架构上,行业收敛到「双系统 + 世界模型」共识:慢系统规划、快系统控制,世界模型既提供「想象未来的能力」,又负责造训练数据。英伟达 GR00T N2 把 DreamZero 做成商用底座,号称全新环境任务成功率比领先 VLA 高一倍以上、RoboArena 第一。[B]

上图:世界模型驱动的数据飞轮——预训练、合成数据、策略训练、仿真验证、真机回流,五个环节互相放大。
三、竞争格局:四派资本,对赌同一条未来
世界模型赛道分裂成四条路线,背后是互斥的十亿美元级赌注。
| 派系 | 代表 | 核心资产 | 最新节点 |
|---|---|---|---|
| 语言中心 | Google Genie 3 | 实时交互世界模型,60 秒强一致性记忆 | Project Genie 开放订阅 |
| 像素中心 | Sora 系 | 高保真视频生成 | 视频「电影级」生成 |
| 3D 结构中心 | World Labs Marble | 3D Gaussian + 碰撞网格,可导航 3D 世界 | 2026-02 融资 10 亿美元、估值 50 亿 |
| 潜空间/表征 | LeCun AMI Labs | JEPA 架构,能量式世界模型 | 种子轮超 10 亿美元(口径不一) |
[B] 四派不只是比技术,而是在赌「世界模型应该长什么样」。谷歌 Genie 3 的物理是「合理的」而不是「正确的」,社区共识是还不能直接当 sim-to-real 训练场;World Labs 输出碰撞网格补物理几何;LeCun 坚持潜空间路线,认为像素级生成浪费算力。
真正在「卖铲子」的是英伟达。Cosmos 3 是第一套「统一世界基础模型」,号称把物理 AI 的训练-评估周期从「月」压到「天」;[B] 叠加 GR00T N2、Newton 物理引擎和 Jetson Thor 边缘芯片,英伟达把「世界模型→仿真→策略→部署」做成了整条流水线——物理 AI 业务过去一年收入超 90 亿美元(单口径)。[C] 更关键的是生态:ABB、FANUC、YASKAWA、KUKA 合计控制 200 万台以上存量机器人,都在集成 Isaac 与 Jetson 模块。[B] 英伟达正在变成物理 AI 的「CUDA」,这次是纵向全栈。

上图:2026 年世界模型从「概念」到「资本共识」再到「开源工具链」的半年时间线。
四、采用与生态:中国押「数据」,欧美押「基础模型」
中国厂商把筹码压在了「数据」上。智元规划 2026 年产数百万小时高质量数据、近 90% 研发在仿真环境完成,并提出 WRAM(世界推理-动作模型)概念;[C] 银河通用的 GraspVLA 用超 99% 仿真合成数据训练,宣称已在宁德时代、博世产线应用;优必选 Walker S2 进入比亚迪、富士康工厂,官方口径数百台交付;比亚迪自研「尧舜禹」机器人,150 台样机实训,单台成本压到 20 万元以内。[B]
政策与资本同步加码。工信部实景实训专项行动要求年底形成万台级落地能力,2026 上半年国内人形机器人产量已超 4 万台。[B] 资本侧,上半年具身智能融资约 935 亿元、322 笔,超过去年全年,百亿估值独角兽从 3 家增至 22 家——媒体评价「淘汰赛倒计时」。[B]
但叙事在分裂。量子位把 WAIC 的世界模型论坛称为「最火也最没有共识的领域」:像素生成派、潜空间/JEPA 派、融合派在「物理精度 vs 物理合理性」上激烈交锋;RSS 2026 现场,北美研究者直言「领域还没有奠基性工作」「中国真正领先的是硬件」。[B] 一句话:融资叙事里世界模型是主角,论文顶会里还是 VLA 的天下。
五、战略影响:三条战线的胜负手
范式线:Coatue 给物理 AI 的估值是「至少 6 万亿美元,比数字 AI 大 50%」,Future Markets 预测 2026 年约 3830 亿、2040 年 3.26 万亿。[C] 但 Fusion Fund 的反驳同样有力:LLM 靠 Chatbot Arena 这类共享基准收敛,世界模型至今没有——RoboArena、WorldGym 都还是早期尝试,四派资本已经分道扬镳。[C]
生态线:英伟达想当「物理 AI 的操作系统」,但用户未必想被绑死。中国厂商一边受益于 Cosmos/GR00T 开源工具链,一边在自研世界模型——不跟可能被生态甩开,跟了模型栈上游就握在别人手里。
数据线:物理保真度是世界模型通往机器人的最后一道闸。Genie 3 的物理只是「合理」,World Labs 用碰撞网格补几何,英伟达用 Newton/Kamino 补物理精度——像素好看不等于物理可用。

上图:物理 AI 计算层的生态地图——英伟达卖整条流水线,四派世界模型提供范式选择,中国厂商押注数据,机器人与工业巨头买单。
六、我的判断
第一,我判断「世界模型之争」是今年物理 AI 真正的主战场。 钱已经给出了答案——世界模型从可选的演示技术变成必争之地。但别把融资热度当技术收敛,四派路线至少还要打 12 个月。
第二,我预判中国厂商会分化成两派。 「自研派」(智源、复旦、智元)押注世界模型是物理世界的独立基础模型,「集成派」直接搭英伟达工具链。未来两年「集成派」商业化更快,「自研派」天花板更高。
第三,我赌「物理保真度」是决定性变量。 谁先证明「世界模型生成的合成数据能让真实机器人在新任务上稳定涨点」,谁就赢下数据线。
第四,先不下结论的是「数据规模 = 能力」这个等式。 如果世界模型没有像 LLM 那样可预测的 Scaling Law,数据多不一定等于能力强。这是我最看不准、也最需要持续跟踪的一点。
参考来源
- HTX Insights — The Year of Physical AI: A Trillion-Dollar Gamble
- TechTimes — Embodied AI World Models Attracted $6 Billion
- ODEI — The Physical AI & World-Model Landscape, August 2026
- blockchain.news — NVIDIA Cosmos 3 and GR00T N2 at GTC 2026
- blockchain.news — NVIDIA Full-Stack Robotics Platform
- TrendForce — NVIDIA Expands Robotics Ecosystem at GTC
- Silicon Republic — World Labs raises $1bn for spatial intelligence
- LearnPrompting — Project Genie: DeepMind’s Interactive Worlds
- OpenDataScience — Physical AI in 2026: Robotics Foundation Models
- AIN China — China’s Embodied AI Revolution: Q1 Funding & World Models
- arXiv — InternVLA-A1.5(上海AI实验室)
- Leaderobot — 智源 VISTA:业内首个开源世界模型+VLA 框架
- yeekal — World Action Models 综述解读
- 量子位 — 世界模型「六小龙」在 WAIC 吵起来了
- 北京智源社区 — RSS 2026:美国具身也没成熟
- 第一财经 — 具身智能上半年:百亿独角兽增加近 20 家
- 搜狐 — 智元:坚定投入世界模型
- 自客 — 自变量王潜:物理世界的独立基础模型
AI 辅助深度研究,人工视角解读。 每日更新。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)