机器人世界模型:2026 技术全景与工程选型指南
前言:2026 年的机器人世界模型已分化成四条技术路线——视频生成、潜空间预测(JEPA)、3D 空间智能与具身操作。闭源旗舰(Sora 2、Genie 3、Marble、GR-2)定义能力上限,开源栈(Cosmos、V-JEPA 2、RynnVLA-002、HunyuanWorld)已覆盖绝大多数工程环节。物理保真是全行业短板,而工程终局不是单一路线胜出,而是「神经仿真器 + 显式物理引擎 + 潜空间规划」的分层混合架构。

目录
- 一、世界模型是什么
- 二、四条技术路线总览
- 三、路线一:视频生成
- 四、路线二:潜空间预测(JEPA)
- 五、路线三:3D 空间智能
- 六、路线四:具身操作世界模型
- 七、开源全景与选型
- 八、效果横评
- 九、从业者建议
一、世界模型是什么
1.1 三派定义之争
「世界模型」的分歧可收敛为三个互斥回答:它应该生成像素、预测表征,还是支持交互?
| 派别 | 核心主张 | 代表路线 |
|---|---|---|
| 生成式(模拟器派) | 下一帧足够逼真,物理规律即隐式涌现 | Sora、Genie、Cosmos |
| 预测式(表征派) | 像素预测浪费且注定失败,应在抽象空间预测状态 | JEPA 谱系(I-JEPA → V-JEPA 2) |
| 交互式(智能体派) | 动作可控、可交互才是世界模型的本质 | Genie 系列、UniSim |
关键分歧:
- LeCun 的论据:文本是离散符号所以生成式可行,高维连续感官输入的不确定性却难以处理;若目标是训练用于规划的世界模型,像素级预测是糟糕的选择。
- 折中立场:《Is Sora a World Simulator?》承认 Sora 与「通过预测理解世界」对齐,但指出其只能被动生成、不能主动干预,物理复现不可靠。
- 交互派的推进:World-in-World、KineBench 等闭环基准使「交互性」从口号变成可测指标。
1.2 评测基准的三次迁移
三个阶段:
| 阶段 | 代表基准 | 核心发现 |
|---|---|---|
| 开环画质 | VBench、FVD | 好看 ≠ 懂物理 |
| 物理合理性 | VideoPhy、IntPhys 2 | 所有模型接近随机(~50%),人类 96.4% |
| 闭环执行 | World-in-World、KineBench | 视觉质量不保证任务成功,可控性更重要 |
⚠️ IntPhys 2 的警示:所有参评模型在复杂场景下大多处于随机水平,而人类成绩为 96.4%。这是贯穿全文的核心背景音:视频生成路线「物理从像素涌现」的赌注,截至 2026 年中尚未兑现。
二、四条技术路线总览
2.1 划分标准:每条路线的「核心赌注」
四条路线的划分标准不是网络架构,而是核心赌注——每条路线认定「智能的关键瓶颈」在哪里,就把全部工程资源押在哪里:

2.2 2026 格局:闭源旗舰 vs 开源平权
核心判断:能力上限的旗舰全部闭源,工程可用的开源栈已覆盖除「最强实时交互」外的几乎全部环节。**「闭源看演示、开源做工程」**是当下格局。
| 路线 | 核心问题 | 代表模型 | 输出形态 | 开源情况 |
|---|---|---|---|---|
| 视频生成 | 下一帧长什么样 | Sora 2、Genie 3、Cosmos | 像素视频 | Sora 2/Genie 3 闭源;Cosmos 开放权重(可商用) |
| JEPA 潜空间 | 抽象状态怎么变 | V-JEPA 2、DINO-WM | 潜表征 | 代码 MIT;权重 CC BY-NC(非商用) |
| 3D 空间智能 | 空间本身长什么样 | Marble、HunyuanWorld-1.0 | 可漫游 3D 场景 | Marble 闭源;HunyuanWorld 开放权重 |
| 具身操作 | 这个动作下去会怎样 | GR-2、RynnVLA-002、EnerVerse-AC | 动作条件预测 | GR-2 未开源;RynnVLA Apache-2.0;EnerVerse-AC 非商用 |
两个结构性信号:
- 具身操作路线的开源梯度最分裂——同一路线内从
Apache-2.0到完全闭源并存,反映机器人数据资产的商业敏感性。 - 闭源程度与资本热度正相关而非与技术成熟度相关——最封闭的玩家恰是融资最凶的几家。
三、路线一:视频生成——预测「下一帧长什么样」
3.1 核心赌注
共同赌注:物理规律可以从像素中涌现——不显式建模重力、碰撞与流体,只要把「下一帧长什么样」预测得足够逼真,模型就隐式内化了这些规律。
路线内部分歧:
- 扩散派(Sora、Cosmos 扩散家族):画质高但天然离线
- 自回归派(Genie 谱系、Cosmos AR 家族):逐帧预测,天然支持边生成边接收新动作
概念区分:只建模
p(下一帧|历史帧, 文本)的模型是「被动预测器」,加入动作项a_t后才成为严格意义上可交互的因果世界模型。
3.2 代表模型
Sora 2(2025-09,闭源)——能力上限的标杆
| 维度 | 详情 |
|---|---|
| 开放性 | 完全闭源:无权重、无代码、无正式技术论文 |
| 架构推断 | 时空 patch 上的扩散 Transformer(DiT),多模态扩散 + 并行音频生成 |
| 能力增量 | 更准确的物理、原生音画同步、跨镜头叙事一致性 |
| 输出规格 | App 端 720p,普通用户最长 15s,Pro 用户 25s |
| 关键短板 | 没有动作条件接口,不可交互、非实时 |
Genie 3(2025-08,闭源)——从「看视频」到「走进视频」
| 维度 | 详情 |
|---|---|
| 核心机制 | 自回归逐帧生成 + 潜在动作模型(LAM) |
| 实时性 | 720p@24fps 即时响应,环境一致性可维持数分钟 |
| 交互能力 | 键盘导航 + 文本「可提示世界事件」实时改变世界状态 |
| 开放进展 | 2026-01 以 Project Genie 原型向 Google AI Ultra 订阅者开放 |
| 官方短板 | 动作空间有限、多智能体交互难、无法地理精度复现真实地点、交互时长仅数分钟 |
NVIDIA Cosmos(开放权重)——机器人基础设施
三代演进线:
| 代际 | 时间 | 核心升级 |
|---|---|---|
| 1.0 | 2025-01 | 扩散(7B/14B)+ 自回归(4B/12B)双家族;训练动用 10,000 张 H100 × 3 个月 |
| 2.x | 2025-06 → 2026-01 | 统一 flow 范式;action-conditioned 2B 机器人变体;精筛 2 亿条视频 |
| 3.0 | 2026-05 | MoT 双塔(推理塔 + 生成塔),单模型统一五种模态;Edge 4B 支持 Jetson 边缘部署 |
三者横向对比:
| 维度 | Sora 2 | Genie 3 | Cosmos |
|---|---|---|---|
| 生成范式 | DiT 扩散 | 自回归逐帧 + LAM | 扩散→flow→MoT 双塔 |
| 动作条件 | ❌ 无 | ✅ 键盘 + 文本事件 | ✅ action-conditioned 变体;3 代直接输出动作 |
| 具身定位 | 范式标杆/研究素材 | 智能体训练与评估环境 | 全栈:合成数据、策略评估、数据质检 |
最值得咀嚼的一行:「动作条件」把三个看似同类的模型分成两代物种。Sora 2 画质最强却只是「被动预测器」;只有 Cosmos 从第一天起就把机器人动作当作一等公民——这与三者背后的商业身份(内容公司 / AGI 实验室 / 机器人基础设施商)完全同构。
3.3 对机器人的实证价值
NVIDIA GEAR Lab 的 DreamGen / GR00T-Dreams(2025-05)提供了最硬的实证:
四阶段管线:
LoRA 微调视频世界模型 → 以初始帧+语言指令 rollout 生成照片级视频
→ 逆动力学模型(IDM)恢复伪动作形成「神经轨迹」
→ 在神经轨迹上训练视觉运动策略
结果(论文自报):GR1 人形机器人仅凭单一环境遥操作数据,学会 22 种新行为并泛化到 10 个新环境:
- 新行为成功率:11.2% → 43.2%
- 未见环境成功率:0% → 28.5%
⚠️ 时间锚点声明:Figure、Agility、1X 等首批采用 Cosmos 的报道源自 CES 2025(2025-01)。Figure 此后转向全栈自研(2026-01 发布 Helix 02),「Figure 用 Cosmos」是历史事实,不宜表述为现状。
3.4 优势与短板
| 优势 | 短板 |
|---|---|
| 数据规模近乎无限(互联网视频) | 长时序漂移与物理失真:无显式物理引擎,靠数据相关性近似「看起来对」的运动 |
| 生成结果直观可检查 | Physics-IQ:Sora 2 仅 42.3%(Original 榜单),Verified 榜单仅 26.5% |
| 可直接产出训练数据 | 难进实时控制回路:Cosmos 扩散式每步动作约需 4 分钟;完整 pick & place 轨迹超 1 小时 |
| 开源阵营(Cosmos)已形成完整工具链 | 同硬件上潜空间规划(V-JEPA 2-AC)每步仅 16 秒,快约 15 倍 |
四、路线二:潜空间预测(JEPA)——预测「世界状态怎么变」
4.1 核心赌注与 LeCun 方法论
JEPA 站在视频生成的对立面:不在像素空间预测下一帧长什么样,而在抽象表征空间预测世界状态如何变化。
LeCun 的两步论证:
- 像素细节本质不可预测——树叶颤动、背景纹理的随机扰动无法预测;强迫模型在像素空间回归,等于逼它把容量浪费在不可预测的低级噪声上。
- 潜空间预测 + 能量最小化规划——编码器天然丢弃不可预测的信息,预测器在表征空间回归「下一个状态」;行动时用能量最小化在动作序列空间搜索。
简单理解:机器人在「脑中预演」多条动作轨迹,挑出预测结果离目标最近的一条执行。
4.2 谱系与代表模型
从 I-JEPA 到 V-JEPA 2:三步走
| 工作 | 时间 | 参数量 | 关键结果 | 开源 |
|---|---|---|---|---|
| I-JEPA | 2023-01 | ViT-H/14 632M | 冻结特征线性探针约 77–79% | ✅ 代码+权重 |
| V-JEPA | 2024-02 | ViT-L 300M / ViT-H | K400 81.9%、SSv2 72.2%(冻结特征) | ✅ 代码+权重 |
| V-JEPA 2 / 2-AC | 2025-06 | 编码器 300M–1B;AC 预测器 ~300M | SSv2 77.3%;零样本 Franka 抓取 ~65%、pick-and-place ~80% | ⚠️ 代码 MIT;权重 CC BY-NC |
V-JEPA 2-AC 深度剖析:62 小时数据炼出的零样本机械臂
三个环节各有看点:
- 编码器全程冻结:阶段一学到的视觉表征不再改动,证明通用视频理解特征可直接复用到机器人场景。
- 预测器极小、数据极少:~300M 参数,仅用 62 小时无标签机器人视频训练——无奖励、无任务标注、无目标环境数据。
- 规划全程不生成一个像素:给定目标图像,用 CEM 在动作序列空间搜索,使预测未来状态与目标表征的 L1 距离最小。
效果(论文自报,两个未见实验室的 Franka 臂,每任务 10 次试验):
| 任务 | V-JEPA 2-AC | Octo 基线 | Cosmos 类生成式 |
|---|---|---|---|
| 抓取新物体 | ~65% | — | 0–30% |
| pick-and-place | ~80% | ~15% | 0–30% |
| 持物够取 | ~75% | — | — |
规划效率——潜空间对像素空间的直接杀伤:
| 方案 | 单步规划时间 | 硬件 |
|---|---|---|
| V-JEPA 2-AC(CEM) | ~16 秒 | 单张 RTX 4090 |
| Cosmos 扩散式视频世界模型 | 4 分钟+ | 同硬件 |
| 完整 pick & place 轨迹 | 超 1 小时 | 同硬件 |
Meta 官方另有「快约 30 倍」的媒体口径(双方基准可能不同),两种口径并存。
DINO-WM:把表征学习彻底「外包」
NYU 的 DINO-WM(ICML 2025,MIT 开源,LeCun 共同署名)走得更远:
- 直接冻结现成的 DINOv2(ViT-L/14,~300M)patch 特征
- 世界模型只学动力学——一个帧级因果注意力的转移模型
- 规划时用 MPC/CEM 把「目标图像的 DINOv2 特征」当回归目标
效果(论文自报,零样本规划):
| 环境 | DINO-WM | 经典 RL 基线 |
|---|---|---|
| PushT | 0.90 | 0.00 |
| Maze / Wall / Reach / Rope / Granular | 全部达到或超过 | — |
瓶颈在表征质量而非规划算法。
三个短板:需要真实动作标签、依赖状态—动作覆盖充分的离线数据、缺乏层级结构。
4.3 资本背书:AMI Labs,10 亿美元押注「反 LLM」路线
| 时间线 | 事件 |
|---|---|
| 2025-11-19 | LeCun 确认离开 Meta(CNBC 口径) |
| 2025 年底 | AMI Labs(Advanced Machine Intelligence)于巴黎成立 |
| 2026-01 | 品牌亮相 |
| 2026-03-09/10 | 官宣 10.3 亿美元种子轮,投前估值 35 亿美元——欧洲史上最大种子轮 |
团队班底:
- LeCun:执行董事长
- Alex LeBrun(Wit.ai 创始人):CEO
- 谢赛宁(DiT 共同提出者):首席科学官
- Michael Rabbat(V-JEPA 系列负责人):世界模型副总裁
公司自称约 5 年内不出商业产品。这笔融资的意义:资本市场第一次为「非生成式世界模型」路线开出了十亿美元级的对价。
4.4 优势与短板
| ✅ 优势 | ❌ 短板 |
|---|---|
| 规划效率快一个数量级(16 秒 vs 4 分钟+) | 无可演示画面——不生成像素,对外展示与人工调试不友好 |
| 数据效率惊人(62 小时无标注数据零样本部署真机) | 工程生态弱:权重 CC BY-NC 限制商用,社区工具链远不及生成式阵营 |
| 冻结通用视觉特征即可迁移 | 任务仍限于短时程桌面操作 |
| DINO-WM 证明连编码器都可以不训 | 规划 16 秒/步对实时闭环偏慢;需以目标图像而非语言指令为条件 |
五、路线三:3D 空间智能——重建「可进入的世界」
5.1 核心赌注
李飞飞的论点:智能的基础是理解三维空间本身,像素和文字都只是它的投影。空间智能是生物演化中最古老的智能形式——远在语言出现之前,动物就已经在三维世界里导航、捕食、避险。
与前三条路线的根本区别:直接产出可走进去的世界——自带几何、可导出到游戏引擎和机器人仿真器的 3D 资产。
5.2 代表模型与产品
World Labs Marble(闭源)——「世界生成即服务」
| 维度 | 详情 |
|---|---|
| 商用时间 | 2025-11-12 正式商用(订阅制:Free/$20/$35/$95) |
| 技术底座 | 3D 高斯泼溅(3DGS)——数百万个带颜色与透明度的椭球「泼溅点」 |
| 输入 | 文本、单图、多视角、短视频、360° 全景、Chisel 粗略 3D 布局 |
| 输出 | 持久化、可 6DoF 导航的世界;导出 .ply/.spz/GLB 网格 |
| 兼容性 | Unreal、Unity、Houdini、Blender;Vision Pro / Quest 3 |
| 生成速度 | 约 2–5 分钟 |
| 2026-04 更新 | Marble 1.1(光照改善)与 1.1-Plus(自动空间扩展,最多追加 5 个空间单元) |
⚠️ 辟谣:Marble 模型本身从未开源。网络上「World Labs 开源 Marble」类文章为 AI 生成的不实内容,World Labs 开源的只是配套渲染器 Spark。
RTFM(闭源)——单卡实时的「学习型渲染器」
- 自回归扩散 Transformer,不构建任何显式 3D 表示
- 给生成的帧赋予相机位姿作为「空间记忆」
- 单块 H100 即可以交互帧率实时推理
- 用户可无限时长交互而世界不因视角切换而「消失」
- 未开源,技术细节有限
开源阵营
| 项目 | 机构 | 开放程度 | 技术底座 | 代表能力 |
|---|---|---|---|---|
| HunyuanWorld-1.0 | 腾讯混元 | 社区 License(有地域限制) | 全景代理 + 分层 3D 重建 | 文/图→可漫游世界,兼容 CG 管线 |
| HunyuanWorld-Voyager | 腾讯混元 | 社区 License(禁 EU/英国/韩国) | RGB-D 视频扩散 + 世界缓存 | WorldScore 综合能力第一(开源方法中) |
| WorldMirror 1.1 | 腾讯混元 | 社区 License | 统一前馈式 3D 重建大模型 | 多视图/视频输入,单卡秒级生成 |
| Matrix-Game 2.0 | 昆仑万维 | MIT | few-step 自回归扩散 | 25 FPS 流式生成分钟级视频 |
| Spark 2.0 | World Labs | MIT | 3DGS 渲染器 | 浏览器端渲染 1 亿+ splats |
结构性特征:生成模型与渲染栈正在分层解耦。World Labs 闭源生成模型(Marble、RTFM),开源渲染基础设施(Spark);腾讯与昆仑万维把生成模型本身开放,但 License 限制各异。
GitHub Star 实测(2026-07-25):
- Spark: ~3,440 ⭐
- HunyuanWorld-1.0: ~2,881 ⭐
- Matrix-Game: ~2,277 ⭐
- Voyager: ~1,573 ⭐
5.3 资本背书
2026-02-18,World Labs 宣布完成 10 亿美元新一轮融资:
- Autodesk 以 2 亿美元战略投资锚定本轮(其历史上最大的初创投资)
- NVIDIA、AMD 等参投
- 累计融资约 12.3 亿美元
- 媒体引用「估值约 50 亿美元」为 Bloomberg 口径,公司拒绝确认
芯片双巨头与 CAD 巨头同时下注,说明资本看重的不是「生成好看的场景」,而是 3D 工作流基础设施的入口位置。
5.4 优势与短板
| ✅ 优势 | ❌ 短板 |
|---|---|
| 几何一致性高——显式 3D 表示天然不会视角一转就「换了个世界」 | 世界是静止的——几何一致但物体不动,不生成可动角色 |
| 可直接对接现有仿真与渲染管线 | 未发布任何定量基准(SLAM 社区评测页明确记录) |
| Marble 2026-01 导出更新让资产按真实世界尺度缩放 | 碰撞与动力学需外包给传统引擎 |
| 对机器人仿真与 SLAM 的用途已落地 |
当前局面:3D 空间智能路线已经能把「世界的壳」造得又快又好,渲染侧也被 Spark 2.0 推到了亿级 splats 的消费级设备实时水准;但「壳里的物理」——可动物体、碰撞响应、可交互动力学——仍要外包给传统引擎。
六、路线四:具身操作世界模型——动作条件化的「操作模拟器」
6.1 核心赌注与两派划分
共同赌注:先在视频或状态序列上学好「世界动力学」,再让策略从中受益,比直接在机器人数据上学策略更划算。
工程上的两派:
| 派别 | 思路 | 代表 |
|---|---|---|
| 视频生成后训练派 | 在互联网视频预训练的视频生成模型上做动作条件化微调 | UniPi、GR 系列、EnerVerse、VidMan |
| 紧凑潜空间动力学派 | 在低维潜空间建模状态转移,效率高、可实时规划 | DINO-WM、JEPA 系 |
嵌入 VLA 回路的通用结构:
6.2 代表模型全景
| 模型 | 年份 | 机构 | 开源 | 代表性成绩(论文自报) |
|---|---|---|---|---|
| UniPi | 2023 | Google Brain + MIT | ❌ | CALVIN SR@1–5 = 56/16/8/8/4% |
| GR-1 | 2023 | 字节 | ❌ | CALVIN ABC→D 94.9% |
| GR-2 | 2024 | 字节 | ❌ | CALVIN 五连任务 85.9%;真机 105 任务 97.7% |
| iVideoGPT | 2024 | 清华 × 华为诺亚 | MIT | 动作条件预测与 SOTA 相当 |
| VidMan | 2024 | 中山 × 华为诺亚 | 代码+ckpt | CALVIN Avg.Len 3.42(+11.7% vs GR-1) |
| EnerVerse | 2025 | 智元 + 上交大等 | EVAC 开源(CC BY-NC-SA) | LIBERO 平均 84.1–88.5 |
| WorldVLA | 2025 | 阿里达摩院 | Apache-2.0 | LIBERO 平均 81.8 |
| RynnVLA-002 | 2025 | 阿里达摩院 | Apache-2.0 | LIBERO 97.4%(无预训练口径) |
| RoboScape | 2025 | 清华 FIB-Lab | 开源 | 策略评估 Pearson 相关 0.953 |
解读:RynnVLA-002 的 97.4% 是在「无互联网视频预训练」口径下取得的,与依赖 3800 万视频预训练的 GR-2 走的是两条路线。全表除 RoboScape 外,高分全部出自 CALVIN/LIBERO 仿真,真机数字只有 GR-2 一家。
GR-1 / GR-2(字节,闭源)——视频预训练 Scaling 的标杆
GR-1(ICLR 2024):GPT 式因果 Transformer 统一建模「语言+图像序列+本体状态→动作+未来图像」
- 先在 Ego4D 上视频预测预训练(80 万剪辑、800 万帧)
- 再在机器人数据上联合微调
GR-2(2024-10):推到互联网规模
- 3800 万互联网视频、500 亿+ token 预训练
- 图像经 VQGAN 离散化为 token,动作 token 与视频 token 交错自回归预测
- 模型约 3B 参数
成绩(论文自报):
- CALVIN ABCD→D 五连任务成功率 85.9%
- 真机 105 个任务简单设置下平均成功率 97.7%
- 端到端 bin-picking 平均 79.0%(GR-1 为 33.3%)
遗憾:GR-1 与 GR-2 均未开源,社区无法将其作为可复现基座。
WorldVLA / RynnVLA-002(阿里,Apache-2.0)
核心论点:更强的「统一后两者互增益」——世界模型分支学物理,动作模型分支生成动作,两者互为正则。
互增益证据(论文自报):
- 相比同骨干纯动作模型:抓取成功率提升约 4%
- 相比纯世界模型:视频生成 FVD 降低约 10%
重要发现:自回归动作 chunk 的误差传播——朴素自回归生成连续多步动作会掉 10%–50% 成功率,提出 action attention mask 挽回 4%–23%。
成绩:
- WorldVLA:LIBERO 四套件平均 81.8%(Spatial 87.6 / Object 96.2 / Goal 83.4 / Long 60.0)
- RynnVLA-002:LIBERO 97.4%(连续动作版各套件 94.4–99.8)
- 真机 LeRobot 实验:引入世界模型使整体成功率提升 50%
短板:256/512 分辨率仍低、LIBERO-Long 约 60% 明显弱于短程套件、连续动作精度不及扩散/流匹配头。
EnerVerse(智元)——把「生成未来」做成工业闭环
- 分块自回归视频扩散预测未来具身空间
- 稀疏上下文记忆做长程推理
- Free Anchor Views 多视角表征解决运动歧义与 3D 接地
闭环设计:
- 生成模型 + 4DGS 构成数据引擎缩小 sim-to-real
- 策略头复用首个去噪步特征预测动作 chunk(RTX 4090 上每 8 步约 280ms)
- 动作条件版 EVAC 兼任策略评估器
开源口径:
- EnerVerse 本体未开源
- EnerVerse-AC 开源(GitHub: AgibotTech/EnerVerse-AC,代码+单视角 checkpoint)
- CC BY-NC-SA 4.0 非商用
- IROS 2025 / ICRA 2026 AgiBot World Challenge 世界模型赛道官方 baseline
开源中坚
| 模型 | 核心创新 | 关键结果 |
|---|---|---|
| iVideoGPT(MIT) | 压缩式 tokenization——上下文帧为条件离散化未来帧,序列长度缩短 16 倍 | 打通动作条件视频预测→视觉规划→闭环控制 |
| VidMan | 双过程理论:视频扩散学动力学 → self-attention adapter 转为隐式逆动力学模型 | CALVIN Avg.Len 3.42(+11.7% vs GR-1) |
| RoboScape | 联合学习 RGB 视频生成 + 时序深度预测 + 关键点动力学 | 策略评估 Pearson 相关 0.953 |
6.3 优势与短板
| ✅ 优势 | ❌ 短板 |
|---|---|
| 与 VLA 架构天然兼容——动作/视频/文本 token 可进同一自回归骨干 | 带动作标注的数据稀缺:iVideoGPT 因 OXE 动作空间异构未放动作条件权重 |
| 论文产出最密集,开源第一梯队已能提供可复现基座 | 长时序一致性未解决:UniPi 五连任务掉到 4%;WorldVLA LIBERO-Long 约 60% |
| 世界模型可降解为数据引擎、评估器或规划器 | 标准基准高分存在「鲁棒性折扣」:LIBERO-Plus 扰动下 WorldVLA 从 81.8% 跌至 25.0% |
| 真机验证稀少:全路线仅 GR-2 给出大规模真机数字 |
最务实的用法:把动作条件世界模型当作离线评估器与数据引擎接入现有训练流水线——RoboScape 的 0.953 相关性和 EVAC 被挑战赛选为官方基线,指向的正是这个方向。
七、开源全景与选型
7.1 开源格局总览
「闭源看演示、开源做工程」
GitHub Star 实测(2026-07-25):
- Cosmos: ~11.2k ⭐(一骑绝尘,平台化策略成功)
- SkyReels-V2: ~7.2k ⭐
- V-JEPA 2: ~4.4k ⭐
- Spark: ~3.4k ⭐
- HunyuanWorld-1.0: ~2.9k ⭐
7.2 分路线开源清单
| 模型/项目 | 路线 | 参数量 | 代码 License | 权重 License | Star | 显存需求 |
|---|---|---|---|---|---|---|
| Cosmos | 视频生成 | 2B–14B | Apache-2.0 | NVIDIA Open Model License(可商用) | ~11.2k | 2B: 26–33GB;14B: 49–57GB |
| SkyReels-V2 / A2 | 视频生成 | 14B | 定制社区 License | HF 开放 | V2 ~7.2k | A2 单卡 RTX 4090 可跑 |
| V-JEPA 2 / 2-AC | JEPA | 300M–2B | MIT | CC BY-NC 4.0(非商用) | ~4.4k | 单卡消费级可推理 |
| DINO-WM | JEPA | 紧凑预测器 | MIT | 随仓库 | <1k | 近实时规划级 |
| RynnVLA-002 | 具身操作 | ~7B | Apache-2.0 | 随 Model Zoo | ~1.1k | 单张大显存卡 |
| Genie-Envisioner | 具身操作 | 基于 LTX-Video 2B | CC BY-NC-SA(部分 Apache-2.0) | ModelScope | ~0.57k | 单卡 |
| EnerVerse-AC | 具身操作 | UNet 扩散 | CC BY-NC-SA 4.0(非商用) | 单视角 ckpt | ~0.18k | 单卡 |
| iVideoGPT | 具身操作 | 压缩 tokenizer + AR | MIT | HF/始智云 | ~0.19k | 单卡 |
| HunyuanWorld-1.0 / Voyager | 3D | PanoDiT / RGBD 扩散 | 腾讯定制社区 License(有地域禁令) | 同左 | ~2.9k / ~1.6k | 完整版 32GB+;Lite FP8 可上 4090 |
| Matrix-Game 2.0/3.0 | 3D/交互 | 基于 SkyReels-V2 | MIT / Apache-2.0 | HF 开放 | ~2.3k | ≥24GB |
| Spark | 3D 渲染 | —(Marble 闭源) | MIT | — | ~3.4k | 浏览器/THREE.js |
三个结构性事实:
- License 的「干净程度」与机构性质强相关——芯片与游戏大厂(NVIDIA、昆仑万维)倾向 Apache/MIT 可商用条款;Meta、智元给权重套上 CC BY-NC,把开源定位为研究引流。
- 参数量与工程门槛几乎不相关——真正拉开差距的是显存带宽与推理管线优化。
- Star 数最低的恰是学术密度最高的具身操作一组——该方向 2025 年才兴起,社区尚在早期,抢先采用的边际收益反而最高。
7.3 本地部署显存速查
| 档位 | 模型 | 备注 |
|---|---|---|
| ≤24GB 单卡可跑 | Matrix-Game-2.0、SkyReels-A2、Cosmos-Reason1-7B、HunyuanWorld-Lite FP8 | HunyuanWorld-Lite 为第三方博客口径,建议对照官方 README 复核 |
| 需更大显存 | Cosmos-Predict2/2.5 的 2B(26–33GB)、14B(49–57GB);HunyuanWorld 完整版(32GB+) | 社区实测 7B 单卡 H100 80GB、14B 双卡 H100 或单卡 H200 |
Jetson 级边缘设备:像素生成路线只适合离线合成数据,边缘在线规划应选紧凑潜空间动力学(DINO-WM 类),冻结特征加小型预测器才是务实解。
7.4 License 风险清单
| 风险类型 | 涉及项目 | 具体限制 |
|---|---|---|
| 非商用条款 | V-JEPA 2 权重、EnerVerse-AC、Genie-Envisioner 主体 | 研究与论文复现无碍,商业产品禁用 |
| 地域与规模条款 | HunyuanWorld-Voyager | 禁 EU/英国/韩国;月活超 100 万需授权;禁止用其输出改进其他模型 |
选型建议:
- 要权重最干净可商用 → Cosmos、Matrix-Game、iVideoGPT
- 要具身操作真机管线 → RynnVLA-002(目前唯一权重级可商用的统一 VLA+WM 方案)
- 要发论文做 baseline → V-JEPA 2、Genie-Envisioner、EnerVerse-AC(非商用条款不构成障碍)
八、效果横评
⚠️ 前置警告:不同路线的指标定义、评测方、硬件条件差异极大,跨路线直接比数字没有意义。以下对比均限定在同一基准内部。
8.1 物理一致性:三个基准指向同一结论
| 基准 | 最佳模型成绩 | 人类/上界 | 口径 |
|---|---|---|---|
| VideoPhy-2 困难子集 | Wan2.1-14B 21.9% | —(人评) | 联合达标率 |
| Physics-IQ(i2v) | Sora 2 42.3% | 物理方差基线 100 | Original 榜单(部分自报) |
| Physics-IQ Verified(i2v) | Cosmos3-Super-I2V 39.5% | 100 | 统一流水线复测 |
| IntPhys 2 Overall | V-JEPA 2-h 57.51% | 人类 96.44% | 评测方自测 |
结论:无论生成式还是预测式,当前模型对物理规律的理解在困难场景下都接近随机或远低于随机上界,与人类近满分的表现存在数量级差距。
8.2 具身操作成功率:高分与扰动掉分并存
标准 LIBERO(论文自报):
| 方法 | 类型 | 平均成功率 |
|---|---|---|
| OpenVLA (7B) | 自回归 VLA | 76.5% |
| WorldVLA (7B) | 统一 VLA+WM | 81.8% |
| DreamVLA (0.4B) | 世界模型类 | 92.6% |
| π0 (3B) | Flow-matching VLA | 94.2% |
| π0.5 (3B) | Flow-matching VLA | 96.9% |
| UniVLA (9B) | 潜动作 VLA | 95.2% |
LIBERO-Plus 扰动测试(第三方复测):
| 方法 | 标准分 | 扰动后 | 跌幅 |
|---|---|---|---|
| OpenVLA | 76.5% | 15.6% | -79.5% |
| WorldVLA | 81.8% | 25.0% | -69.5% |
| π0 | 94.2% | 53.6% | -43.1% |
| π0.5 | 96.9% | 80.7% | -16.7% |
两个规律:扰动下的排名与标准基准不一致(π0 系远稳于自回归系);世界模型统一训练带来的标准分增益在扰动下保留得相对较好,但绝对水平仍不足以支撑真实部署。
8.3 规划效率:潜空间对像素空间的代际差
| 方案 | 单步规划 | 硬件 | 成功率 |
|---|---|---|---|
| V-JEPA 2-AC(CEM) | ~16 秒 | RTX 4090 | 零样本 pick & place ~80% |
| Cosmos 扩散式 | 4 分钟+ | 同硬件 | 0–30% |
| DINO-WM(MPC) | 近实时 | 消费级 | PushT 0.90 |
潜空间规划只需前向若干次小型预测器,比像素生成方案快一个数量级——表征质量决定规划上限。
8.4 实时性
| 模型 | 实时性指标 | 硬件 |
|---|---|---|
| Genie 3 | 720p @ 24 fps,一致性数分钟 | 云端(未公开) |
| RTFM | 单 H100 交互级帧率 | 1×H100 |
| Cosmos-1.0-AR-4B + Medusa | 320×512 下 10.08 帧/s | 8×H100 |
| Matrix-Game 2.0 | 25 fps 实时流式交互 | ≥24GB 单卡 |
实时交互门槛已被集体跨过,但成本差异接近一个数量级。
九、从业者建议
9.1 四条路线怎么选
重要:表内任何一行都不能与另一行直接比「好坏」,它们回答的是不同问题。
| 路线 | 核心假设 | 数据需求 | 实时性 | 物理保真 | 直接用于控制 | 成熟度 |
|---|---|---|---|---|---|---|
| 视频生成 | 物理可从像素涌现 | 海量互联网视频 | 中 | 低-中 | ❌ 困难(4 分钟+/步) | ★★★★ |
| JEPA 潜空间 | 在抽象表征中预测状态 | 100 万小时视频 + 62h 机器人数据 | ✅ 好(16 秒/步) | 相对最佳(57.5%) | ✅ 适合 | ★★★ |
| 3D 空间智能 | 空间结构是智能的基础 | 文本/单图/多视角 | 中(生成 2–5 分钟) | 几何高 / 动力学弱 | ⚠️ 需下接引擎 | ★★★ |
| 具身操作 | 动作条件预测与动作生成可统一 | 带动作标注的机器人数据 | 中 | 动作忠实为主 | ✅ 原生支持 | ★★★ |
一句话记忆法:
- 想造数据 → 视频生成路线:工程落地用 Cosmos
- 想做规划 → JEPA 潜空间:V-JEPA 2-AC
- 想建环境 → 3D 空间智能:要商用支持选 Marble,要二次开发选 HunyuanWorld
- 想嵌进 VLA → 具身操作:RynnVLA-002
- 想边缘平台在线规划 → 紧凑潜空间:DINO-WM(Jetson 级唯一务实解)
「选一条路线」本身就是伪命题。2026 年的工程现实是分层混合:神经仿真器负责视觉多样性与长尾场景,显式物理引擎保住接触动力学,潜空间模型在控制回路里做快速预演。
9.2 2026 四大趋势信号
| 信号 | 证据 |
|---|---|
| 视频生成、机器人与仿真三方合流 | Cosmos 下沉为机器人合成数据基础设施;Genie 3 向「智能体训练场」演进;Marble + Spark 把显式 3D 推向可编辑、可接入仿真 |
| VLA 内嵌世界模型成为演化方向 | WorldVLA 证明互增益;Cosmos 3 直接输出关节角、夹爪位姿;智元计划推出融合 ViLLA 与世界模型的 GO-3 |
| 世界模型吃掉「策略评估」与「奖励函数」 | RoboScape Pearson 0.953;WorldGym 仅凭单张初始图像完成策略全流程评估;World-in-World 获 ICLR 2026 Oral |
| 神经仿真器与物理引擎收敛为混合架构 | 智元 Genie Sim 3.0 = Isaac Sim 物理引擎 + 三维重建 + 视觉生成 + LLM 场景泛化 |
分层混合架构的终局形态:
9.3 四条可执行建议
1. 不把世界模型当单一赛道:先判路线归属,再谈指标
读一篇世界模型论文,第一个动作应是判断它属于哪条路线。IntPhys 2 是最直观的警示:全行业模型在复杂场景直觉物理上接近随机(~50%,人类 96.4%)——如果用生成画质去推断一个模型能否做规划,这个落差会让你做出错误决策。
2. 短期工程收益最大的组合:开源视频模型造数据 + 动作条件化嵌入 VLA
如果只能在 2026 年落地一件事,选「路线一+路线四」的合成数据组合:用 Cosmos 生成目标场景的机器人视频,经逆动力学恢复伪动作后微调 VLA。GR00T-Dreams 让 GR1 仅凭单一环境遥操作数据学会 22 种新行为,新行为成功率从 11.2% 提升到 43.2%。合成数据是当前世界模型离投资回报率最近的位置。
3. Jetson 级边缘平台:紧凑潜空间规划是唯一务实解
像素生成规划在 RTX 4090 上每步需 4 分钟以上,进不了控制回路;V-JEPA 2-AC 的潜空间 CEM 规划每步约 16 秒。要更低延迟就走 DINO-WM(冻结 DINOv2 特征、零样本规划,MIT 开源)。⚠️ 注意:V-JEPA 2 权重是 CC BY-NC 非商用许可,商用部署需另行授权。
4. 给系统留「第三层」,给选型先查 License
架构上,在「大脑(VLA 决策)—小脑(控制)」之外保留第三层做预演与反事实评估。工程上,选型第一步不是跑 demo,而是查 License:V-JEPA 2 权重限非商用,HunyuanWorld-Voyager 含 EU/英国/韩国地域禁令,EnerVerse-AC 主体 CC BY-NC-SA——任何一个都足以让产品化在上线前返工。

结语:世界模型的路线之争远未收敛,但对工程师而言这恰恰是好消息——不必押注终局,只需按功能分层组合当下最强的开源件。明年的答案大概率不同,而这套组合方法论不会过时。
分享完成~
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)