最近几个月,世界模型很热。

热到什么程度?从 DreamZero 开启行业热浪,Jim Fan 宣传「VLA 已死,WAM 万岁」。再到最近一个月,智元罗剑岚、英伟达和PI、字节、极佳,很多头部公司都在推出新进展。

世界模型好像已经成为了具身终局的代名词。不止一个技术同学找我们交流, 说现在世界模型太火了,变化实在是太快了。

热闹是热闹。但我们心里一直有个疑问:

所有人都在证明「我的世界模型多强」,却很少有人正面回答另一个问题:世界模型到底怎么让一个具身模型变强?

这个问题困扰我们有一段时间了,让我找到灵感的是原力灵机联合创始人汪天才的一句话,他说:世界模型驱动低成本、规模化的后训练,是具身智能进入真实场景的现实路径。

他没有说终局、唯一、原生这些大词,只说了「现实」,并把一些使用心得和经验告诉了大家。他们用世界模型做了哪些事情,背后的思考以及判断。

原文链接:最近我们发现,世界模型开始有了更务实的场景应用…

在这里插入图片描述

以及原力灵机对应发布了DM0.5和DW0.5,DM0.5我们之前聊过了,所以今天想借着这个机会和讨论上面的问题。

表面看,DW0.5也是一个刷了 SOTA 的世界模型:EWMBench 4.66、WorldArena 73.54、RoboTwin2.0 93.3,三个榜第一(均截至 2026-07-09)。

但真正促使我们想写这篇文章的,不是这几个数字。我隐隐有一种感觉:我们不应该把技术本身定义成为目标,这样有些本末倒置,而应该从目标出发,充分挖掘技术可能的能力。

现在行业有一股风气,把技术路线等同于具身智能,我们认为并不是这样的。

这就是我从DW0.5上看到的东西,下面一步步来。

GitHub:https://github.com/dexmal/opendw
Hugging Face:https://huggingface.co/Dexmal/DW05-Base

01 世界模型确实很热

先把这波热潮盘一下。

这一个月密集出现的世界模型工作,方向确实各异:有的做开放世界的未来预测,有的做双臂操作的仿真评测,有的做大规模视频生成。

但如果从这些工作的用途来看,都落在一件事上 —— 评测。用世界模型生成未来场景,然后看生成质量、评得准不准、在榜单上排第几。

这当然有价值。一个能准确预测未来的世界模型,本身的确有技术含量。

但问题来了:VLA 现在真正卡在哪?

不在于"有没有一个更强的世界模型可以推演未来"。做过具身后训练的同学感受会更深,**真机 rollout 的成本是根本性障碍,人工反馈效率极低。**因此,VLA的瓶颈之一在于训练效率,它没法像人一样反复试错、从失败里学。

这里可以借助另一个参照物。过去三年,语言模型里进步最快的是 code agent,快得离谱。很多人把功劳归给更大的模型、更多的数据。但如果只是规模问题,为什么 code 的进步比别的任务快那么多?

原力灵机在 DW0.5 里给了一个解释:**代码是可以自我验证的。**写完一段代码,测试一跑,对错立刻知道;失败的结果直接沉淀成下一次的训练信号。反馈高频、判定明确、数据可以回流。这套自己给自己判分的机制,才是 code agent 快速变强的真正原因。

具身没有这套东西。

一个 VLA 想变强,它需要动作尝试之后再看结果,判断是成功亦或失败,进一步再将反馈转换为学习信号。可在真机rollout上,没有捷径。另一方面,传统仿真的 sim-real gap,在日常操作任务上格外难弥合。

所以VLA 真正需要的,是一种新的闭环方式:比真机便宜,比人工反馈高频,比传统仿真更贴近真实物理。围绕这个目标出发,任何可以解决这个问题的技术都可以进行尝试。

原力灵机在当前阶段给出的答案,就是DW0.5。他们给世界模型的定位是后训练中的 learned environment。

02 DW0.5 的核心,从目标本身出发

DW0.5 的核心,都是围绕「为 VLA 构建一个可闭环迭代的世界模型」这个目标设计的。而这个闭环迭代可以概括为:

  1. VLA 根据语言指令、当前观察和机器人状态采样候选动作;

  2. DW0.5 在动作条件下生成对应的未来视觉 rollout;

  3. Value Expert 对当前状态、候选未来或整段 rollout 给出成功概率或任务价值评分;

  4. 系统根据这些反馈选择动作、构造偏好数据,或对 VLA 做 RL 后训练;

  5. 少量真机 rollout 持续校准世界模型,让闭环不断贴近真实部署分布。

真机不会消失,它是飞轮的起点,却不是唯一的训练场所。真实 rollout 校准世界模型,世界模型支持低成本大规模探索,新的策略再回到真实环境验证和收集数据。
在这里插入图片描述

具体落实为三种能力:Action作为强先验、如何模拟成功与失败、如何把未来变成可训练的反馈。

生成只是世界模型最基础的能力

一个世界模型能不能参与到训练过程,有一个最基本的测试:给定同样的起点,输入一个向左推、一个向右推,它生成的未来场景是否不一样?

如果两段生成视频看着差不多,那它就只是个带成功偏置的视频生成器。

不管你给什么动作,它都倾向于生成一段「顺利完成」的画面。这种东西对训练毫无用处,因为它压根没在响应你的动作。

难点在于怎么让动作「说话算数」。一种常见做法是把动作离散成 token、纳入到语言模型的词表,当成生成视频的一个条件。

实现简单,但这仅是软约束。动作 token 进了语言空间后,模型可以参考它,也可以在追求画面顺滑时偷偷把它弱化掉。

你给一个明明会把物体推歪的失败动作,它照样可能生成一段成功的过程。而且动作和视频帧之间没有时间对齐,模型根本不知道第 3 帧夹爪该在哪、接触发生在哪一刻。

这两个局限其实限制了世界模型能发挥的作用。

DW0.5 的做法是把动作当成生成的一等条件,用一个叫 group-diagonal attention mask 的结构,把动作和视频在每一帧上强制绑定:第 i 帧的视频只能看第 i 组动作,不会跟全局的动作信息糅杂在一起。简单来说,向左推和向右推这两串动作,在模型内部从第一步就走上了两条完全不同的路,自然生成两个不同的未来。

这一步做到了,才谈得上后面的事:VLA 一次采样出好几个候选动作,DW0.5 给每个动作各自演一遍不同的未来,供后续评测。

这里是 DW0.5 使用世界模型的第一层能力,生成

成功与失败,都很重要

第二个关键点,也是行业最近都在强调的内容:一个训练场所,必须学会模拟失败。这部分,原力灵机把世界模型定义为Video Expert。

道理不难懂。

如果世界模型的训练数据的全是专家的成功轨迹,它会过拟合,养成一种过强的「成功偏见」。

你给它什么动作,它都给你生成一个任务完成的结局。这样的模型没法告诉 VLA「你这么做会把物体推到再也够不着的地方」,没法惩罚错误动作,自然也没法拿来做强化学习。

它展示的只是成功长什么样,一个只会让你赢的陪练,其实就是啦啦队。
在这里插入图片描述
在这里插入图片描述

DW0.5 的数据策略围绕这一目标设计,来自四类来源:真机和仿真里跑出来的成功、失败、偏离、卡住、恢复各种轨迹都往里喂,还接了 RoboChallenge 的真实成败案例。

仿真负责高效地探索那些危险的、容易失败的动作空间,真机负责提供真实的接触噪声和执行误差。两头一凑,DW0.5 不只学"该怎么做对",也学"做错了世界会变成什么样"。

除此之外,还有常见的公开数据与自采机器人数据、互联网视频数据、Egocentric 数据,这部分我们就不再赘述了。

这里是 DW0.5 使用世界模型的第二层能力,仿真。

总结来说,这一步是能上强化学习的前提。没有失败,就没有可以拿来优化的信号。

把只有终局才有的胜负,细化到每一步

前两个部分做完,世界模型已经能告诉 VLA「你这么做,未来大概长这样」。

但还差一样东西:VLA 做强化学习需要 reward,需要知道哪个动作该鼓励、哪个该给负反馈。

机器人任务的 reward 出了名的稀疏,往往要等任务完成,才能计算奖励信号。可很多失败在中间早有征兆:物体姿态偏移、夹爪接触点不稳、目标被推进了低成功率的区域。

这些信号要是等到任务结束,训练效率是极低的。

DW0.5 加了一个 Value Expert,专门做评测这件事。它对当前状态、候选轨迹、整段生成的未来打一个成功概率分,把只有终局才有的那一票胜负,细分成每一步都能拿到的反馈。

这对应原力灵机强调的「对执行效果做准确打分」。在闭环系统中,Value Expert 可以用于:

  • 候选动作筛选:对多个 rollout 打分,让 VLA 选择更可能成功的未来;

  • RL 后训练的 reward 信号:在世界模型环境中对 VLA 做策略优化,无需频繁占用真机;

  • 部署时的在线监测:发现当前状态偏离成功路径,及时触发重新规划或失败恢复。

看下面两个例子。上面是成功的例子,reward和任务过程正相关。下面是失败的例子,就需要给模型较强的负反馈。
在这里插入图片描述
在这里插入图片描述

这里是 DW0.5 使用世界模型的第三层能力,闭环训练,也就是真机RL。

打个比方,Video Expert 是能陪你把动作演一遍、还会让你输的陪练;Value Expert 是站在场边的裁判,每一步都给出精准的打分。

这两个部分融合,一个能真正跑起来的强化学习闭环才算成型。

03 三个设计,服务同一个闭环

把这三个部分串起来,DW0.5 的闭环就成型了。

VLA 根据指令采样出多个候选动作 → DW0.5 给每个动作演出不同的未来(有成功也有失败)→ Value Expert 给这些未来打分 → 系统拿这些分去筛动作、造偏好数据,或者直接对 VLA 做强化学习后训练 → 少量真机 rollout 持续校准,让这个仿真训练场不至于偏离真实世界。

所以同一个世界模型,在这套闭环里同时扮演了三个角色:生成、仿真、闭环训练。
在这里插入图片描述

这也是 DW0.5 给我们的一点启发:不把某个技术固化为单一用途,从目标出发榨干技术价值。

在原力灵机的发布会上,DFOL2.0 接上 DW0.5 做闭环后训练,真机训练数据需求下降约 60%、整体训练成本下降约 40%。

据我们了解,这是行业第一次把世界模型规模化用进具身后训练闭环,榜单是这个能力的具象化表现,大家针对性吸收。

DW0.5 的模型权重也已经开源(Dexmal/DW05-Base),代码放在了 opendw 仓库。

  • 链接:https://github.com/dexmal/opendw

这一点值得单独提一句:愿意把技术开源,比多刷一个榜要更实在。

也期待后续有技术的小伙伴跟我们反馈使用体验。

04 写在最后:目标比方法重要

写到这里,一个更大的分野也比较清楚了。

这一波世界模型热潮,多数公司的选择是:不停发新的世界模型、不停打榜、反复强调自己在某个榜单上的地位。

这条路没有错,生成质量本身是硬指标。但它容易让人忘了为什么出发:这些榜单第一,最后帮哪个具身模型,变强了多少?

原力的选择有一些第一性原理的味道:先判断具身当下的卡点(后训练太贵、飞轮转不起来),再把世界模型拿来当解法。

这个区别看着不大,其实决定了你最后会做出什么东西。

说到底,真正拉开差距的,是你到底想解决什么。谁的技术短期领先,反而没那么关键。在我们和原力的同学交流的过程中,给我最大的感受就是务实。

对现状的判断也很踏实,他们说短期来看具身的落地困难重重,内部其实是打算长期备战,不会现阶段过分强调场景落地。在技术发展的过程中,持续的打磨自身的实力,构建自己的护城河。

也正因为这样,给世界模型钦定一个「正确用途」这件事本身就没什么必要了。它能生成、能评测、能当训练场,具体用来干嘛,得看你要解的问题,跟贴什么标签没关系。

把某个技术本身当成终局去follow,多少有点本末倒置。

当然话说回来,DW0.5 也只是第一步,能做的事情还有很多。

期待大家后续的技术进展。

重磅!

全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)

推荐阅读

真机强化入门的一套完整教程!pi*0.6复现方案

我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~

具身智能的WAM与世界模型一份完整指南~

一览具身智能的行业全局,从产品经理的角度出发!

VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~

好用,高性价比!面向具身科研领域打造的轻量级机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

从零训练你的足式机器人!让你的足式机器人真正动起来~

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐