写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

许多 VLA 将大规模预训练视觉语言模型直接作为动作骨干,希望从通用视觉与语言知识中换取更好的机器人控制。WorldDiT 反过来追问:若不把一个数十亿参数的 VLM 放在动作路径上,能否让一个统一扩散 Transformer 同时学习连续动作和未来视觉预测,并保留强控制能力?

WorldDiT 的答案是一种训练与部署不对称的设计。训练时,模型从三步双视角观察、机器人状态和语言指令出发,同时对 7 步动作块与未来时刻的双相机 RGB patch 做 flow matching;部署时,未来 RGB token 与其输出头完全移除,只从高斯噪声生成动作,并执行前 3 步后重新规划。

作者报告完整系统共有 399.084M 参数,其中 135.107M 可训练。在四个 LIBERO 套件上,分别得到 98.0%、97.0%、92.8%、91.8%,均值 94.9%;在论文收录的 24 个方法中,这个点位于“总参数量—四套平均成功率”的报告 Pareto 前沿。

WorldDiT 在 LIBERO 成功率与总参数量上的位置

图 1:论文以部署所需的总实例化参数为横轴、四个 LIBERO 套件的报告平均成功率为纵轴。399M 的 WorldDiT 位于作者整理的 Pareto 前沿。图中比较来自不同论文的已报告数字,并非统一复现实验。来源:原论文 Figure 1。

猫先生认为,WorldDiT 的核心价值是把“世界模型”降到一个很具体、可服务控制的辅助目标:不要求生成完整未来视频,只要求让同一个扩散骨干在训练中对未来视觉 patch 保持可预测。 它的成绩说明这条路线值得继续扩大,但尚不能证明未来 RGB 预测本身就是性能提升的因果来源,因为论文没有给出移除该目标的消融。

  • 论文标题:WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
  • 论文地址:https://arxiv.org/abs/2607.23909
  • 作者机构:Bagel Labs

原文脉络

第 1 节从“大 VLM 动作骨干难以区分规模收益与架构收益”的问题出发,用 Figure 1 给出参数–成功率比较。第 2 节定义统一多模态编码、动作与未来 RGB patch 的 flow matching 训练目标,以及推理时的滚动控制。第 3 节说明 LIBERO 数据、模型规模、训练协议与结果。第 4 节回到参数效率和未来扩展方向。全篇只有 9 页,方法与实验都很集中。

1. Introduction:控制模型是否一定需要大 VLM?

大 VLM 作为动作骨干有两个好处:视觉和语言表征已经预训练充分,模型可以直接利用这些能力生成动作。但它也让比较变得困难:一个策略表现强,究竟来自动作解码方式、训练数据,还是来自数十亿参数的通用骨干?

WorldDiT 选了一条更紧凑的路径。视觉与文本侧仍使用冻结的 MAE 与 CLIP 编码器,却不让大型 VLM 负责动作生成;可训练的核心是一个共享 DiT。它接收多模态上下文,在训练中学习两类连续目标:

  • 未来 7 步的 7 自由度动作块;
  • 未来时刻两台相机画面中的归一化 RGB patch。

这类设计更接近“控制导向的世界建模”,而不是把环境做成可自由采样的视频生成器。未来视觉目标的职责是约束动作骨干内部表征,让它既能拟合动作,也能对动作之后的视觉状态保持预测能力。

2. Method:一个 DiT,两个 flow-matching 目标

2.1 训练窗口:3 步上下文、7 步动作、1 个未来视觉目标

每个样本窗口长度为 N = C + H = 10 N=C+H=10 N=C+H=10:前 C = 3 C=3 C=3 步是已观察上下文,随后 H = 7 H=7 H=7 步是动作目标。每个观察时刻包含主相机图像、腕部相机图像、机器人状态和共享的语言指令。

未来视觉监督不覆盖整段视频。模型取当前动作块末端 i + H i+H i+H 的主相机和腕部图像,以 224 × 224 224\times224 224×224 预处理,每帧切成 16 × 16 16\times16 16×16 patch;每台相机均匀保留 64 个 patch,共 128 个 768 维 patch 向量。每个 patch 自己做均值和方差归一化,目标是预测其归一化 RGB 值,而非重建可直接观看的像素帧。

WorldDiT 的训练窗口、统一编码与联合目标

图 2:三步干净上下文经过冻结 MAE、冻结 CLIP、Perceiver Resampler 与状态编码后,条件化同一个 WorldDiT。动作 token 与未来 RGB patch token 被加噪;动作查询受严格 block-causal 掩码保护,不能读取 RGB 目标。来源:原论文 Figure 3;原论文 Figure 2 为四条成功 rollout 的截图,未提供方法对比或失败证据,故未收入。

2.2 统一编码:冻结感知器,训练控制接口与 DiT

每个时间槽位包含三类干净条件 token:34 个视觉 token、1 个语言 token、1 个状态 token。视觉由冻结 MAE 编码,经共享 Perceiver Resampler 与视角投影压缩;语言由冻结 CLIP 文本编码器处理;机器人状态则把机械臂和夹爪分开编码后投影为一个 token。

这些模块的分工很明确:冻结编码器提供通用视觉和文本表征,训练中的 DiT 学习把表征转成机器人时序控制。WorldDiT 主干深度为 4、隐藏维度 1024、16 个注意力头,带 4 个 register token。总参数量 399.084M,其中只有 135.107M 是可训练参数;论文把冻结模块也纳入总参数统计,因为部署时它们仍必须存在。

2.3 Flow matching:动作与视觉共享噪声到目标的速度场

对动作或 RGB patch 的干净目标 y y y,先采样高斯噪声 ϵ \epsilon ϵ 和时间 τ ∈ [ 0 , 1 ] \tau\in[0,1] τ[0,1],构造直线路径:

x τ = ( 1 − τ ) ϵ + τ y . x_\tau=(1-\tau)\epsilon+\tau y. xτ=(1τ)ϵ+τy.

WorldDiT 预测从当前噪声状态走向目标的速度 v θ v_\theta vθ,对应的 flow-matching 损失为:

$$
\mathcal{L}_{\text{flow}}

\mathbb{E}\left[\left|v_\theta(x_\tau,\tau,c)-(y-\epsilon)\right|_2^2\right],
$$

总损失是动作速度损失与 RGB patch 速度损失的加权和:

L total = w action L flow action + w rgb L flow rgb . \mathcal{L}_{\text{total}} =w_{\text{action}}\mathcal{L}_{\text{flow}}^{\text{action}} +w_{\text{rgb}}\mathcal{L}_{\text{flow}}^{\text{rgb}}. Ltotal=wactionLflowaction+wrgbLflowrgb.

微调时作者设定 w action = 0.1 w_{\text{action}}=0.1 waction=0.1 w rgb = 0.001 w_{\text{rgb}}=0.001 wrgb=0.001。动作损失的权重远高于视觉目标,说明世界建模被定位为辅助约束,而非与控制同等重要的生成任务。

一个防止信息泄漏的细节很重要:动作查询只能读取当前和过去的干净上下文,不能读取已加噪的未来 RGB target token。否则模型可能借助包含未来信息的视觉分支“作弊”,把训练时看见的未来间接传给动作头,部署时便会失效。

猫先生认为,WorldDiT 的统一性并不等于“动作和图像完全混为一谈”。它共享的是 DiT 的时序建模能力与 flow-matching 形式,通过注意力掩码把未来视觉目标隔离在动作决策之外;没有这层隔离,所谓世界–动作联合训练很容易变成未来信息泄漏。

2.3 Inference:去掉世界分支,执行 3 步再规划

部署时,输入仍是最近 3 步主视角/腕部视角、机器人状态和指令,但不再输入未来 RGB patch,也不运行 RGB velocity head。动作 token 从高斯噪声初始化,经 20 次 Euler 积分生成一个 7 步动作块;控制器只执行前 K = 3 K=3 K=3 步,更新观察窗口后重新采样与规划,并对重叠绝对时间上的动作进行 temporal ensembling。

WorldDiT 的动作生成与滚动时域控制

图 3:部署路径移除了 RGB target token 和 RGB 输出头,仅以三步历史条件化 WorldDiT,从高斯噪声经 20 个 flow 步生成 7 步动作;每次执行前 3 步后观察并重规划。来源:原论文 Figure 4。

“训练时有世界目标、推理时只有动作”的不对称设计带来两层收益:视觉预测不增加部署时的 RGB token 和输出头开销;滚动重规划又限制了开环误差累积。但它并不提供显式的未来视频或可供人检查的世界轨迹,世界模型的状态只作为控制特征存在于共享 DiT 中。

3. Experiments:94.9% 的含义与比较边界

WorldDiT 先在 LIBERO 的 libero_90 多任务拆分上预训练 30 个 epoch,再对 Spatial、Object、Goal、Long 四个下游套件分别微调。每个套件汇总 500 个仿真 episode;训练在一台含 8 张 RTX Pro 6000 的节点上完成。

LIBERO 套件 WorldDiT 成功率
Spatial 98.0%
Object 97.0%
Goal 92.8%
Long 91.8%
平均 94.9%

同一张结果表中,WorldDiT 高于没有大预训练 VLM 动作骨干的 DreamVLA(92.6%)、FlowVLA(88.1%)和 DiT Policy(82.4%);但低于 ACoT VLA(98.5%)、MMaDA VLA(98.0%)等大型 VLM 动作骨干方案。图 1 所说的 Pareto 前沿并不是“全表最高分”,而是给定 399M 总参数后,比较表中没有更小或等参数的模型报告更高的四套平均分;比它分数更高的模型需要更多总参数。

3.1 结果不能当作完全独立的测试估计

论文在实验设置中明确写出:每套 500 个 episode 的汇总中,包含 300 个用于分阶段检查点选择的 episode。因此 94.9% 不是严格完全 held-out 的无偏测试估计。作者还指出,部分比较方法没有完整公开权重和训练代码,表格只能引用各自论文报告的数字,无法在统一协议下复现。

这两个披露反而让结果的适用范围更清楚:WorldDiT 是一个很有竞争力的紧凑基线,但当前证据更适合支持“在已报告比较中参数效率突出”,不适合支持“已经确定优于所有现有 VLA”。

3.2 缺少的关键消融:世界目标到底贡献多少?

论文的技术主张依赖未来归一化 RGB patch 作为训练信号,但正文没有报告以下对照:

  • 去掉 RGB patch loss,只训练动作 flow;
  • 分别使用主视角或腕部的未来视觉目标;
  • 改变未来 offset、patch 数量或 RGB loss 权重;
  • 用更简单的视觉自监督目标替代未来 RGB patch。

因此,WorldDiT 证明了“联合训练可以得到 94.9% 的报告均值”,却没有分离出未来视觉监督带来的净增益。未来工作若能提供这些消融,才能回答它是改善了状态表征、正则化了动作生成,还是主要受益于预训练与微调协议。

4. Discussion:世界模型在这里更像可控的辅助预测器

WorldDiT 并不声称可在像素空间长程滚动生成世界。它只在一个固定未来偏移上预测稀疏的、归一化后的 patch,并且只把损失施加在最后的时间槽位。这种选择牺牲了可解释的完整生成能力,换来了较小的辅助目标和不增加推理路径的部署方式。

它的边界也很清晰:

  • 单一基准。 所有主结果来自 LIBERO 仿真,没有真实机器人或跨机体验证;
  • 分别微调。 四个套件使用独立 fine-tuned 模型,不是一个单模型同时覆盖四套任务;
  • 世界预测不可见。 推理时 RGB 分支被移除,无法直接检查模型预测了怎样的未来;
  • 未验证缩放规律。 论文只评估一个 399M 配置,Pareto 图不是 scaling law;
  • 复现信息不完整。 作者明确说明权重与完整训练代码尚未完整公开,横向结果也来自文献报告。

总结:把世界建模变成动作学习的训练信号

WorldDiT 用一个共享扩散 Transformer 同时处理动作 chunk 与未来 RGB patch 的速度场。冻结 MAE/CLIP 负责感知与语言表征,399M 总参数系统在训练时得到未来视觉监督,部署时则只保留动作采样和 3 步滚动重规划。这个设计给出了一条不同于“大 VLM 直接出动作”的紧凑 VLA 路线。

文章最值得带走的判断有两点:第一,世界模型可以是训练期的局部预测约束,而不必是部署期的视频生成模块;第二,399M 与 94.9% 的组合说明紧凑扩散控制很有竞争力,但世界目标的独立贡献、完全 held-out 泛化、真实机器人效果和开源复现仍需要后续证据。

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐