Dyna-2:世界-动作模型的百万小时规模化定律(下)
26年8月来自dyna公司的博客“Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models”:https://www.dyna.co/dyna-2。
一个基于超过 100 万小时人类视频预训练的世界动作模型展示适用于人类和机器人评估的规模化规律,以及其背后的许多技术见解。

。。。。。。继续。。。。。。
4. 模型附加功能及扩展分析

虽然本研究的主要重点是探索规模化的涌现(如上图所示),但 Dyna-2 还具有许多其他值得分享的有趣功能。具体而言,通过一系列直接比较发现,Dyna-2 在各方面都优于Dyna-1 模型,其指令跟踪能力可随目标函数和数据量扩展,并且只需一步推理即可生成视频。需要注意的是,此处的实验是在“生产”Dyna-2 模型上进行的,这些模型使用了不同的训练方案,但所有发现都具有普遍性,并适用于专门为尺度律实验训练的变体。
WAM 与 VLA:直接比较
在最终确定 Dyna-2 方案的过程中,还对 WAM 和视觉-语言-动作 (VLA) 模型 [13, 3] 进行了严格的直接比较。目前,业界尚未就哪种架构更优达成共识,也缺乏实证证据。已发表的比较研究在训练数据、计算预算、评估协议以及双方检查点的调优程度等方面存在差异[4, 37]。
采用完全一致的比较方法,将早期版本的 Dyna-2 与之前的生产级 VLA 架构 Dyna-1 进行了比较。Dyna-1 采用类似的混合 Transformer 架构进行动作预测,其初始模型基于 Qwen3-VL-4B [32]。在匹配的条件下训练并比较了这两个模型:相同的预训练和后训练数据集以及训练超参数;每次后训练运行都使用每个架构的三个不同的预训练检查点进行初始化,以消除检查点选择偏差。值得注意的是,这种比较实际上对 WAM 并不公平。首先,此处测试的早期 Dyna-2 版本早于本技术报告的大部分内容:没有 100 万小时的预训练,并且整个模型仅使用动作损失进行监督。其次,更重要的是,整个实验流程都针对VLA进行优化:数据集的收集和整理均符合VLA的规范,训练超参数也沿用了VLA的调优方案。因此,可以将这些结果解读为WAM模型相对于经过良好调优的VLA基线模型性能的下限。
以下展示7个基准任务的汇总结果。汇总所有试验和检查点后,WAM模型的成功率是VLA的1.55倍,得分是VLA的1.12倍。在直接对比中——同时固定预训练检查点步骤和训练后任务——早期的Dyna-2模型胜率达到65%,Dyna-1模型胜率为29%,平局率为6%。VLA模型的大部分胜利都出现在最早的预训练检查点,此时WAM模型的预训练优势尚未积累。

定性案例研究
除了汇总的训练后结果外,还报告了其定性行为的一些发现。与 Dyna-1 相比, Dyna-2 在生成更高质量的成品和应对极端干扰条件方面表现更佳。作为案例研究,考察蔬菜切碎任务,该任务最初使用 Dyna-1 进行演示。在该任务中,Dyna-2 和 Dyna-1 切出的芹菜质量存在显著差异。在相同的数据集配置下进行训练后,Dyna-2 切出的芹菜片比 Dyna-1 更薄、更均匀,与专家演示的结果非常吻合。
此外,由于训练后数据集较小,Dyna-1 在此任务中对干扰较为敏感,而 Dyna-2 即使在极端工作条件下也能无需人工干预运行:
光照强度改变和降低。改变工作区域的光照强度,然后又移除大部分光照。在这两种情况下,Dyna-2 都能精确地完成任务。
视觉输入丢失。在运行过程中移除策略的部分视觉输入。Dyna-2 仍然能够继续运行。其视为对传感器丢失的鲁棒性,而非对未观测场景状态的预测。
坚持目标状态。在策略运行期间,直接站在机器人面前,不断地将切好的方块放回棋盘上,以与机器人完成操作相同的速度撤销操作。Dyna-2 持续清空棋盘,并非在固定循环次数后停止,而是在棋盘清空时才停止。
零样本真实部署
像 Dyna-2 这样的通用模型的一大优势在于,它可以直接部署到客户现场的真实客户任务中,无需额外的微调。Dyna-1 模型已经具备令人印象深刻的零样本能力(参见之前的博文),在未见过的环境中也能保持接近 100% 的任务完成率。然而,任务完成率并非生产环境中的关键指标,性能评估会综合考虑客户现场所需的质量、吞吐量和可靠性。一个策略可能满足完成率标准,但仍然无法满足这三项标准。Dyna-2 突破了这一限制:它在从未见过的客户现场也能保持质量、吞吐量和可靠性。
在已部署 Dyna-2 和 Dyna-1 的客户现场,根据生产环境的通过标准对 Dyna-2 和 Dyna-1 进行评估。通过率数据来自现场报告,并由未参与模型开发的运维人员根据客户验收标准进行评分。两个模型均使用相同的任务数据集进行相同步骤数的后训练,并且均未接触过任何来自部署现场的数据。
在厂内测试中,两者难分伯仲:均达到生产质量标准,合格率接近100%。但在现场测试中,二者差距显著。Dyna-1的合格率为46%,而Dyna-2的合格率为87%——在相同的培训后预算下,两者相差41个百分点。
通过世界建模实现指令跟踪
语言是控制机器人策略的重要接口,它使机器人能够在部署过程中保持灵活性,接收来自人类或System 2模型的指令,并正确地对机器人数据进行上下文关联和重用。端到端的机器人策略通常难以正确地跟踪输入的语言指令,因为图像包含的信息量更大,而且持续的动作损失会破坏预训练的表征[33]。反事实情况,即模型在与训练数据相似的场景中接收到不同的语言指令,尤其具有挑战性。
对于VLA,为了在骨干网络中保留语义知识,早期的研究通常需要进行多阶段训练以及骨干网络冻结[33, 34],这导致训练流程脆弱且速度缓慢。通过视频预测,世界-动作模型为语言学习提供一种新的数据来源,使模型能够学习物体和动作在物理世界中的含义,并利用丰富的以自我为中心的数据。
01视频预测是否能增强Dyna-2的语言跟踪能力?
02在预训练期间规模化视频数据是否能改善下游的语言跟踪能力?
受通用策略评估[35]和反事实场景研究的启发,设计了以下基准任务来评估机器人的语言理解能力。在这些任务中,改变输入的语言指令,同时保持场景不变:
推/拉叠叠乐积木:机器人必须按指定方向推或拉一个叠叠乐积木。
物品组合:机器人必须从5个物品中挑选出指定的物品并将其放入容器中。
积木堆叠:机器人必须将红色积木堆叠在黄色积木的顶部,反之亦然,并进行各种排列组合,以测试机器人的语言-空间关联能力。
餐巾纸操作:机器人必须对餐巾纸执行各种操作(拿起、放下、拉、旋转、翻转、从左到右折叠、从上到下折叠、展平)。
这些基准任务涵盖了认为对灵活部署机器人至关重要的多种能力,包括空间理解、物品关联能力和灵巧动作基元。
为了回答问题 1,对早期 Dyna-2 语料库进行 A2A 预训练比较,对比 FastWAM 风格的视频协同训练和仅基于动作的训练。为了回答问题 2,在完整的 Dyna-2 语料库上比较视频协同训练。在每种情况下,都使用几个小时的数据对上述所有任务的预训练检查点进行微调,并评估成功率,其中策略尝试执行预设动作但失败的试验计为 0.5/1。
在早期 Dyna-2 语料库上,从仅包含动作的预训练切换到视频协同训练,可将整体成功率从 35% 提升至 67%;而在完整的 Dyna-2 语料库上进行视频协同训练,则可将成功率提升至 96%,显著提高涉及物体定位和更灵巧动作基元的任务的成功率。总体而言,结果表明,预训练数据的规模和多样性以及训练目标均对语言跟随性能有显著贡献,共同赋予 Dyna-2 强大的语言可控性。
一步式视频生成
除了扩展数据规模和展示机器人端性能外,Dyna-2 还推进了视频生成技术的发展,使其可用于下游应用。开发一个蒸馏流水线,将 Dyna-2 视频生成器转化为一步式学习模型,将潜时间缩短约 90 倍。这是一个能够生成可用于规划和评估的指令条件化操作视频的一步式蒸馏流水线,尽管其精度尚未达到全精度教师模型的水平。对于视频而言,少步蒸馏是一种标准方法,其目标函数可以是轨迹回归 [20, 21] 或分布匹配 [22, 23, 24],但两者都无法简化为单步损失。回归损失通过最小化条件均值 E[x_0 | z] 来实现,因此从噪声出发的一步损失会返回所有未来和模糊的平均值。分布匹配损失保留了细节,但其梯度 E_x∼p_θ [(s_θ −s_q)∂x/∂θ] 会评估从未训练过的教师得分 s_q:概率流路径局部是直线,但整体是弯曲的(在其教师模型中,每步大约弯曲 4°,总共弯曲 58°),因此单步损失会离开 s_q 的支持集。维度越高,这两种方法的效果就越差。在流形假设下,p_θ 和 q 占据低维集合,且对于 dim M_p + dim M_q < D,它们通常不相交,因此 χ2 (p||q) = ∞,除非两者都被噪声平滑,否则散度会饱和并趋于零梯度 [40]。一步法必须完整地执行平滑操作,而多步采样器在每一步都重新投影到数据上并避免平滑。因此,一步法适用于图像 [25, 26],但不适用于视频,因为视频的 D 值远大于图像,一步法会导致模糊,分布匹配可能会进一步退化为静态片段。
其将一步视频生成视为一个控制问题,即学生与目标之间的追逐游戏,目标会随之移动。不将教师固定为目标,而是将学生与一条从初始化时可达的目标到数据本身的连续目标路径进行匹配。路径的推进基于学生的在线读数,因此目标向数据方向的后退速度仅与学生能够跟随的速度相同,从而保持足够的接近度以确保可到达性和可靠的评分。
形式上,设学生为一个单步生成器 x = G_θ (ε),其中 ε ∼ D(0,I),{q_r},r∈[0,1],为构成连续路径的目标度量族,其中 q_0 在初始化时可达,q_1 为数据。这两个度量在经过上述流形(manifold)论证中的噪声 D(0,σ2) 平滑处理后进行比较,以使它们重叠。设 m^ 为学生自身样本的在线读数,w 为增益。训练以不同的速率运行两个耦合更新:
散度 D 是开放的:模式搜索、对抗或两者的混合。慢速更新 f 是控制律,其形式决定目标跟随而不是领先。在例子中,只有当 m^ 表示学生已缩小与当前目标之间的差距时,f 才会前进 r,否则保持前进 r 不变,因此目标始终不会超出学生能够跟随的范围。
推理成本降低约 90 倍。在一个 H100 测试中,对于一个三秒、三视角的操控视频,采样器的时间从 10,203 毫秒降至 110 毫秒,这相当于用一个网络评估代替教师的一百次评估。下表对比在保留的片段中,速度与质量之间的关系:一步学生模型将 FVD 保持在 121,并且闪烁幅度接近真实值,而截断为一步的教师模型则抖动严重(15.81);其运动幅度仅为真实值的 75%,仍然落后于完整的教师模型。

5 相关工作
机器人学的规模化定律。能力随数据和计算量的平滑幂律规模化是现代机器学习[10, 11]及其迁移学习形式(有效数据迁移[8]和依赖于对齐的下游规模化[9])的组织成果。在机器人学领域,规模化研究已针对环境和物体多样性[12, 38]、计算和模型规模[39]以及与本工作最接近的、针对以自我为中心的人类数据的动作预测损失(高达约20,000小时规模)[6]进行了测量。Dyna-2将测量范围扩展了两个数量级以上,并验证了规模化定律适用于世界动作模型,在四个指标上均成立,并且这是在模型从未见过的机器人数据上,零样本地证明该规模化定律同样适用于具身差距。EgoScale定律[6]是基于保留的人类损失进行测量的,机器人结果仅在训练过程中人机对齐后获得;此外,近期的基础模型在单一数据规模下展示了零样本跨具身迁移[29, 30],证明了无需自适应即可进行迁移,但并未阐明其规模如何;在这些案例中,机器人形状的数据(例如,UMI)仍然保留在预训练阶段。
机器人基础模型和世界动作模型。一种研究方向是基于视觉语言模型构建通用策略:RT-2 [13]、OpenVLA [14]、π0 [3] 和 GR00T N1 [15];在匹配条件下将 Dyna-2 与最强的内部 VLA 基线进行比较。另一种研究方向是基于视频生成模型构建策略。许多工作将视频生成用作规划器[16, 43]或通过微调直接生成策略[41],以及最直接相关的联合世界-动作建模[4, 5, 42]。 Dyna-2 是 WAM 类别中一种可扩展的架构,能够处理数百万小时的数据,并展现出若干新规模化规律。
6 结论
Dyna-2,一个在 100 万小时人类数据上预训练的世界动作模型。该架构在预留的人类数据上展现出扩展规律,并首次证明了跨具身迁移规模化规律的可行性。此外,我们证明了世界建模是推动跨具身泛化的关键,并通过实证研究证实视频数据是扩展的新数据源。仅需几个小时的微调数据,Dyna-2 即可在预训练期间从未见过的机器人具身上执行复杂的操作任务。此外,还展示 Dyna-2 的多项功能,包括增强的鲁棒性、精确性、指令跟踪能力和一步视频生成能力。总体而言,它比之前的模型有了显著的改进。同时,它也提供强有力的实证证据,有助于解答该领域的一些未解之谜。100 万小时并非扩展的极限;这仅仅是机器人技术规模化新时代的开始。
参考文献
01Bai et al. Causality in Video Diffusers is Separable from Denoising. arXiv:2602.10095, 2026.
02Liang et al. Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models. arXiv:2411.04996, 2024.
03Black et al. π0: A Vision-Language-Action Flow Model for General Robot Control. arXiv:2410.24164, 2024.
04Ye et al. World Action Models are Zero-shot Policies (DreamZero). arXiv:2602.15922, 2026.
05Zhu et al. Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets. arXiv:2504.02792, 2025.
06Zheng et al. EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data. arXiv:2602.16710, 2026.
07Schaeffer, Miranda, Koyejo. Are Emergent Abilities of Large Language Models a Mirage? NeurIPS 2023. arXiv:2304.15004.
08Hernandez, Kaplan, Henighan, McCandlish. Scaling Laws for Transfer. arXiv:2102.01293, 2021.
09Isik, Ponomareva, Hazimeh, Paparas, Vassilvitskii, Koyejo. Scaling Laws for Downstream Task Performance of Large Language Models. arXiv:2402.04177, 2024.
10Kaplan et al. Scaling Laws for Neural Language Models. arXiv:2001.08361, 2020.
11Hoffmann et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556, 2022.
12Lin et al. Data Scaling Laws in Imitation Learning for Robotic Manipulation. arXiv:2410.18647, 2024.
13Brohan et al. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control. arXiv:2307.15818, 2023.
14Kim et al. OpenVLA: An Open-Source Vision-Language-Action Model. arXiv:2406.09246, 2024.
15NVIDIA. GR00T N1: An Open Foundation Model for Generalist Humanoid Robots. arXiv:2503.14734, 2025.
16Du et al. Learning Universal Policies via Text-Guided Video Generation. arXiv:2302.00111, 2023.
17Kareer et al. EgoMimic: Scaling Imitation Learning via Egocentric Video. arXiv:2410.24221, 2024.
18Lipman, Chen, Ben-Hamu, Nickel, Le. Flow Matching for Generative Modeling. arXiv:2210.02747, 2022.
19Liu, Gong, Liu. Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow. arXiv:2209.03003, 2022.
20Salimans, Ho. Progressive Distillation for Fast Sampling of Diffusion Models. arXiv:2202.00512, 2022.
21Song, Dhariwal, Chen, Sutskever. Consistency Models. arXiv:2303.01469, 2023.
22Yin, Gharbi, Zhang, Shechtman, Durand, Freeman, Park. One-step Diffusion with Distribution Matching Distillation. arXiv:2311.18828, 2023.
23Yin, Gharbi, Park, Zhang, Shechtman, Durand, Freeman. Improved Distribution Matching Distillation for Fast Image Synthesis. arXiv:2405.14867, 2024.
24Huang, Li, He, Zhou, Shechtman. Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion. arXiv:2506.08009, 2025.
25Geng, Deng, Bai, Kolter, He. Mean Flows for One-step Generative Modeling. arXiv:2505.13447, 2025.
26Geng, Lu, Wu, Shechtman, Kolter, He. Improved Mean Flows: On the Challenges of Fastforward Generative Models. arXiv:2512.02012, 2025.
27Peebles, Xie. Scalable Diffusion Models with Transformers. ICCV 2023. arXiv:2212.09748.
28Zhou, Girdhar, Xiong, et al. Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model. arXiv:2408.11039, 2024.
29Liu et al. RDT2: Enabling Zero-Shot Cross-Embodiment Generalization by Scaling Up UMI Data. arXiv:2602.03310, 2026.
30Zha et al. LAP: Language-Action Pre-Training Enables Zero-shot Cross-Embodiment Transfer. arXiv:2602.10556, 2026.
31Allshire, Singh, Singh, et al. Scalable Behavior Cloning with Open Data, Training, and Evaluation. arXiv:2606.27375, 2026.
32Bai et al. Qwen3-VL Technical Report. arXiv:2511.21631, 2025.
33Driess et al. Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better. arXiv:2505.23705, 2025.
34Liu et al. Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training. arXiv:2512.24125, 2025.
35Gao et al. A Taxonomy for Evaluating Generalist Robot Manipulation Policies. arXiv:2503.01238, 2025.
36Kareer et al. Emergence of Human to Robot Transfer in Vision-Language-Action Models. arXiv:2512.22414, 2025.
37Li et al. Causal World Modeling for Robot Control. arXiv:2601.21998, 2026.
38Sunday Robotics. ACT-2 Preview: Generalizing Reliability. Blog post, 2026. sunday.ai/blog/act-2-preview.
39Generalist. GEN-0: Embodied Foundation Models That Scale with Physical Interaction. Blog post, 2025. generalistai.com/blog/gen-0.
40Arjovsky, M. and Bottou, L. Towards Principled Methods for Training Generative Adversarial Networks. ICLR 2017. arXiv:1701.04862.
41Kim et al. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning. arXiv:2601.16163, 2026.
42Pai et al. mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs. arXiv:2512.15692, 2025.
43Chen et al. Large Video Planner Enables Generalizable Robot Control. arXiv:2512.15840, 2025.
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)