使用物理 AI 视频基础模型进行世界模拟

[Cosmos-Predict2.5] 基于流式架构构建,将 Text2World、Image2World 和 Video2World 生成统一在单个模型中,并利用物理 AI 视觉语言模型 [Cosmos-Reason1] 提供更丰富的文本基础和对世界模拟的更精细控制。 [Cosmos-Predict2.5] 经过 2 亿个精选视频剪辑的训练,并通过基于强化学习的后期训练进行了改进,在视频质量和指令对齐方面比 [Cosmos-Predict1] 取得了实质性改进,并以 2B 和 14B 尺度发布了模型。这些功能可以为机器人和自主系统提供更可靠的合成数据生成、策略评估和闭环仿真。我们通过 [Cosmos-Transfer2.5] 进一步扩展了该系列,这是一个用于 Sim2Real 和 Real2Real 世界翻译的控制网风格框架。尽管比 [Cosmos-Transfer1] 小 3.5 倍,但它提供了更高的保真度和强大的长视野视频生成。”

“[Cosmos-Predict2.5] 通过三项关键改进超越了 [Cosmos-Predict1](NVIDIA,2025)中的扩散视频世界模型。首先,我们加强数据过滤管道,以生成更高质量的预训练数据集,并手动管理为物理 AI 量身定制的专业后训练数据。其次,我们简化了模型架构,并将 Text2World、Image2World 和 Video2World 功能合并到一个模型中。第三,我们改进了训练方法,利用模型合并和新颖的强化学习算法进行后期训练,并将 [Cosmos-Predict1] 中使用的 T5 文本编码器替换为 [Cosmos-Reason1](NVIDIA,2025),这是一种专门用于物理 AI 的现代仅解码器 VLM 架构,提供更丰富的文本表示并实现对世界生成的更细粒度的控制。通过大量的实验,我们证明 [Cosmos-Predict2.5] 在输出质量和提示对齐方面比 [Cosmos-Predict1] 提供了显着的提升。”

图 1:我们的视频管理管道将来自不同现实世界来源的原始、非结构化视频数据转换为高质量、带注释、去重和分片的数据集,并针对视频世界基础模型的大规模训练进行了优化。

图2:【Cosmos-Predict2.5】的整体架构。如右图所示,在潜在空间中,模型应用重复的自注意力、交叉注意力和前馈 MLP 层块,并通过给定时间步 t 的自适应层归一化(缩放、移位、门)进行调制。我们利用 [Cosmos-Reason1] 作为文本编码器(如左图所示)。 [Cosmos-Reason1] 还可以容纳文本之外的视觉输入(图像和视频),我们将其留给未来的工作。

解读:图片中的两个Text的图标embedding是什么意思?:指的是一个变量,不是操作,两个的变量是一样的,只是图片重复画了两次。 它是拿初始的image/video当作的noise tokens的前几帧了吗?如果是这样的话,那再模型前向传播过程中会改变初始的图片了吗?,还是说?: 其实对齐一下loss就行了。 这个时间embedding的scale shift和公式4有关系吗,有的话是什么关系? 前者是调整 timestep/noise distribution,后者是根据 timestep 对 LayerNorm feature 做 learned affine shift

“高分辨率内容通常包含大量冗余,因为附近的像素高度相关。因此,如果注入噪声的水平太小,模型可能无法“分解”这种相关性,从而使 FM 模型更难学习有意义的结构(Esser 等人,2024 年;Hoogeboom 等人,2023 年;Chen,2023 年;Atzmon 等人,2024 年)。为了解决这个问题,我们故意将训练过程偏向更高的噪声水平。具体来说,我们采用平移对数正态分布(Esser et al., 2024)。在实践中,我们首先从逻辑正态分布中采样 t,然后应用单调变换

  1. 训练

我们采用渐进式训练策略,平衡效率和模型质量。该过程从多阶段预训练开始,训练难度沿着两个轴逐渐增加:像素分辨率和任务多样性。预训练后,我们对精心策划的高质量物理 AI 数据集进行监督微调 (SFT),以增强模型在专业领域的能力,然后将它们合并到统一模型中。最后,我们通过在合并模型之上应用强化学习(RL)算法来进一步提高生成质量。

DiT 通过将真实帧与噪声帧连接来调节。为了指定哪些输入是有条件的,我们应用了掩码方案:每个输入标记都是通过将原始标记与掩码标记连接起来形成的,其中掩码用作指示输入是否是条件输入的二进制标志。去噪损失仅应用于指定的帧,确保梯度正确传播。之后,我们逐步将分辨率从 256p 提高到 480p,然后到 720p,一旦模型收敛并且视觉质量达到稳定状态,就进入下一阶段。最后,我们添加 Text2World 任务,其中提供零调节帧。在此阶段,我们分别以 0.5、0.25 和 0.25 的概率采样 0、1 或 2 个条件帧。

“为了统一特定领域 SFT 模型和冷却模型的优势,我们采用模型合并(Yang et al., 2024)。我们尝试了四种方法:model soup (Wortsman et al., 2022)、TIES (Yadav et al., 2023)、DARE-Linear (Yu et al., 2024) 和 DARE-TIES (Yu et al., 2024)。对于每种方法,我们运行超参数扫描并生成 20 多个合并模型。我们根据对一小部分精心挑选的具有挑战性的示例的质量评估,从这些候选模型中选择性能最佳的模型。然后,我们使用人类偏好投票在更大的评估集上验证所选模型,以确保跨特定领域和一般任务的稳健性能。”

“4.2.2.强化学习

强化学习已广泛应用于后期训练中,以使模型输出与人类偏好保持一致,通过人类反馈(Ouyang et al., 2022)或奖励模型(Schulman et al., 2017;Guo et al., 2025)来表示。对于基于流的世界生成,我们可以类似地将条件视为状态,将整个去噪轨迹视为动作,并利用强化学习框架对模型进行后训练。下面我们简要介绍我们的 RL 机制,以及 Ye 等人提出的综合技术。 (2025)。 我们采用 VideoAlign (Liu et al., 2025),这是一种基于 VLM 的奖励模型,用于评估文本对齐、运动质量和视觉质量,以进行后期训练 [Cosmos-Predict2.5-2B](预训练模型和合并模型)。我们为每个输入条件生成 20 个扩散步骤的 8 个输出,然后按照 GRPO(Guo 等人,2025),通过标准化其推出组内的奖励来计算每个输出的优势。由于GPU内存限制,每条轨迹的概率是通过将其分解为每一步的条件概率之和来计算的,在实践中,我们根据优势计算每两个条件概率的梯度,并累积整个轨迹(总共十步)的概率梯度以进行一次参数更新。该模型经过 256 个步骤的训练,批量大小为 32。正如 Ye 等人所讨论的。 (2025),我们在微调数据集上使用扩散损失进行正则化,有效缓解了奖励黑客现象。我们在合并模型上进行后训练后发布 EMA 权重作为最终的 [Cosmos-Predict2.5] 训练后检查点。 我们在表 6中展示了 RL 训练后前后 PAI-Bench 上的奖励分数。无论是在 Text2World 和 Image2World 场景中,无论是预训练模型还是各种 SFT 模型的合并模型,奖励都有大幅增加。我们还对强化学习前后模型生成的视频进行了人工投票,结果如图 5 所示。在所有情况下,平均而言,强化学习模型生成的视频更受欢迎。总之,强化学习被证明可以有效提高模型质量,无论是在奖励分数还是人类投票结果方面。” “6.1. Cosmos-Transfer2.5

我们开发了一个条件世界生成模型 [Cosmos-Transfer2.5-2B],它建立在 [Cosmos-Predict2.52B] 之上,可根据多个空间控制输入生成高质量的世界模拟。这些输入可以采用不同的模式,包括边缘、模糊视频、分割图和深度图,并且可能源自物理模拟引擎(例如 NVIDIA IsaacSim)或真实世界的视频数据。

6.6.动作条件世界生成

我们将[Cosmos-Predict2.5]从纯视频生成扩展到动作条件视频生成,从而产生[Cosmos-Predict2.5-2B/robot/action-cond]。该模型将单个条件图像和一系列机器人动作作为输入,并生成遵循所提供的动作序列的未来帧块。为了产生完整的轨迹,生成是以自回归的方式进行的,其中每个块都是根据最后生成的帧来预测的。

由于动作代表了预训练期间不存在的新模式,因此我们引入了额外的调节模块。具体来说,我们添加一个动作嵌入器 MLP,将每个动作映射到一个张量。我们没有直接注入这个张量,而是通过将其添加到 DiT 模块的时间戳嵌入中来合并它。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐