Cosmos-Reason1:从物理常识到具身推理

“在本文中,我们提出了 Cosmos-Reason1 模型,该模型可以理解物理世界并通过长链思维推理过程以自然语言生成适当的具体决策(例如下一步行动)。我们首先定义物理人工智能推理的关键功能,重点关注物理常识和具体推理。为了表示物理常识,我们使用分层本体来捕获有关空间、时间和物理的基本知识。对于具身推理,我们依赖于泛化不同物理实体的二维本体。基于这些功能,我们开发了两种多模式大型语言模型:CosmosReason1-7B 和 Cosmos-Reason1-56B。我们分两个阶段整理数据和训练模型:物理 AI 监督微调 (SFT) 和物理 AI 强化学习 (RL)。”

“图 1:Cosmos-Reason1 概述。 Cosmos-Reason1包含7B和56B两个多模态大语言模型,分两个阶段进行训练,包括物理AI SFT和物理AI RL。我们还定义了物理常识和体现推理的两个本体,并构建了两个基准来评估模型的物理人工智能推理能力。”

“在本文中,我们首先定义物理人工智能系统所必需的基本功能。与设计擅长解决编码和数学问题的模型不同,我们的重点是为模型提供物理常识知识和基于现实世界的具体推理能力。为了建立一个共享框架并帮助衡量进展,我们提出了两个本体论。首先,一个分层本体论将物理常识分为三大类——空间、时间和基础物理——并进一步分为 16 个细粒度子类。该本体论概括了有关物理世界如何在物理定律下运行以及如何响应与实体的交互的知识。其次,我们引入了用于具体推理的二维本体,其中包含跨五种具体代理的四种关键推理功能。基于物理常识的有效具身推理对于理解和规划实现现实世界特定目标的行动至关重要。”

图 2:饼图显示了我们的物理常识本体。该本体包含三个类别(空间、时间和基础物理)和 16 个细粒度子类别。”

“我们引入 Cosmos-Reason1 作为使多模态LLM能够产生更多基于物理的响应的一步。我们专注于视觉世界,对世界的观察以视频的形式呈现。 Cosmos-Reason1 通过视频输入感知物理世界,理解它,并通过长链思维过程对其进行推理,然后生成响应。这些以自然语言表达的响应包括解释性见解和具体决策,例如确定下一步要采取的行动。我们采用仅解码器的多模态 LLM 架构,其中输入视频由视觉编码器处理,然后由投影仪处理,以在输入 LLM 之前与文本标记嵌入对齐。我们尝试使用密集 Transformer 和混合 Mamba-MLP-Transformer 架构作为 LLM 主干。 Cosmos-Reason1 有两种型号尺寸:Cosmos-Reason1-7B 和 Cosmos-Reason1-56B。我们在第3 节中描述了有关模型架构的详细信息。 .”

“大规模构建基于规则、可验证的奖励对于推理法学硕士成功解决数学和编码问题至关重要。我们可以设计基于规则的、可验证的奖励来通过强化学习训练物理人工智能推理模型吗?在这项工作中,我们基于回答多项选择题(MCQ)来探索两种类型的奖励。第一种类型的 MCQ 是基于人工注释设计的。受到视频自监督学习的启发,我们根据视频数据本身的结构自动生成第二种类型的 MCQ,例如用打乱的时空视频块解决谜题,或者预测视频是向前还是向后播放的时间箭头。所有这些奖励都是基于规则的、可验证的,并且与物理人工智能能力高度相关。我们将在第 4 节讨论 RL 训练算法和基础设施的设计细节。 ”

“第7节给出了Cosmos-Reason1的评估结果以及与现有模型的比较。在 7.1,我们介绍了实验设置,包括物理 AI SFT 的训练细节,以及 SFT 模型在我们的基准上的评估结果。在 7.2,我们给出了物理 AI RL 的评估结果。在 RL 训练后使用我们基于规则的、可验证的奖励进行训练可以改善我们所有的基准。”

“我们利用类似于 LLaVA (Liu et al., 2023) 和 NVLM-D (Dai et al., 2024) 的仅解码器架构,通过将其他模态标记(图像或视频)对齐到文本标记嵌入空间来简单且统一处理所有模态。具体来说,该模型从视觉编码器开始(Chen 等人,2024),然后是包含下采样两层 MLP 的投影仪,然后是仅解码器的 LLM 主干(Nvidia 等人,2024;Waleffe 等人,2024;DeepSeek-AI,2025)。”

“图 3:我们的多模式大语言模型架构的图示。给定输入视频和输入文本提示,视频将由视觉编码器和投影仪作为视频令牌投影到 LLM 的令牌嵌入空间中。文本标记与视频标记连接并馈入 LLM 主干、密集 Transformer 或混合 Mamba-MLP-Transformer 架构。我们的模型可以通过长链思维推理过程输出响应。”

“实际上,Mamba 的选择性状态空间可能不足以捕获长序列中的每个细节。为了解决这个问题,一小部分 Transformer 层被纳入长上下文建模中,从而产生了混合 Mamba-MLP-Transformer 架构(Waleffe 等人,2024)。”

“图 4:Cosmos-Reason156B 中使用的混合 Mamba-MLP-Transformer 主干架构的图示。 Transformer 块由自注意力层和 MLP 层组成。我们还在图顶部展示了交替 Mamba-MLP 模块的示例。”

然后来到了第四节,我认为第四节的强化学习最重要(因为我没系统性的学习过强化学习)。第4节文章篇幅算上图只有一页多

“我们采用物理 AI SFT 和物理 AI RL 两个训练阶段,将预训练的视觉语言模型(例如 Qwen2.5-VL(Bai 等人,2025)或 Nemotron-H-VLM(NVIDIA,2025))适应物理 AI 推理模型。在 SFT 阶段之后,我们使用 RL 和以物理 AI 为重点的任务对模型进行后训练,以进一步增强其物理常识和体现推理能力。在本节中,我们将解释该算法和定制的训练框架,它们对于 RL 训练来说非常高效且鲁棒。”

“我们采用 GRPO(Shao 等人,2024)作为我们选择的 RL 算法,因为它简单且计算效率高,因为它避免了训练和维护单独批评者模型的必要性。 GRPO 实现了策略优化的简化方法,其中优势函数是通过对每个提示生成的一组响应中的奖励进行标准化而得出的。令 R(oi) 表示在一组响应 G = {o1, o2,... , oG}中对响应 oi 的奖励,那么计算出的优势可以表示为:

“图 5:所提出的 RL 训练框架的架构。框架主要分为三部分。 (1)调度程序:调度和分发训练数据,管理框架的状态。 (2) Actor Rollout:根据提示生成响应,计算策略训练的奖励和优势。 (3)策略训练:对参与者进行强化学习算法,并根据奖励和其他约束来优化参与者。策略训练节点支持5D并行,即数据并行(DP)、管道并行(PP)、上下文并行(CP)、全分片数据并行(FSDP)和张量并行(TP)。 Actor 转出节点支持 DP、PP 和 TP。我们采用定制的 NCCL 通信器在调度程序和 rollout/policy 节点之间进行通信。”

我让AI广泛调研了一下源码,从loss出发的话就是:

先看rt:框架里的Actor Rollout和Policy Training是两个模型,但架构一样,actor rollout是执行者即pi_xita_old,二policy training是下面所述的“训练中的当前模型”,每次训练结束之后policy training会把更新好的参数赋值给actor rollout;相当于rt>1,要增大这个预测出来的token的概率,当然也不是无休止的增大,Cosmos-Reason1 论文正文明确给出了 group-normalized advantage、KL 系数等,但没有在该实验段明确报告 clipping ϵ 的具体值;上式是标准 GRPO/PPO-style 更新机制,用来解释 Figure 5 中 Policy Training 的内部行为。 当前 Cosmos-RL 代码实现也确实提供 epsilon_lowepsilon_highkl_beta 等 GRPO 配置。

KL项就是防止policy输出的偏离SFT训出来的模型太远,设置的针对输出做的分布校验;因为这里只对最终的答案和输出格式做奖励,确实需要设置KL来限制输出的分布。

图5中“策略训练节点支持5D并行,即数据并行(DP)、管道并行(PP)、上下文并行(CP)、全分片数据并行(FSDP)和张量并行(TP)。 Actor 转出节点支持 DP、PP 和 TP。我们采用定制的 NCCL 通信器在调度程序和 rollout/policy 节点之间进行通信。”这些就是工程上的优化了。

“5.1.物理人工智能监督微调在这个阶段,我们根据特定领域的数据对前一阶段的模型进行微调,以专门研究物理人工智能。该过程旨在实现两个关键成果:(1)增强模型对物理人工智能特定数据的视觉语言能力;(2)开发两种关键推理能力——物理常识推理和体现推理(详见第 2.1 节和第 2.2 节)。与前两个训练阶段不同,现有数据源不能直接用于物理 AI SFT。为了应对这一挑战,我们开发了一个专门的管道,为物理常识和具体推理应用程序精心策划 SFT 数据集。物理 AI SFT 数据的一部分,特别是视觉问答 (VQA) 对,是通过模型在环方法生成的,而不是直接由人工管理生成。

解读:数据不是由人从头到尾手工写出来,而是在数据生产流水线中,让一个或多个已有模型参与“看视频 → 写描述 → 出问题 → 生成推理 → 生成答案 → 清洗”,最终把这些模型参与生成的数据拿去训练 Cosmos-Reason1。

“5.2.物理 AI 强化学习

虽然微调建立了基本的物理常识和体现推理能力,但我们通过强化学习后训练进一步增强这些能力。这种方法需要有效的奖励机制,我们按照 DeepSeek-AI (2025) 使用经过试验和测试的基于规则且可验证的奖励来实施该机制。与数学和编码等法学硕士领域(其中正确答案和格式被精确定义)不同,物理常识和具身推理通常涉及自由形式、开放式的反应,这使得奖励分配变得复杂。”

解读:RL 不告诉模型 推理链路思路reasoning 必须怎么写,而是让模型自己尝试,再奖励最终做对的回答。SFT有给出推理链路思路+正确答案

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐