RSS 2026 Robot World Models Workshop Summary4-Max Li Cosmos 3
Talk 3: Cosmos 3 Omnimodal World Models for Physical AI – Cosmos 3:一款面向物理人工智能的全模态世界模型
Max Zhaoshuo Li from Nvidia Cosmos Lab
一、存在的问题

物理 AI 领域存在数据核心瓶颈:对比计算机使用的智能体、大语言模型,获取物理交互数据受时空线性约束,仅靠算力无法无限扩充。单纯依靠人工遥控采集数据、或是简易合成数据都不足以突破瓶颈,我们需要全新范式 —— 世界基础模型,为视觉 - 语言 - 动作(VLA)等各类物理智能应用提供底层通用基础能力。

我们长期思考,从智能体交互视角出发,世界基础模型必须具备哪些核心能力,才能成为通用底层底座。三大核心能力缺一不可:
- 现实场景理解能力:正如劳拉刚才分享的微波炉取餐任务,模型必须精准理解环境、物体的状态;
- 动作结果仿真预判能力:和陈立提到的观点一致,真实世界动作成本极高,打碎物品无法复原,但虚拟仿真可无成本反复试错,推演能力、价值评估能力至关重要;
- 真实世界执行动作能力:机器人领域研究者都十分熟悉,模型需要能将抽象意图转化为真实物理动作。
基于这三大需求,我们研发了 Cosmos 3 全模态世界基础模型。劳拉提出的多模态融合思路我们高度认同,Cosmos 3 将文本、图像、视频、音频、动作全部统一进单一模型,同时支持全部模态的生成任务。
二、核心功能
第一,现实时序场景理解。输入机器人操作视频观测画面,Cosmos 3可作为视觉语言模型(VLM),完整推演全流程时序事件,输出密集时序标注或画面状态预测。场景理解是所有物理智能模型的底层根基,无法看懂环境,就不可能输出有效动作。
第二,生成能力同样至关重要。现在音频恢复了,只是存在一点延迟,我先暂停视频,这段交互的音效质感很不错。我们将音频,视频与动作等一切模态联合建模,这个演示案例里仅展示音视频生成效果。生成是检验模型是否真正理解 “给定控制信号或条件输入后未来会发生什么” 的核心手段。我们发现音频信息价值独特,大量物理交互行为都能通过声音线索预判,因此音频模态被纳入 Cosmos 3基础模型的建模。(foundation指代Cosmos 3) [ 这就是为什么它是我们建模Cosmos 3的基础之一。]
第三,世界仿真能力:这个例子展示 Cosmos 3 模拟人类智能体与环境的复杂交互。画面左下角是第一视角相机轨迹,右下角是手部姿态推演,仿真完整复现人类拿起物体、放置在桌面上的全过程。我们极度看好第一视角(自我中心)数据:这是让基础模型深度掌握物理交互逻辑最高效的数据类型。目前我们正和大量科研团队、开源社区合作,把海量第一视角交互知识灌入模型。
第四,Cosmos 3 同时支持逆动力学推演:模型不仅能输入动作预测未来画面,还能输入多视角观测画面,反向推演出产生该画面的底层动作序列。这项能力可作为无动作标注海量视频的数据挖掘工具,尤其适配人类交互视频。演示中,模型推演出的动作序列可以直接驱动 URDF 格式机器人模型完成移动。
第五,当Cosmos 3模型完整建模所有可能的物理状态与推演结果后,比如动力学、视频生成、文本理解等,可直接转化为能在真实世界执行动作的机器人策略。这个演示效果或许不算惊艳,但核心逻辑是:只要模型对足够多的环境状态建立完整表征,这套状态理解或推演机制会自然转化为策略模型,接收文本指令并落地执行。
视觉推理、图文音视频生成、机器人策略、正 / 逆动力学模型 全部集成在同一模型中,仅通过切换不同的输入输出模态空间,全模态模型就能切换对应功能。
三、Introduction
Cosmos 初代发布时仅有 Nano、Super 两个系列超大尺寸模型,算力门槛高,很难用于机器人终端设备。为此我们专门研发 Cosmos Edge 轻量化版本,可在英伟达 Jetson Thor 嵌入式终端实时推理,无需云端集群 GPU 算力,面向一线机器人开发者落地使用。

基础 Cosmos 3 总参数量 4B,推理塔、生成塔各 2B;Cosmos Nano 总 16B,两大模块各 8B;最大的Cosmos Super 64B,双塔各 32B。不同尺寸适配不同场景,策略推理需实时,因此轻量化 Edge 版本单独优化。
Cosmos 最新更新是和 Physical Intelligence(PI)联合完成策略评估能力验证。我们目前不宣称该方案可完全替代真实机器人评测,真实世界评估依旧必不可少,但 Cosmos 可以分担大部分虚拟评测工作,相关研发进展顺利。机器人策略可与 Cosmos 3 联动,借助Cosmos 3模型逆动力学能力完成一系列创新评测实验。上图是真实机器人策略执行过程,在线虚拟评测时模型预判机器人不会把碗丢进垃圾桶,判定任务失败,这就是当前 Cosmos 3 可实现的评测效果。
四、Architecture

Cosmos 整体分为两大模块:一是推理塔,负责环境理解,等价于VLM视觉语言模型;二是生成塔,统一完成视频、音频、动作多模态生成。

MOT架构: 在理解和双向生成时我们的注意力掩码基本上是因果关系的 [ 推理塔采用因果注意力掩码,生成塔使用双向注意力掩码 ]。作为机器人专题研讨会,我重点说明跨本体统一动作的方案:模型当前支持自动驾驶车辆、相机运动、第一视角人体运动、单机械臂、双机械臂、人形机器人及各类夹爪。我们设计启发式算法拼接不同本体的动作向量,实现最大化动作语义空间共享。

五、处理不同的模态
当我们处理不同的模态时,一个棘手的问题是我们如何处理这些模态之间的潜在嵌入。所以这是我们提出的,这样一切模态都可以统一起来。[ 多模态统一嵌入是一大难点 ]。我们基于旋转位置编码(ROPE)做适配:语言是非常标准的ROPE,我们在所有3个维度上增加索引 [ 文本采用标准多维递增 ROPE ];视频采用三维位置编码(时间帧、画面宽、画面高);音频、动作无空间宽高维度,仅保留时间轴编码。所以全部模态编码逻辑兼容大语言模型的 ROPE 范式。
这套设计最大限度复用大语言模型预训练语义先验,但文本 token 本身无时间维度,和音视频、动作时序天然冲突。我们统一基准帧率 24 帧 / 秒,任意帧率的输入视频都会重新换算时序编码,所有模态对齐真实物理时间,而非无意义抽象索引。
六、Training

我前面演示的所有能力,来自三种训练范式:
- 正动力学:输入动作,预测未来视频;
- 逆动力学:输入观测视频,反推产生画面的底层动作;
- 策略模式:视频与动作联合去噪生成。
七、Dataset
推理塔预训练整理约 2200 万条多领域样本,覆盖文字识别、目标定位等任务;监督微调(SFT)筛选 220 万条物理 AI 专项子集。生成塔分三阶段训练:预训练以文生图或图像生成,视频生成和图生视频为主。预训练视频总时长约一百万小时,实现场景覆盖,这样大家能感觉到数据的数量。中期训练新增动作模态与仿真迁移数据 —— 机器人领域常用仿真迁移。我们生成Issac仿真,它有很漂亮的SDG外观,但你可以渲染它;这样生成照片级真实画面且不篡改视频的物理规则,所以这类样本纳入训练。论文首发时仅完成 Nano、Super 大模型训练,然后后训练微调它们文生图和视频、图生视频,以及适配 Droid 机器人的专属策略模型,这样人们可以感受到Cosmos 3如何转成策略以及策略效果如何。
八、Q&A
1 你们这套大一统大模型是否真正缩小了动作对齐鸿沟?尤其是轻量化 Edge 模型输出的动作,只是视觉上看起来合理,还是能真实适配物理环境完成任务?
论文里有详细说明:Cosmos 基础预训练阶段完全不植入机器人专属控制参数,仅作为通用状态转移机训练;所有机器人控制信息都放在增量微调阶段,后训练 Droid 机器人分支时才加入控制信号,这套分层设计效果很好。底层设计思路是预训练追求极致通用、脱离特定硬件,落地微调再针对性适配机器人本体。
2 如何量化 Cosmos 生成画面的物理精准度?怎么衡量推演物理规则和真实世界物理的误差?
我们配套了 PAI Bench 等专项物理评测基准,专门为物理一致性评估等量身定制。[ 专门量化物理一致性 ]。动作被包括在为许多下游用户预训练——我猜我们称之为训练,但可能是预训练——的一部分中的动机是我们认为将动作与视频相结合将提高许多物理推演的精度。不幸的是,在这次迭代中,我们没有看到一个强有力的指标或结果表明,一旦你加入动作,就会改善所有领域的物理效果,因为现在所有视频都有动作。但我们确实看到了许多机器人领域的提升,这种建模可以非常有用。
3 您展示了不同系列的不同尺寸的Cosmos模型,200万小时视频数据用来训练模型。您有使用不同数量的视频数据训练不同尺寸的模型吗?他们是普遍一致的吗?
通常,当你研究缩放定律,你想确保数据词元匹配算力,我们必须为端侧模型做一些取舍。例如,我们完全剔除音频模态,因为我们发现2B已经不足以处理另一个模态。一旦我们增加到8B和32B时就没有这个问题了。这是一个非常好的点,一个开放问题,当你做取舍时这取决于你的数据。因此,由于数据不同,我的经验永远不会转移到另一个团队的经验中。通常对于不同的尺寸都有一些取舍。我仍然相信更大的模型效果更好。希望将来某一天我们能有1T参数量的物理AI基础模型。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)