Qwen-RobotWorld:通过语言条件视频生成统一具身世界建模
26年7月来自阿里千问的论文“Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation”。
QWEN-ROBOTWORLD,是一个面向具身智能、由语言驱动的视频世界模型。该模型以自然语言作为统一的动作接口,能够基于当前观测预测符合物理规律的未来视觉轨迹,涵盖机器人操作、自动驾驶、室内导航及人机动作迁移等多种场景。这种统一的建模方式带来三个极具前景的应用方向:用于增强策略训练的合成数据生成、用于策略评估的可扩展虚拟环境,以及为下游机器人控制提供语言引导的规划信号。该模型通过以下三部分设计实现:a) 结合 MLLM 动作编码的双流 MMDiT 架构,利用 60 层双流扩散 Transformer(Diffusion Transformer),通过逐层联合注意机制将冻结的 Qwen2.5-VL 语义与视频 VAE 潜表征进行耦合;b) 具身世界知识(EWK)数据集,这是一个包含 860 万个视频-文本样本(超过 2 亿帧)的语料库,涵盖 20 多种具身形态和 500 多种动作类别;以及 c) “通用+专家”渐进式课程学习策略,即先学习通用视觉先验,随后在统一语言接口下注入具身领域的专业知识。大量实验结果显示该模型极强的竞争力:在 EWM-Bench 和 DreamGen Bench 上综合排名第一,在 WorldModelBench 和 PBench 上超越所有开源模型。此外,在 RoboTwin-IF 基准测试上的零样本(zero-shot)分析进一步验证其稳健的泛化能力和多视角一致性。

训练通用具身世界模型的核心挑战不仅仅在于数据规模,更在于表征的异构性:机器人操作动作表现为关节角度或末端执行器航点,驾驶任务涉及转向指令与速度曲线,而导航则体现为航向向量——这些形式各异的动作通常需要针对不同领域设计专门的模型或接口。通过一个“动作-语言”映射框架解决这一难题,该框架将来自20多种机器人形态和500多种动作类别的异构动作转化为统一的自然语言接口。在此统一接口下,来自Franka机械臂、自动驾驶车辆及室内导航智能体的视频数据,均被视为同一类“语言条件视频生成任务”的实例;这样能够在无需特定领域控制接口的情况下,利用单一模型实现跨场景、跨任务的联合训练。如图1所示,该框架生成了约600万组高质量的跨场景、跨任务具身视频-文本对;进一步结合通用视频数据(占总量的30%)构建了“具身世界知识”(EWK)数据集——这是一个包含860万组视频-文本对及超过2亿帧观测图像的大规模语料库。

1 动作-语言映射
动作-语言映射框架旨在解决具身数据中存在的一个根本性不对称问题:视觉状态(视频帧)处于统一的像素空间中,而动作表征则分散在互不兼容的模态里。其框架通过将所有动作信号映射到一个共享的自然语言空间来解决这一问题,从而使得同一个扩散Transformer(diffusion transformer)模型能够学习 s_{t+1} = f(s_t, a_t) 的映射关系,而无需考虑底层的物理形态(domain)。
为何选择语言作为统一的动作接口?与关节角度、末端执行器航点(waypoints)或力/力矩指令等低级动作表征不同——这些表征通常依赖于特定硬件,且每种具身形态都需要独立的控制接口——自然语言提供了一种通用的、与具体具身形态无关的动作接口。诸如“抓住红色杯子并垂直提起”这样的一条指令,便隐含了完整的动作序列、目标状态及物理约束信息,且无需了解底层的运动学链结构。
通过训练模型仅根据语言动作 a_t 来预测下一个视觉状态 s_{t+1},其获得一个能够跨具身形态泛化的仿真骨干模型——无论是Franka夹爪、Aloha双臂系统还是人形机器人,均无需针对特定机器人重新训练或重新设计接口。然而,这种通用性对标注质量提出了极高要求:每条描述(caption)都必须作为完整且自包含的动作规范,其精确度需足以让模型仅凭 a_t 和 s_t 即可预测 s_{t+1},而无需依赖任何机器人元数据或本体感知信号。
分层五级标注体系。为了在涵盖20多种机器人具身形态和500多种动作类别的场景下,始终如一地生成包含丰富动作信息的描述,其设计一个包含五个递进层级的层级化标注框架。前三个层级构成一个结构化的“思维链”(chain-of-thought),将每一次视觉状态转换分解为可解释的组成部分:
- 任务目标层(Task Goal Layer)——推断状态转换的高层意图(即 s_t 与 s_{t+1} 之间应发生何种变化),结合外部指令与观测到的视频内容;
- 动作细节层(Action Detail Layer)——将动作 a_t 分解为时空轨迹、微动作、速度及力等要素,并强制明确标注视角信息(如:以自我为中心的主视角、腕部视角、外部视角或拼接的多视角组合);
- 物理反馈层——描述动作对环境产生的可观测后果(如物体位移、形变、接触状态变化),将每一次状态转换都建立在可验证的物理结果之上。
基于上述分析,生成两种粒度的动作描述:
- 详尽描述(50–100词)——完整定义“视角-智能体-动作-反馈”四元组,为精确的状态转换预测提供丰富的动作信号;
- 简洁描述(15–30词)——仅保留“视角-智能体-关键动作”等核心要素,使模型能够在推理阶段处理简短的高层指令。
其实施四项质量控制原则:操作聚焦(仅限智能体动作与物体交互)、视角定义(明确视角类型与语义角色)、客观性(仅描述可见动态)以及物理可验证性(仅描述视觉上可验证的结果)。在训练过程中,以等概率(各50%)从详尽描述和简洁描述中进行采样,从而使模型既能执行详细的轨迹规范,也能执行简短的任务级指令。
覆盖范围:20多种机器人形态,500多种动作类别。该框架适用于所有数据域。在机器人形态维度上,涵盖了人手、七种机械臂配置(单臂夹爪、双臂夹爪、单臂灵巧手、双臂灵巧手、移动双臂、半人形及全人形机器人)、自车(环视相机)、行人/无人机以及移动导航智体——总计代表20多种不同的机器人形态,数据源自RoboCoin(涵盖三大结构类别的15种机器人模型)、Robomind(4种形态)、InternData-A1(4种机器人模型)、Groot-XE及其他各类数据集。在动作维度上,该体系涵盖了源自训练数据集的 500 多种动作类别——仅 Agibot-World 就定义了 84 种不同的操作基元(如抓取、推、倾倒、折叠、擦拭、切割等)——并辅以来自其他操作数据集的独特基元以及移动与导航动作(如转向、变道、航点追踪、避障等)。这些动作被组织为四个层级:(1) 操作基元,(2) 长时程动作组合,(3) 移动与导航,以及 (4) 针对动态与可变形物体的交互。这种系统性的覆盖确保了由此生成的具身视频-文本对能够涵盖一个语义丰富且物理形态多样的动作空间,这是单一领域数据集无法提供的。
2 数据收集
通用数据
通用世界数据为模型掌握基本物理规律及构建精确的视觉表征奠定了基础。该类别涵盖了来自互联网的各类视频与静态图像。视频数据统一标准化为 24 FPS,并支持多种分辨率及长宽比(如 1:1、2:3、3:2、3:4、4:3、9:16、16:9 等)。图像数据整合了高质量的静态照片,作为视觉质量的基准,确立了物体外观、材质纹理及空间构图的精确表征。所有通用数据均附有由 Qwen2.5-VL(Bai 等人,2025)生成的自然语言描述;标注内容剔除了特定视角的细节信息,以保持数据的灵活性与通用性。值得注意的是,我们对人工智能生成内容(AIGC)持审慎态度:通用数据不包含 AI 生成的图像或视频,因为这类内容往往带有视觉伪影、物理不一致性及隐性偏差,可能削弱模型的泛化能力。
具身操作数据
为了使世界模型能够在各种场景与任务中获得基于物理现实的理解,其构建一个涵盖操作、驾驶、导航及跨具身迁移领域的数据集锦(如表 1 所示)。针对核心的操作领域,从多具身(Multi-Embodiment)、多任务(Multi-Task)、多场景(Multi-Scenario)及多视角(Multi-View)四个维度对数据进行组织。
多具身。操作数据涵盖了多种具身形态——包括人手、单臂夹爪、双臂灵巧操作系统、移动操作臂以及全身人形机器人——从而使模型能够学会将任务层面的意图与特定具身的运动学特性区分开来。人类操作数据(如 EgoHOD [Pei,2025]、EPIC-Kitchens [Damen,2018])确立灵巧操作的性能上限:模型通过观察具备物理交互能力的操作过程,学习流畅的手眼协调与工具使用相关的先验知识。随后,机器人数据则教导模型如何将同样的意图映射到各种不同的机械形态之上。通过让模型接触针对重叠任务的人类演示和机器人执行数据(例如 Robomind [Wu et al., 2025a] 和 RoboCoin [Wu et al., 2025b]),模型能够学习到“具身无关”的动作语义——即无论执行者是双指夹爪还是七指灵巧手,都能预测“接下来会发生什么”的能力。
多任务。操作数据集涵盖从原子级接触动作到长程多步流程的技能层级,从而训练模型在多种时间粒度上进行操作。短程数据集(如 Bridge V2 [Walke et al., 2023] 和 RH20T [Fang et al., 2024])提供了对基础交互原语(如抓取、推动、插入)的密集覆盖,这些原语构成了模型对接触物理特性和物体affordance理解的基础。长程数据集(如 Agibot-World [AgiBot-World-Contributors, 2025] 和 Galaxea [Galaxea AI, 2025])将这些原语串联成连贯的序列,迫使模型在数十个步骤中保持状态追踪和因果推理能力。此外,动态交互数据集(如 Humanoid Everyday [Zhao et al., 2025])引入高速全身运动,旨在测试模型在显著动量和平衡约束下预测结果的能力。这些数据的综合应用确保模型既能推理“在此处按压会发生什么”,也能推理“在连续做出十个决策后会发生什么”。
多场景。多场景覆盖沿着两个互补的维度推进:1)真实环境中的广度,以及2)向模拟器渲染场景的扩展。在第一个维度上,物理交互的表现形式因环境而异——例如,厨房台面在光照、杂物密度和表面特性方面,与工厂车间或户外作业现场截然不同。因此,操作数据主要来自真实世界,涵盖了家庭厨房、车间、实验室和非结构化户外环境,使模型能够接触到光照、遮挡、材质外观和背景复杂性等方面的真实变化,从而避免模型因过度拟合单一环境而变得脆弱。在第二个维度上,将照片级逼真的模拟数据(如 InternData-A1 [Tian et al., 2025])作为一种同等重要的补充纳入其中。这一研究的背景源于 VLA领域的现状:相当一部分策略模型是在仿真器中训练的,且几乎所有模型都使用标准化基准(如 LIBERO [Liu et al., 2023]、SimplerEnv [Li et al., 2024] 和 RLBench [James et al., 2020])在仿真环境中进行评估。因此,旨在作为通用仿真底座的世界模型,必须能够忠实地生成符合仿真器风格的外观与物理特性,从而弥合真实观测与合成观测之间的视觉域差异,以同时支持“从仿真-到-现实”(sim-to-real)的迁移和闭环评估流程。仿真部分还提供光照、物体姿态和摄像机位置的精确可控变化,从而进一步增强视觉鲁棒性。
多视角。单视角数据训练模型从固定视角预测合理的未来状态,但许多对物理交互至关重要的事件在单一摄像机视角下往往会被部分或完全遮挡。同步多视角记录(如 Agibot-World (2025) 和 Robomind Wu et al. (2025a))让模型能够同时从头戴式、腕戴式和外部视角观察同一事件。这具有双重作用:在训练阶段,跨视角的对应关系充当几何正则化项,隐式地让模型学习物体的形状、深度及空间关系;在推理阶段,模型既可以基于任意单一视角生成内容,也可以生成相互一致的多视角输出。在总计 600 万个具身智能样本中,约有 160 万个包含 2 到 4 个视角的同步拼接数据;这在不主导整个数据集的前提下,提供了丰富的多视角监督信号。
自动驾驶数据
虽然操作类数据捕捉的是受限工作空间内细粒度的物体交互,但自动驾驶数据则让模型接触到范围大得多的运动空间,涵盖了各种驾驶动作(如转弯、变道、加速)以及更广泛的速度和轨迹范围。驾驶场景还包含丰富的多智体动态交互——即周围车辆、行人和骑行者在交通规则下的相互作用——这要求世界模型学习多个物体如何随时间推移进行移动、相互遮挡以及相互影响。此外,摄像机的大幅度位移通过视差和透视变化,为 3D 场景几何结构提供了密集的监督信号,从而增强了模型的视角合成与空间推理能力。其从四个大规模数据集中精选了多视角驾驶视频:Waymo E2E (Waymo Team, 2024)(真实驾驶场景,8个环视摄像头,7,044个片段/11.3小时)、NVIDIA PhysicalAI-AD (NVIDIA, 2025b)(真实驾驶场景,5个视场角为30°–120°的摄像头,1,342,418个片段/1,715.9小时)、Bench2Drive (Jia et al., 2024)(CARLA模拟驾驶,涵盖9,881种多样化交通场景,6个摄像头,384,948个片段/511.2小时)以及 Sekai (Sekai Team, 2025)(以自我为中心视角的行人步行及无人机视频,9,995个片段/166.6小时,包含场景与天气标注)。这些驾驶数据总计包含1,744,405个片段,时长达2,405小时。其采用统一的三阶段处理流程:(1) 帧提取并将轨迹统一转换为通用的路点格式;(2) 基于自车机动动作的转换,将视频分割为动作片段(时长2–8秒);(3) 生成描述文字,结合结构化轨迹描述与可选的视觉语言模型(VLM)增强。
以自我为中心的室内导航数据
以自我为中心的室内导航数据为操作数据和驾驶数据提供了互补的视角。操作任务侧重于有限工作空间内细粒度的物体交互,驾驶任务则在室外大规模环境中进行;相比之下,室内导航要求模型理解房间尺度的空间布局、进行具备避障意识的路径规划,并实现从文本导航指令到空间连贯视觉轨迹的映射。
参考 VLNVerse (Lin et al., 2025) 的做法,利用支持照片级真实感渲染和连续控制的 NVIDIA Isaac Sim (NVIDIA, 2022) 平台,采集基于物理环境的以自我为中心的导航数据。收集了涵盖134个室内场景的6,064个成功导航片段,每个片段包含一段以自我为中心视角的RGB视频(分辨率256×256,帧率10 FPS)以及相应的自然语言导航指令。这些轨迹的平均长度约为8.2米(范围在4至17.5米之间),总行程距离约为49.8公里,包含约5.8小时的连续第一人称导航视频。指令采用两种形式:单字符串的分步指示(3,031个片段,平均长度67.2词)以及涵盖正式、自然和口语化风格的多粒度描述(3,033个片段)。
基于此类遍历数据训练出的视频生成模型,能够展现出跨帧的涌现式3D一致性与空间连贯性(Gao et al., 2026; Bar et al., 2025);同时,每个序列所具备的物理真实性与动作条件特性,促使模型内化深度推理、几何一致性以及具备障碍物感知能力的规划能力(Shang et al., 2025; Han et al., 2025; Zhen et al., 2025)。通过将语言指令与连续的自我中心视角遍历过程相结合,该数据集使世界模型能够在室内环境中协同学习语言理解、3D空间推理及具身动作预测。
人机迁移数据
为了在无需物理机器人采集的情况下训练模型学习跨形态(cross-embodiment)的视觉对应关系,整理两类互补的人机迁移数据。第一类是基于第一人称双臂操作录像,通过自动化流程构建的大规模人机配对数据集:利用 MANO(Romero,2017)模型重建并提取 3D 手部关键点,将其重定向为机器人末端执行器的轨迹;通过视频修复技术去除画面中的人手;利用 MuJoCo(Todorov,2012)的逆运动学将 14 种机器人手臂模型渲染到修复后的场景中。由此,每个操作片段(episode)生成四路对齐的视频流:原始人类视频、去手场景、纯仿真场景以及机器人叠加场景。在同一场景下涵盖 14 种不同机器人形态的多样性,确保了编辑能力能够泛化至各种机器人构型。
第二类数据旨在解决直接渲染的一个根本局限:简化渲染器往往忽略场景光照、投影以及与材质相关的镜面反射,导致渲染图像与真实观测之间存在光度学差异。为弥合这一差距,基于开源的 InternA1 数据集(Tian,2025)进行构建;该数据集利用 NVIDIA Isaac Sim(NVIDIA,2022)生成包含环境光照和精确阴影的光影逼真(photorealistic)RGB 观测数据。用相同的动力学参数和机器人 URDF 模型,在 MuJoCo(Todorov,2012)中渲染匹配的第一人称视角图像(不含光照或阴影效果),从而生成几何结构与视角完全一致、但在光度学逼真度上存在差异的配对样本。此类配对数据使模型能够学习简化渲染与光影逼真观测之间的视觉映射关系。该数据集涵盖 Franka Emika Panda、AgileX Split Aloha、ARX Lift2 和 AgiBot Genie1 等多种机器人,涉及单臂、双臂、移动双臂及人形机器人等构型,包含约 8 万个操作片段,任务类型涵盖抓取放置、铰接物体操作及多物体重新排列。
3 数据处理
其设计一套统一的数据处理流程,将来自各种具身智能平台及通用视频源的异构原始数据,转化为高质量且格式统一的训练样本。如图2所示,该流水线包含四个阶段:(1) 原始数据采集,(2) 视频预处理,(3) 分层标注,以及 (4) 结合提示词迭代优化的字幕质量筛选。第2和第3阶段根据源数据特性采用领域自适应操作,而第4阶段则构成一个闭环反馈机制,将质量不佳的字幕重新送回进行针对性重标注。

阶段1:原始数据采集
该流水线首先从涵盖通用领域和具身智能领域的五类来源中获取原始视频数据。“通用视频”类数据提供了互联网规模的视觉多样性,涵盖纪录片、专业素材库及精选网络片段。“操作数据”类涵盖了广泛的机器人形态——包括单臂夹爪、双臂系统、灵巧手、移动平台及人形机器人——数据源自EgoHOD、Bridge V2、DROID、RoboMind、Agibot-World等数据集。“自动驾驶”类数据提供了大规模的自车运动(ego-motion)及多智能体动态信息,源自Waymo、Bench2Drive、NVIDIA PhysicalAI-AD及Sekai。“室内导航”类数据提供了基于语言引导的空间推理片段,源自涵盖134个室内场景的VLNVerse。“人机迁移”类数据提供了成对的人类演示与机器人执行数据,这些数据是通过我们自动化的MANO到机器人映射流水线构建的,涵盖了14种机器人类型。
阶段2:视频预处理
原始视频需经过领域自适应预处理,以生成适合训练的统一结构化片段。根据源数据特性,采用五种互补的操作:
帧提取。针对短时程任务视频(通常为持续2–8秒的单步操作),以特定目标帧率提取帧,以捕捉交互的关键阶段——接近、接触、操作及结果——从而确保每个样本都包含原子动作的完整因果链。
帧插值。当源视频帧率不足以支持平滑运动学习时,采用时间插值来增加帧密度,从而保留连续的运动轨迹,这对建模细粒度接触动力学及物体状态转换至关重要。
子任务切分。针对涉及多步骤流程的长时程片段(例如连续的抓取与放置、复杂装配),将视频分解为语义连贯的子任务片段。每个片段都涵盖一个具有明确起始与结束状态的完整原子动作,从而避免因简单的均匀截断而产生的不完整执行伪影。
主视图选择。对于仅需单一主要视角的“多机位”录制内容(例如单视角操作训练),选择信息量最丰富的摄像机流——通常是能最佳捕捉交互区域的第一人称视角(egocentric view)或外部视角(external view)——并舍弃冗余角度。
多视图拼接。反之,对于多视图联合训练,将来自 2–4 个摄像机视角的同步片段拼接成单一的水平布局,同时保持各视图间的时间对齐。这使得模型无需修改架构即可学习跨视图的几何一致性及同步的状态转换。
阶段 3:分层标注
------分层标注提示词模板
作为一位具身智能(Embodied AI)领域的专家级标注员。针对一段由 {{viewpoint_type}} 视角拍摄的、展示 {{embodiment_type}} 执行操作任务的视频片段,需要生成以下五层标注内容。
— 分析阶段 —
第 1 层 – 任务目标:识别此次交互的高层意图。智体(agent)试图实现什么目标?请用一句话描述从当前观测状态到目标状态的预期状态转换。
第 2 层 – 动作细节:将智体的动作分解为分步序列。针对每一步,明确说明:(a) 运动轨迹与方向,(b) 微动作(如靠近、抓取、抬起、旋转、释放等),© 预估速度与力度等级。必须明确指出所依据的视角(第一人称 / 腕部 / 外部 / 多视图拼接)。
第 3 层 – 物理反馈:描述每个动作对环境产生的可观测物理后果:物体位移、形变、接触状态变化以及任何次生效应(如液体晃动、布料折叠)。仅包含视觉上可验证的结果。
— 生成阶段 —
第 4 层 – 综合描述(50–100 词):将第 1–3 层的内容整合为一段连贯的文字,全面阐述“视角-智体-动作-反馈”这一四元组信息。内容应涵盖摄像机视角、智能体身份、完整动作序列及物理结果。
第 5 层 – 简明描述(15–30 词):将其浓缩为指令式摘要,仅保留“视角-智体-关键动作”这一核心要素,使其适合作为世界模型的直接语言指令。
质量约束:
• 操作重点:仅描述智体动作及物体交互;省略背景叙述。
• 视角定义:明确标明视角类型及其语义角色。
• 客观性:仅报告可见的动态变化;不推断隐藏状态。
• 物理可验证性:所述的每一个结果都必须能从视频画面中直观确认。
预处理后的视频将通过该五层分级标注框架的处理,生成两种粒度的视角感知描述——详尽描述(50–100 词)和简明描述(15–30 词)——并在训练过程中以等概率进行采样。标注模型所使用的提示词模板如上所示。
阶段 4:描述质量筛选
为了确保语料库中涵盖的各种场景、任务和具身形态下的标注质量,实施一套结合自动评估与人工监督的闭环质量筛选系统。未通过质量检查的描述会被送回阶段 3 进行针对性重标,从而形成一个迭代优化循环。
评估流程(Judge Pipeline)。基于大语言模型(LLM)的自动评估器会从多个维度对每条描述进行评估,包括事实准确性、具体程度、指令清晰度以及视角一致性。具体而言,它会评估描述是否准确反映了视频内容、是否提供了超越笼统表述的充分细节、是否能作为可执行指令,以及空间参照是否与摄像机视角保持一致。未能满足上述任一标准的描述将被标记,以待进一步审查。
人工评估。部分描述——特别是那些处于评估阈值边缘或来自样本稀缺领域的描述——将由人工标注员进行复核。他们负责验证准确性、识别系统性错误模式,并提供作为“真值(ground-truth)”的修正内容,从而指导后续的提示词优化工作。
提示词迭代优化。当“评判流水线”(judge pipeline)识别出特定类别中持续表现不佳的情况时,其会针对三个维度启动定向提示词(prompt)重构:特定场景重试(如户外光照条件、厨房环境)、特定任务重试(如关节物体操作、液体倾倒)以及特定具身形态重试(如人形双臂协同、灵巧手操作)。每次重试均采用针对特定失败模式定制的提示词模板,并由评判流水线对优化后的描述(caption)进行重新评估,直至其达到质量标准。这种迭代循环机制确保了不会因采用“一刀切”的提示词策略,而导致任何场景、任务或具身形态类别出现系统性的标注质量低劣问题。
最终语料库统计。在完成四个阶段的处理流程后,最终训练语料库包含约 860 万个视频-文本对(涵盖超过 2 亿帧观测图像),其中具身智能数据占比 70%,通用数据占比 30%。在具身智能数据部分,单视角操作数据占据主体,约为 430 万个样本;其次是约 160 万个多视角拼接样本(包含 2 至 4 个同步摄像机视角),以及约 20 万个导航与驾驶样本。
1 模型架构
如图3所示,该模型由三个组件构成:作为动作编码器(action encoder)的MLLM、作为状态编码器/解码器(state encoder/decoder)的VAE,以及作为状态转移函数(transition function)的MMDiT(Esser,2024),并采用双流(double-stream)设计。
MLLM — 动作编码器。用冻结参数的Qwen2.5-VL(Bai,2025)将用户输入编码为条件信号。对于给定的输入文本S,它提取最后一层的隐藏状态h = φ(S),作为动作条件。
VAE — 状态编码器/解码器。VAE将视频帧编码为潜表示z = E(x),并将预测出的潜表示解码回视觉观测。采用Wan-VAE(Wan,2025)架构,该架构同时支持图像和视频模态。
MMDiT — 状态转移函数。MMDiT采用双流架构:理解流(understanding stream)接收MLLM的编码h(经由可训练连接器投影),而生成流(generation stream)接收来自VAE的带噪状态潜表示。在每个模块(block)中,两个流通过联合注意机制(joint attention)进行交互。主干网络包含60个双流模块,具有24个注意头(头维度为128)、3072的隐层维度以及2×2的Patch大小。总参数量:MLLM为7B,VAE为127M(编码器54M + 解码器73M),MMDiT为20B。上下文长度支持高达48,360个视频Token。
2 3D旋转位置编码(3D RoPE)
采用3D RoPE(Su,2024;Heo,2024)来独立编码时间、空间高度和空间宽度维度。不采用均匀分配维度的方式,而是使用非对称划分:时间轴分配16个维度,高度和宽度各分配56个维度,总计128个维度(pe_axes_dim = [16, 56, 56])。时间轴分配较少的维度是因为相邻帧之间存在强相关性;空间轴分配了更多资源,以捕捉物体位置和场景布局的高度多样性。还应用 Scalable RoPE(Wan,2025),以支持在推理阶段泛化至不同的分辨率和时长。
3 Scene2Robot
基于双流 MMDiT 架构和非对称 3D RoPE 编码,其设计 SCENE2ROBOT。这是一种多片段条件控制机制,旨在复用同一主干网络来实现跨具身(cross-embodiment)视频合成,如图 4 所示。
首帧条件控制(TI2V 基线)。对于标准的“文本+图像转视频”任务,首帧作为固定的视觉条件:其 VAE 潜变量(latents)在生成流中被指定为时间步 t=0 且不参与去噪损失计算,同时冻结参数的 Qwen2.5-VL 将文本指令编码至理解流中。由于双流联合注意力机制在每一层融合了这两种信号,生成 Token 能够同时关注视觉锚点和语义动作规范,从而生成基于语言指令且在时间上连贯的后续视频内容。
面向“人-到-机器人”迁移的多片段扩展。从人类到机器人的迁移构成了一个视频编辑问题:模型既需要参考场景上下文(背景、物体布局、光照),也需要参考来自模拟演示的目标机器人运动轨迹。通过将首帧条件控制扩展为三片段输入序列来解决这一问题,所有片段均在同一个 VAE-MMDiT 流水线中处理,无需修改架构:
(1). 场景条件(F 帧):原始人类演示视频(已遮挡人类手部),经 VAE 编码以提供外观、空间布局和物体状态信息。
(2). 机器人参考(F 帧):通过 MuJoCo 渲染的模拟机器人执行过程,经 VAE 编码,提供目标具身的运动学轨迹和形态特征。
(3). 生成片段(F 帧):待去噪的噪声潜变量,最终生成逼真的机器人执行视频。
片段 (1) 和 (2) 采用与首帧条件控制相同的 t=0 设置,且不参与损失计算;仅片段 (3) 在训练过程中接收梯度更新。 3D RoPE 编码为每个片段分配了独立的时序索引范围,使模型能够区分不同片段间的时序位置。随后,每个 MMDiT 模块中的联合注意机制(joint attention)使得生成 Token 能够同时关注来自片段 (1) 的场景外观、来自片段 (2) 的机器人运动,以及来自理解流(understanding stream)的 MLLM 动作语义。这种三方条件约束使模型能够合成逼真的机器人执行动作,并忠实地保留场景上下文与指令所要求的操作行为。
1 训练策略
提出一种联合训练范式,将通用场景生成与机器人操作预测统一为同一个基于自然语言接口的条件视频生成任务,使模型在整个训练过程中持续接收来自两类数据源的梯度更新。这种统一的表述方式允许通用世界先验与具身动作先验通过共享的主干网络相互增强,从而实现跨场景、跨任务的稳定联合训练。训练过程分为两个渐进阶段:预训练阶段建立广泛的世界知识基础,而监督微调(SFT)阶段则在保持通用能力与专家能力平衡的同时,深化具身领域的专业化能力。
预训练阶段:建立通用世界基础
通用世界先验。从14个高质量视频平台精选超过2亿个真实世界观测样本,涵盖自然场景、日常生活及体育运动等领域。这种广泛的数据覆盖使模型能够内化与特定领域无关的世界先验知识——如物体运动、光照变化及碰撞动力学——从而构成了后续具身泛化能力的通用主干。此外,引入多相机同步观测数据并结合3D RoPE空间编码,建立了初步的跨视角几何一致性,为多视角具身生成奠定了空间基础。
人类交互先验。引入大规模的第一人称手部操作数据(如Ego4D、EPIC-Kitchen等)。人类演示充当通用能力与具身能力之间的天然桥梁:通过学习日常生活中的抓取、工具使用及物体操作,模型构建动作先验和对物体affordance的理解,这些能力可直接迁移至后续阶段的机器人操作任务中。
多任务联合训练。T2I(文生图)、T2V(文生视频)和TI2V(图文生视频)任务在共享主干网络上进行联合训练,这是实现通用能力与具身能力在单一模型中共存的核心机制。T2I任务利用通用图像数据学习清晰的视觉表征,作为视觉质量的基准;其习得的物体形态知识通过共享主干网络自动迁移至视频生成任务,从而有效避免了物体变形及身份特征不一致的问题。任务配比从纯T2I训练逐渐过渡到三项任务的全面联合训练,确保模型在预训练结束时能够稳定地在多种生成模式下运行。
SFT 阶段:具身专用化
SFT 阶段在每个训练批次中保留通用世界数据的同时,逐步深化具身专业知识,确保具身专用化能力与通用世界建模能力协同提升,而非此消彼长。
渐进式具身知识注入。采用四阶段数据混合策略。在训练初期,多具身机器人数据与人手操作数据共同占据主导地位:人类动作先验引导模型学习跨具身操作的共性,而机器人数据则强化具体的执行表征。随后,逐渐增加腕部视角和第三人称视角的数据,以扩大视角的覆盖范围。在此基础上,引入多视角拼接训练:将来自多个摄像头的同步首帧在空间上拼接为单一输入,要求模型同时生成所有视角的后续帧,从而迫使注意力层建立跨视角的空间对应关系,实现几何一致的多视角生成。在最后阶段,针对稀缺的高复杂度任务(如倾倒、折叠、双臂协作、多材质交互)及长程推理数据进行补充,以拓展具身能力的边界。在整个过程中,通用世界数据持续参与每个训练批次,与具身数据共同作用于同一主干网络,确保具身专用化与通用世界建模能力同步发展。
2 训练目标与基础设施
采用流匹配(flow matching)目标函数(Lipman et al., 2023; Liu et al., 2022),其中输入视频通过 VAE 编码器编码至潜在空间,噪声则从标准正态分布中采样。Qwen2.5-VL 将文本输入编码为引导信号。时间步长采样自对数正态分布,并根据视频序列长度进行自适应偏移调整(Esser et al., 2024)。对于 TI2V 任务,首帧的时间步长固定为 0,以确保生成过程基于给定的观测帧进行条件化。训练基于 Megatron-LM(Shoeybi et al., 2019)采用混合并行策略进行,并对部分双流(dual-stream)模块应用选择性激活重计算(selective activation recomputation,Korthikanti et al., 2023),以平衡显存占用与训练吞吐量。
基准测试
EWMBench(Yue,2025)从三个维度评估具身世界模型:场景一致性(SceneC)、运动正确性(HSD、Dyn、nDTW)以及语义对齐(多样性、BLEU、CLIP、逻辑性)。该基准测试包含 7 个任务下的 21 个样本,这些任务具有明确的动作顺序约束。
DreamGen Bench(Zhou,2025)评估由视频世界模型生成的机器人视频质量,针对 GR1 机器人具身形态的三个子集——环境泛化(GR1-Env)、物体泛化(GR1-Object)和行为泛化(GR1-Behavior)——衡量指令遵循(IF)和物理对齐(PA)能力。其中,IF 评估采用 Qwen2.5-VL(Bai,2025)作为评估器。
PBench(NVIDIA,2025a)从两个互补的方面评估模型:(1) 领域得分(Domain Score),通过 Qwen2.5-VL 评估的问答(QA)对,衡量模型对六大领域(自动驾驶、机器人、工业、物理、人类、常识)中物理行为的理解;(2) 质量得分(Quality Score),利用 VBench(Huang,2024)的八项指标(包括图-视频一致性、美学质量、运动平滑度、主体一致性等)衡量视觉质量。综合得分(Overall Score)为上述两项得分的平均值。
WorldModelBench(Li,2025)从三个维度评估模型:指令遵循(0–3 分制)、常识(帧质量与时间质量)以及物理规律遵循(涵盖 5 种违规类型:牛顿定律、质量守恒、流体动力学、穿模现象、重力)。该基准测试包含 7 个领域及 56 个子领域下的 350 个实例。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)