26年7月来自生命科学AI公司“流形空间(Manifold AI)”、清华和上海交大的论文“WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory”。

世界动作模型(WAMs)通过联合建模视觉状态转换与机器人动作,为机器人操作任务提供了一种极具前景的范式。然而,现有的 WAMs 受到时间上下文有限、仅限于片段级(episode-level)的粗粒度语言监督以及主要依赖纯文本条件控制等因素的制约;这些局限性不仅阻碍了任务进度追踪及语言-视频-动作的细粒度落地(grounding),还限制了视觉上下文推理与跨具身(cross-embodiment)迁移能力。WorldScape Policy 2.0,是一种结合推理-增强型长短期记忆(LSTM)机制的可控 WAM。其“因果短期视觉记忆”模块利用近期观测数据作为 扩散 Transformer(DiT)的预填充(prefill)信息,以保留局部的交互动态;而“长短期事件记忆”模块则将视觉语言模型(VLM)的历史输出组织为全局历史、局部活跃状态及事件边界表征,从而支持基于任务进度的信息检索。检索的历史信息增强感知能力及自回归生成的规划 Token,进而为自主规划提供了隐式子目标条件;此外,语义强制(semantic forcing)机制进一步将事件级的指令语义迁移至这一潜规划路径中。

为了实现细粒度的多模态可控性,其构建了 ManipEvent-5M 数据集——这是一个基于事件对齐的具身预训练数据集,包含近 500 万个事件片段,涵盖动作轨迹、片段级子任务描述、目标图像及视频演示等多种对齐数据。这些设计提供一个统一的接口,既支持基于高层指令的自主规划,也支持基于细粒度文本、目标图像或视频上下文提示的可控执行。


1 用于机器人操作的世界动作模型

世界动作模型(WAMs)利用视觉动力学进行机器人动作规划,为从观测到动作的反应式策略提供了一种以动力学为核心的替代方案。早期的世界模型和视频预测策略使用未来的观测、视觉目标或潜状态作为规划的中间表征 [13–25]。V-JEPA 2-AC [26] 进一步证明,一种基于动作条件的潜世界模型——在利用大规模视频表征进行预训练并辅以少量机器人数据后——能够支持基于图像目标的规划。其他互补方法包括将世界模型用作可扩展的具身数据引擎(如 GigaWorld-0 [27]),或直接将预训练的视频模型适配为策略(如 Cosmos Policy [28]),后者在视频潜空间内表征动作、未来状态和价值。

近期的 WAM 研究正向统一的视频-动作建模发展,表明以动作为中心或具有因果关系的视频-动作模型可用作零样本机器人策略 [6, 7, 9, 11]。LingBot-VA [10] 强调采用持久化 KV 缓存的因果自回归视频-动作建模,而 MemoryWAM [12] 则通过利用近期帧、事件边界锚点和要点(gist)tokens来提高内存效率。除了整体视频或全局潜状态预测外,OA-WAM 引入持久化的“对象可寻址槽位”(object-addressable slots),并联合预测以对象为中心的世界状态与流匹配(flow-matching)动作片段 [29]。然而,以往的 WAM 研究往往只是对文本引导的视频骨干网络进行改造,主要将视频预测作为训练时的监督信号,或者缺乏对任务进展的显式推理能力 [6, 9]。WorldScape Policy 2.0 通过原生的可控 WAM 预训练以及结合推理增强的长短期记忆机制,解决上述不足。

2 长期记忆与长时程规划

长时程操作任务要求模型能够记住已完成的子目标,并判断尚需执行的操作。诸如 Long-VLA [30] 这样的端到端方法引入了针对运动和交互的阶段感知建模,从而在无需显式规划器的情况下改善了技能链式执行的效果。其他 VLA 模型会显式呈现中间规划表征:𝜋0.5 [3] 在生成动作之前预测高层子任务,而 𝜋0.7 [4] 则利用子任务语言描述、元数据、历史信息及视觉子目标,实现长程且受语言引导的执行。VLA-OS [31] 系统性地研究了语言、视觉及分层规划表征,强调了基于视觉的中间规划所带来的优势。

诸如 MEM [32] 和 MemoryVLA [33] 等面向记忆的方法,通过检索并融合多尺度的具身或感知-认知记忆,实现具备时间感知能力的动作预测。LoHo-Manip [34] 在后退视界控制(receding-horizo​​n control)框架下,维护一份包含已完成与待完成子任务的显式规划,并结合更新后的视觉轨迹进行操作。Goal2Skill [35] 和 DSWAM [36] 等双-系统方法同样将高层规划与底层执行解耦,通过向 VLA 或 WAM 执行器传递子目标、视觉轨迹或可执行指令来实现这一过程。NovaPlan [37] 结合了闭环 VLM 规划器、生成的视频参考以及基于几何信息的执行机制,从而实现零样本长程操作。这些研究凸显了记忆与子任务推理的价值,但通常依赖于 VLA 策略、外部规划器或显式的中间规划。相比之下,WorldScape Policy 2.0 则将近期的视觉动力学、事件级进度记忆以及潜在子目标推理整合到了一个可控的 WAM 之中。

3 面向可控策略的细粒度提示

细粒度语言提示为可控操作提供了一个重要的控制接口,因为粗粒度的轨迹级指令无法具体描述多样化的原子动作、物体状态、执行风格以及中间子目标。在通用模型层面,Qwen-VLA [38] 通过具身-觉察提示(embodiment-aware prompting),统一跨任务、跨环境及跨机器人形态的连续动作与轨迹生成,同时在同一策略内保留细粒度控制能力。FineVLA [39] 则将语言粒度作为监督维度,通过将目标级和过程级指令与机器人轨迹对齐,提升因子级的可控性。相关研究通过像素级视觉提示 [40]、三维空间动作表征 [41]、基于重构的视觉定位 [42] 以及辅助空间协同训练 [43] 等方式,引入密集控制或定位信号。

视觉提示为指定动作发生的位置及方式提供一种互补的交互接口。TraceVLA [44] 将“状态-动作”轨迹渲染为视觉轨迹,以增强时空定位能力;而 CoT-VLA [45] 则在生成动作之前,自回归地预测未来的子目标图像,以此作为视觉推理步骤。基于人类演示条件的策略 [46] 进一步利用单段人类视频作为任务提示,并通过对齐人类与机器人的表征来实现跨具身迁移。显式子任务分解也能为 WAM 执行器提供细粒度的可执行指令 [36]。WorldScape Policy 2.0 通过基于事件的 WAM 预训练,将这些互补的方向统一起来,实现 ManipEvent-5M 中的细粒度子任务描述、目标图像及视频演示与视觉状态转换及原子动作轨迹的对齐。


如图1所示,现有的世界-动作模型(WAMs)在以下三个维度上仍存在局限性。

  • 有限的进度感知记忆能力。大多数现有方法基于当前观测 [6–9] 或短时间窗口的历史信息 [10, 11] 来进行世界-动作建模。这种有限的上下文信息使得模型难以把握全局任务进度,特别是在不同阶段呈现相似视觉外观的情况下。例如,在完成某个中间子目标前后,桌面场景可能看起来几乎完全相同,但正确的后续动作却取决于已完成的操作内容。MemoryWAM [12] 通过高效的混合记忆机制扩展了对完整视觉历史的访问能力。然而,仅仅检索过去的视觉证据,并不能明确地围绕任务进度组织历史信息,也无法将其转化为用于自主规划的潜在子目标条件。
  • 粗粒度的语言-视频-动作对齐。 在许多具身智能数据集中,同一任务片段的不同部分往往共用相同的任务级指令,这为多样化的原子动作提供了微弱的语言监督信号。因此,模型可能会依赖视觉捷径,而无法学习事件级意图如何与特定的状态转换及动作序列相对应。结果是,模型虽然能生成看似合理的视频-动作轨迹,却对所请求原子动作的细微变化不敏感或表现脆弱。
  • 受限的交互接口。现有的 WAMs 主要通过文本进行控制,而用户往往能通过目标图像、演示视频或来自其他具身形态的示例更自然地表达意图。缺乏原生视觉提示功能,使得 WAM 无法充分利用目标状态证据、物体对应关系或潜在的任务规则,从而限制了视觉上下文推理和跨具身形态迁移的能力。

请添加图片描述

核心见解是,实现长程可控性需要两种互补的时间上下文形式:用于推理任务进度的语义事件记忆,以及用于保留局部交互动态的帧级视觉记忆。基于这一见解,提出 WorldScape Policy 2.0,这是一个结合推理增强型长短期记忆(Reasoning-Augmented LSTM)的可控 WAM。其 VLM 分支将历史片段组织为全局历史、局部活跃和事件边界三种记忆视图,并检索相关证据以增强对当前观测的感知及自回归规划tokens。与此同时,其因果 扩散Transformer(DiT)架构将近期观测保留为短期视觉预填充(prefill)信息,并将可选的视觉提示作为持久上下文。这种分工使得事件记忆能够推断下一个子目标,而视觉记忆则能保留不断演变的交互动态。

为了实现可扩展的监督学习,构建 ManipEvent-5M——一个基于事件的多模态数据集,包含近 500 万个片段,这些片段与动作轨迹、片段级任务指令、事件级子任务描述、目标图像及视频演示进行对齐。采用三阶段课程学习策略:首先通过基于事件的预训练建立细粒度的可控性与因果视觉记忆;随后引入事件记忆分支,利用语义强制(semantic forcing)将事件语义转化为自主的潜空间规划;最后使模型适应下游具身智体及各种交互模式。由此构建的视频-动作联合模型支持基于高层指令的自主规划、基于细粒度描述的直接控制,以及基于视觉提示的上下文适应。


1 概述与问题表述

WorldScape Policy 2.0 是一种可控的世界动作模型(World Action Model),旨在支持基于共享视频-动作主干(backbone)的自主规划与交互式操作。

(1) 统一的动作表示。对于机器人具身 𝑒,动作相对于每个动作分块(action chunk)的首帧来表示。

(2) 特定具身(embodiment-specific)的动作适配器。每种具身都拥有专用的动作编码器 E和动作解码器 D。

编码器将受流(flow)扰动的原始动作片段投影到共享的 DiT Token 空间,而解码器则将生成的动作隐状态映射回原始动作空间中的速度场。这种因果视频-动作 DiT 在不同具身(embodiment)之间共享,而适配器(adapters)则负责处理各具身特有的运动学特性、动作尺度及控制惯例。关键在于,适配器仅提供输入和输出接口:流匹配(flow matching)与流积分(flow integration)均直接在原始动作片段上执行,而非在未来控制(动作)编码上进行。

如图 2 所示,语言提示和视觉提示遵循不同的条件化路径。细粒度指令由 T5 编码;高层指令由 VLM 推理分支结合当前观测进行解读;视觉提示则被编码为持久的 VAE 预填充(prefill)信息。在 DiT 联合预测未来的视频与动作片段之前,这些特定模态的条件信息会与事件及视觉记忆进行融合。

请添加图片描述

2 基于事件的世界动作建模 (Event-Grounded World Action Modeling)

现有的世界动作模型 (WAM) 通常基于粗粒度的“回合(episode)级”指令或单一交互模态进行训练,这对于长程操作过程中复杂多样的状态变化及原子级动作而言,仅能提供较弱的监督信号。相比之下,WorldScape Policy 2.0 将 WAM 的学习建立在“事件(event)级”之上,即通过将细粒度的子任务语义与视觉状态转换及对应的机器人动作进行对齐来构建模型。这种事件级结构支持两种语言交互模式以及互补的视觉提示机制:细粒度子任务指令经 T5 编码后直接控制 WAM,而高层任务指令则由视觉-语言模型 (VLM) 分支进行解析,以支持自主子目标规划;此外,目标图像和视频演示还提供持续的视觉上下文信息。持久视觉条件根据可用的视觉提示来选择。

语言条件同样由语言交互模式 𝜇 ∈ {auto, fine} 决定;该模式的语言输入包括片段级指令 𝑦 和事件级指令 𝑐_𝑡,而非将 T5 和 VLM 分支简单拼接为单一输入。

依赖于模式的语言基础(Language Grounding)。在细粒度指令遵循任务中,片段级描述 𝑐_𝑡 明确指定了原子动作或中间子目标。其 T5 嵌入向量 𝑠_𝑡 通过交叉注意机制直接注入 DiT,从而实现精确且可控的动作执行。在自主规划任务中,机器人仅接收片段级的高层指令 𝑦。VLM 综合解析 𝑦、当前观测以及历史事件记忆,以推断当前活跃的子目标;由此生成的“记忆增强型 VLM token”(而非 𝑦 的 T5 嵌入向量)作为 DiT 的条件输入。在训练过程中,事件级描述通过语义强制(semantic forcing)机制对这一潜规划路径进行监督。

基于目标的策略学习。目标图像提示以视觉形式指定期望的目标状态。WorldScape Policy 2.0 将目标图像编码为 𝑧^goal_t 并将其保留在因果视觉预填充(causal visual prefill)中,使得受流扰动的未来数据块在生成过程中能够关注到期望状态。因此,模型经过训练,能够推断出一条从当前观测通往视觉目标的、可执行的动作路径。

基于演示的上下文适应。视频上下文提示引入跨具身(cross-embodiment)适应任务;其中的上下文信息可源自“人对机器人”的演示、“机器人对机器人”的演示,或是涉及不同具身形态与视角的过往上下文片段。WorldScape Policy 2.0 将这些演示表示为 𝑣_𝑡,并将其与近期观测数据一并保留为持久的视觉预填充上下文。这种训练模式促使模型从视觉演示中推断物体对应关系、可迁移的动作模式以及潜在的任务规则,从而直接匹配 ManipEvent-5M 数据集所提供的视频上下文标注。

3 推理增强型长短期记忆(Reasoning-Augmented LSTM)

长时程操作任务需要两种互补表征层面的记忆能力。在事件层面,模型必须保留关于已完成子任务的语义证据,并检索与当前任务阶段相关的历史信息。在视觉层面,为了实现时间上连贯的视频动作预测,模型必须保留近期的帧级动态信息,例如接触状态的变化和物体的运动。如图3所示,WorldScape Policy 2.0 结合 VLM 推理分支中的“长短期事件记忆”与因果 DiT 分支中的“短期视觉记忆”。前者针对历史动作片段(chunk)的表征执行感知进度的检索,而后者则直接提供近期的视觉潜向量(latents)作为因果预填充(prefill)上下文。此外,可选的目标图像和视频演示也会在整个推演(rollout)过程中作为持久的视觉上下文予以保留。

请添加图片描述

潜推理的表述。对于自主规划下的每一个动作片段,感知与规划模块共享同一个 VLM 上下文,而非分别进行前向传播计算。该上下文结合当前的头部视角观测 o^head_t 与任务条件化的规划提示 𝑦~_t = T_plan(y)。用一个以下固定模板来实现 T_plan,其中的{task} 可以是片段级指令 y:

“你是一个机器人规划器。指令:{task}。根据当前的高层任务指令和当前的头部视角观测,预测下一秒要执行的原子动作子任务。”

单次 VLM 预填充(prefill)操作会联合编码 (ohead_t, y~_t),并生成最终层的上下文隐状态 Hctx_t 及其对应的 KV 缓存。感知token u_t 直接从该 VLM 输出中读取。

基于同一缓存上下文,VLM 随后以自回归方式继续运行,并利用贪婪解码生成 K 个离散规划token wk_t。在每个解码步骤中实时返回的最终层隐状态被保留为相应的潜规划token rk_t。

因此,u_t 和 r{1:K}_t 属于同一连续的 VLM 推理轨迹:u_t 编码共享的视觉-语言预填充信息,而 r^{1:K}_t 则概括了其自回归推理出的任务后续内容。将这两组tokens拼接起来,构成当前的推理潜向量 q_t,该向量联合表征当前状态与推理出的下一个子目标。历史观测数据通过相同的感知和规划分支进行处理,从而确保每个记忆条目都具有相同的两部分标记结构。

长短期事件记忆的构建。事件记忆分支维护一个队列 Q_t = {q_1, …, q_{t-1}},其中包含上述历史分块(chunk)级别的 VLM 输出。每个 q_j 包含与分块 j 相关的感知token和潜规划 token。为了控制全历史检索的开销,通过注意力池化(attention pooling)将每个历史分块的感知token压缩为固定数量的学习型“要点”(gist)tokens,同时保留其规划tokens。将所得tokens拼接后,便构成紧凑的全历史记忆库 H_t。随后,显式构建三种互补的记忆视图:全局历史潜向量概括了完整轨迹,局部活跃潜向量表征当前活跃事件,而事件边界潜向量则稀疏地保留了主要的语义转换信息。近期的局部活跃分块和选定的边界分块被保留为全token锚点(anchors),以保存细粒度的感知与规划证据。

事件边界分块是根据历史 VLM 输出中的潜向量变化直接选取的。令 {q-}_j = Mean(q_j) 表示数据块 j 的 Token 平均表征。由此产生的事件边界隐变量能够稀疏地保留子任务可能开始、结束或发生转换时刻的状态,且无需显式的在线边界标注。与局部活跃记忆(local-active memory)类似,被选中的数据块以完整 Token 锚定帧(anchor frames)的形式存储;这使得模型能够在这些关键转换点回溯详细的感知与规划依据,而不仅仅是依赖汇总后的边界得分。

因此,事件记忆结合来自全局历史与事件边界隐变量的长期任务进度上下文,以及来自局部活跃隐变量的短期语义上下文。这种锚定帧的实现方式在语义记忆组织中保留了局部细节,这与帧级视觉记忆有着本质区别。

事件记忆检索与门控融合。在具体实现中,将三种专用记忆视图与紧凑的完整历史记忆库进行拼接,从而确保在筛选过程中不会丢弃非边界处的证据。

鉴于历史证据在不同步骤中的有用程度各不相同,系统采用一种经学习得到的门控机制,来控制注入当前每个 Token 的检索记忆量。该检索机制允许模型有选择地利用任务级进度、近期事件上下文、稀疏的转换证据以及压缩后的完整历史信息。

视觉短期记忆与持久上下文。在进行事件记忆检索的同时,因果扩散Transformer 模型(DiT)通过视觉预填充(visual prefilling)来建模近期的帧级动态。将近期视觉潜表征(latent)缓冲区定义为 Z^{vis}t = z{obs}{t-s_v:t},其中包含当前观测以及最近 s_v 个视觉片段(chunks)对应的纯净 VAE 潜表示。在 DiT 序列中,这些潜表示位于经由流插值(flow-interpolated)生成的未来视频潜表示及经由具身编码(embodiment-encoded)生成的动作 Token 之前。

如图 4 所示,因果视觉注意掩码(causal visual-attention mask)允许未来的视频-动作 Token 关注持久的视觉提示(visual prompts)和可用的纯净历史信息,同时防止来自未来片段的信息泄漏。该路径通过 DiT 自注意机制提供局部运动和交互的连续性,而无需先将近期帧压缩到 VLM 事件记忆中。

请添加图片描述

与滑动式的近期帧缓冲区不同,可选的提示潜向量 p{vis}_t 在整个展开(rollout)步骤中保持固定,这使得模型能够持续参考预期的目标状态或演示轨迹。近期视觉潜向量与持久视觉潜向量均通过因果自注意机制输入 DiT,而交叉注意条件则根据交互模式进行选择:针对细粒度指令遵循使用 T5 嵌入,针对自主规划则使用经记忆增强的 VLM tokens。这种分离方式保留语义事件检索、局部视觉动态以及多模态任务条件设定各自的功能角色。

4 隐子目标潜规划

WorldScape Policy 2.0 以两种不同的方式利用事件级子任务描述(captions)。在细粒度指令遵循任务中,T5 嵌入向量 s_t = E_T5(c_t) 直接作为语言条件;而在自主规划任务中,该描述仅作为训练阶段的语义监督信号,用于指导 VLM 规划分支——该分支基于感知信息、自回归规划 token 以及检索到的历史记忆生成 {qˆ}_t。

子目标语义强制(Subgoal semantic forcing)。在训练过程中,s_t 为自主规划的潜表示提供一个语义目标。由于 s_t 和 {qˆ}_t 可能是长度不等的 token 序列,首先获取固定维度的摘要表示 {s-}_t = {Pool(s_t) 和 {q-}_t = Pool(qˆ_t)。保持 T5 目标编码器固定,并对其归一化后的表示应用梯度截断(stop-gradient),同时利用一个可训练的投影层 phi_q 将推理摘要映射到 T5 的语义空间中。

固定语义目标可防止对齐目标偏向于导致联合坍缩(jointly collapsed)的解,同时让 phi_q 学习将推理潜表示与显式子任务语义进行对齐。在自主推理阶段,细粒度描述及其 T5 嵌入不再可用;模型仅接收高级指令,并依赖 {qˆ}_t 根据当前观测和事件记忆来推断当前激活的子目标。

基于模式的视频动作预测。语言侧的交叉注意条件根据所要求的交互模式来选择,即显式的原子动作控制或者一种隐式推断且感知进展的子目标条件。令 𝜌 表示经由 AdaLN 嵌入的流时间步(flow timestep);共享的因果 DiT 生成动作与视频的隐状态,随后,特定于具身形态的动作解码器与共享的视频输出头分别预测各自的速度场。

在推理过程中,视频信息被整合到 VAE 潜空间中。在每个流步中,当前的原始动作片段会在下一次速度评估前通过编码器重新编码。在自主规划中,模型会反复更新事件和视觉记忆,推断 𝑞ˆ_𝑡,预测下一个片段,并结合新的观测向前推进。在细粒度指令执行中,外部指定的 𝑠_𝑡 直接引导每个原子动作,而不需要模型仅从高层指令中推断子目标。

5 ManipEvent-5M:基于事件的多模态数据集

为了支持 WorldScape Policy 2.0 的原生预训练,构建 ManipEvent-5M——一个如图 5 所示的基于事件的多模态数据集。该数据集汇集人类手臂视角的视频、无需机器人的 UMI 演示、仿真轨迹以及来自自采集和公开来源的真实机器人数据。每条轨迹都被分解为有序的事件序列。

请添加图片描述

这个方案将全局任务意图与事件级子目标语义分开,同时保持它们与观测和动作的对齐。

动作规范化和人手重定向。机器人轨迹被转换为笛卡尔末端执行器表示。对于人类数据,预估的手部姿态会在预训练前重定向到机器人夹爪的姿态和指令,从而产生在相同位置-旋转-夹爪语义下对齐动作的人类示范。这种规范化布局使得人类和机器人数据可以联合预训练,同时特定于机体的动作编码器和解码器保留不同的运动学映射和控制方式。

文本提示构建。用Qwen3-VL [54] 通过四阶段分层注释流程,将每条轨迹转换为集级任务描述和时间对齐的子任务标题,如图6所示。

请添加图片描述

(1) 两阶段标注。首先根据机器人状态信号构建时间结构,随后利用视觉语言模型(VLM)进行开放词汇语义重标注。在时间分割方面,基于末端执行器或手部的轨迹计算经具身归一化的平移与旋转速度,并进行平滑处理。运动状态转换、夹爪状态变化以及任务片段(episode)的起止点构成了候选边界。短片段会与相邻事件合并,同时采用自适应粒度约束,既避免语义过于冗杂的片段,也防止因传感器抖动产生的碎片化片段。根据运动和夹爪信号,每个生成的事件都会被赋予一个粗粒度的基元先验(primitive prior),例如“移动”、“抓取/释放”或“空闲”。确定边界后,VLM 负责判定轨迹及各事件的语义内容。这种两阶段设计将“动作何时发生变化”与“动作的具体含义”解耦,从而减少直接对长视频进行描述时常见的步骤遗漏、顺序错误及时间对齐偏差。

(2) 分层帧采样。标注过程涵盖任务片段(episode)和事件(event)两个层级。在任务片段层级,从完整轨迹中采样最多 16 个代表性时间点,并将这些时间点的图像与有序事件列表、时间边界、基元动作先验及执行结果一并输入模型。Qwen3-VL 输出结构化的高层级描述,总结实际完成的任务(即事后任务描述,而非原始指令的逐字复述);这种方式使得标注结果对于指令缺失、执行偏差及纠错尝试具有鲁棒性。在事件层级,在每个片段内均匀采样最多 12 个时间点,并收集相应的可用相机视角图像。结合任务片段层级的高层级描述、事件边界、基元先验及局部视觉信息,VLM 生成针对单个动作的步骤描述文本(step_text)。将全局总结与局部描述分离,既能将每条指令与特定事件关联,又能避免长动作序列中的遗漏与顺序错误。

(3) 具身提示词约束。将标注指南转化为结构化的提示词约束,而非要求模型生成无约束的视频摘要。提示词提供了时间元数据和基元动作先验,并引导生成的描述包含以下要素:动作顺序、执行动作的末端执行器、目标物体、初始与终止状态、接触模式、运动方向、物体交互、身体动作,以及(若存在)失败或恢复行为。这些约束在保留自然语言动作描述的同时提高了语义密度;例如,标注明确指出了哪个夹爪与哪个物体交互并朝向哪个目标,而不是生成诸如“移动杯子”之类的笼统描述。

(4) 多视角冲突解决。对于事件级标注,多视角观测数据采用“局部优先”的组织方式,即:左夹爪视角 → 右夹爪视角 → 头部视角。头部相机提供全局场景和任务上下文,而手腕/夹爪相机则提供关于接触、抓取状态及局部目标身份的更可靠依据。因此,提示(prompt)指示视觉-语言模型(VLM)在夹爪视角与头部视角发生冲突时优先考虑夹爪视角的证据,从而减少在杂乱场景中对目标物体的混淆。最后,输出结果被解析并验证为结构化记录;无效的片段(episode)标注会触发更严格的重试或基于规则的备用方案,而失败的事件标注则仅在局部进行替换,无需丢弃剩余轨迹中的有效标签。

如表1和图7所示,ManipEvent-5M 结合了大规模视觉覆盖与跨异构数据源的事件级子任务分解。除了细粒度的文本标注外,还构建了目标图像和视频演示提示,以支持视觉目标指定及跨具身(cross-embodiment)的上下文适应。
请添加图片描述

请添加图片描述

目标图像提示构建。构建两种互补类型的目标图像提示。第一人称视角(first-view)目标图像直接提取自每个分割事件的最终观测帧,展示与相应动作轨迹相同的相机配置和具身形态下的期望结果状态。因此,它为学习原子动作后的状态转换提供了明确的视觉目标。第三人称视角(third-view)目标图像则采样自任务匹配的人类演示视频中事件完成时刻的画面。此类图像保留了人类演示者,并从外部视角展示目标物体的布局状态。它们要求策略模型能够忽略演示者和视角的影响,推断出预期的结果,并利用机器人自身的具身形态复现演示中的状态。

视频提示构建。视频提示(video prompts)主要用于“人到机器人”及“机器人到机器人”的任务迁移。在“人到机器人”迁移中,将自行采集的真实机器人轨迹与针对同一任务采集的 UMI 演示进行配对。配对依据包括全局任务、有序事件序列及最终结果,旨在确保人类与机器人的演示体现一致的动作流程,并减少关于应迁移何种技能的歧义。在“机器人到机器人”迁移中,收集或检索由不同机器人形态执行同一语义任务的轨迹,并利用其有序事件描述与目标状态进行对齐。由此生成的“上下文-目标”配对促使模型识别与具体形态无关(embodiment-invariant)的物体对应关系、动作结构及任务意图,同时使执行过程适应目标机器人。

6 训练目标与三阶段课程学习

WorldScape Policy 2.0 采用联合“视频-动作”目标进行优化;当启用自主规划功能时,还会额外引入“语义强制”(semantic-forcing)目标:

L = L_𝑎𝑐𝑡 +𝜆_𝑤 L_𝑤𝑜𝑟𝑙𝑑 +𝜆_𝑠 L_𝑠𝑒𝑚.

其中,L_𝑎𝑐𝑡 和 L_𝑤𝑜𝑟𝑙𝑑 分别是针对动作和未来视觉潜在状态生成的流匹配(flow-matching)目标,L_𝑠𝑒𝑚 遵循子目标语义强制;当启用语义强制时,𝜆_𝑠 设为 0.001,否则为 0。多模态条件输入与记忆门控机制通过这些目标进行端到端训练,无需额外的提示(prompt)或记忆标签。

训练过程遵循一个三阶段课程,旨在逐步实现多模态可控性、自主规划以及下游交互式操作能力。

阶段 1:基于事件的(event-grounded)多模态 WAM 预训练。首先在 ManipEvent-5M 数据集上预训练因果视频-动作(causal video-action)主干网络,使用包含细粒度描述、目标图像、视频演示、视觉转换和机器人动作的事件级样本。不同的提示模态被采样作为可互换的控制条件:细粒度描述通过 T5 交叉注意力机制注入,而目标图像和视频演示则被编码为持久的视觉预填充(visual prefill)信息。在此阶段,短期因果视觉记忆已开始发挥作用:近期的观测片段被动态维护为纯净的视觉预填充信息,使 DiT 能够通过因果自注意力机制建模局部时间连续性。阶段 1 尚未引入基于 VLM 的事件记忆或自主潜在子目标推理。

该阶段在引入事件级记忆推理之前,建立细粒度的语言-视频-动作对齐(grounding)、短时程视觉动力学以及可控的视频-动作生成能力。

阶段 2:记忆感知的中期训练。基于阶段 1 的 WAM 并保留其短期因果视觉记忆,引入 VLM 规划分支以及长短期事件记忆,以实现自主规划。该阶段使用时间跨度更长的机器人轨迹进行训练,其中片段级(episode-level)指令提供全局任务意图,而事件级描述则标识当前活跃的原子子目标。规划分支仅接收高级指令作为输入,通过检索全局历史、局部活跃状态及事件边界的潜表示(latents)以及紧凑的历史库(compact history bank),构建记忆增强型 VLM token {qˆ}t;局部活跃片段和边界片段保留完整的 token 锚点表示,以便进行精细检索。相应的细粒度 T5 嵌入通过 L{sem} 提供训练时的语义目标,但不直接用作自主规划的条件。

通过将潜子目标推理与阶段 1 学习的细粒度语义空间对齐,“语义强制”(semantic forcing)机制将预训练的语言理解和可控视频-动作生成能力迁移到自主规划路径中。因此,模型学会跟踪任务进度、推断当前活跃子目标并选择下一步动作,而无需在推理阶段提供明确的细粒度指令。

阶段 3:下游交互式后训练。最后,利用各任务所需的交互模式,在下游机器人任务上对模型进行后训练。长程操作任务会激活高层指令、经推理增强的事件记忆以及在线视觉历史,以实现自主规划。细粒度指令遵循任务则直接基于 T5 子任务嵌入(embeddings)来调节 WAM 模型。上下文适应任务保留目标图像或视频演示作为持久的视觉预填充信息,并将其与在线视觉记忆及(必要时的)潜推理相结合。该阶段使共享的预训练模型能够适应特定任务的具身形态与动作分布,同时保持一个统一的接口,以支持自主规划、显式指令遵循及视觉提示适应。


1 基准设置与评估协议

通过仿真基准测试、控制变量消融实验及现实世界部署来评估 WorldScape Policy 2.0。在针对 RoboTwin 2.0 [51] 的主要对比实验中,所有方法均在包含“干净数据”与“随机化数据”的完整训练集上微调 50,000 步,以匹配对比基线所采用的设置;评估过程涵盖 50 个任务,每个任务进行 100 次试验,并分别在干净环境和随机化环境下进行测试。在这些设置下,评估任务成功率、子目标完成情况、指令遵循能力、进度一致性以及上下文适应能力。

针对 RoboTwin 2.0 的控制变量消融实验旨在分离并评估记忆组件、分阶段训练及语义强制(semantic forcing)各自的贡献。此外,还在 AgileX Robotics 平台上对模型进行评估,重点考察四项核心能力:长程自主规划、依赖记忆的推理、跨具身上下文学习(ICL)以及序列化细粒度控制。对于每个现实世界任务,均执行 20 次试验并报告平均成功率。

2 实现细节

模型配置。在事件标注方面,利用 Qwen3-VL-32B [54] 生成并验证片段级子任务描述、时间边界以及提示词元数据。推理增强型 LSTM 采用轻量级的 Qwen3-VL-4B 模型 [54] 作为潜在推理主干网络。为降低显存开销,该模块仅接收调整为 320 × 160 分辨率的头部视角观测图像。针对每个动作片段(action chunk),VLM 通过单次预填充(prefill)操作联合编码该图像与任务条件规划提示词,随后模型基于同一缓存上下文自回归生成 K=4 个规划 Token。

WAM 的输入将三个视角的摄像机画面拼接成一个统一的视觉画布。视频 DiT 初始化自Wan2.2-5B 文生视频预训练模型 [55],且视频 DiT 与动作 DiT 共享同一主干网络。视频与动作之间的交互采用联合双向注意力机制,而针对干净 Token(clean tokens)和视觉历史 Token(visual-history tokens)的注意力机制则保持因果性(causal),以确保自回归预测的有效性。在多具身(multi-embodiment)预训练阶段,每个具身使用其专属的动作编码器-解码器对,同时共享同一个视频-动作骨干网络。短期视觉记忆(LSTM)保留最近的最多 4 个动作片段(chunks);长期记忆默认保留 8 个历史片段,该长度可根据任务时域跨度和记忆需求进行调整。

训练设置方面,动作接口遵循定义:每只机械臂提供一个相对于片段的 3D 位置增量、一个连续的 6D 相对旋转表征以及一个绝对的单自由度(1-DoF)末端执行器指令,从而构成用于双臂控制的 20 维原始动作向量。动作流匹配(action flow matching)直接在该原始动作空间中进行优化;动作编码器和解码器仅充当连接共享 DiT 模型的具身专用接口。基于事件的预训练采用 768 的批次大小(batch size)和 5 X 10{-4} 的学习率;后续训练阶段则采用 128 的批次大小和 6 X 10{-5} 的学习率,共进行 50,000 步迭代。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐