26年7月来自中山大学、鹏程实验室、中科院深圳研究院和拓元智慧公司的论文“BRIDGE-WA: Predicting Where and How the World Changes for Robotic Action”。

通用视觉-语言-动作(VLA)模型受益于大规模视觉-语言先验知识,但有效的操作还需要预判与动作相关的场景变化。现有的世界-动作模型往往依赖于大型生成式世界模型或密集的未来状态推演,这些方法不仅计算成本高昂,而且将模型容量浪费在与控制关联度较低的视觉细节上。BRIDGE-WA,是一个轻量级的世界-动作框架;该框架将一个冻结参数的“未来变化教师模型”提炼为三种紧凑的先验信息:代表预期结果的“未来 tokens“、支持干预操作的“变化图(change maps)”以及指示局部转换方向的“运动流图(motion-flow maps)”。BRIDGE-WA 引入一个 WORLDBRIDGE 模块,通过多源注意记忆机制和时空偏置,将动作 Transformer 模型的输出建立在这些先验信息之上,同时在推理阶段移除教师模型。在 VLABench、RoboTwin2.0、LIBERO-Plus 及真实机器人实验中的评估结果表明,BRIDGE-WA 提升任务成功率、完成进度及系统鲁棒性,特别是在面对分布外(OOD)视觉变化时,性能提升尤为显著。通过将动作生成聚焦于场景变化的部位与方式,BRIDGE-WA 抑制背景、光照及干扰物等无关外观因素的干扰,从而在无需部署时生成密集未来图像的情况下,实现了更好的泛化能力。


如图1所示,BRIDGE-WA 将训练阶段的“世界先验”(world-prior)获取过程与部署阶段的动作生成过程分离开来。一个处于冻结状态的“未来变化教师模型”(future-change teacher)负责生成三个缓存的监督目标:代表预期结果的未来 Token、用于支持干预的变化图(change maps),以及表征局部运动的运动流图(motion-flow maps)。一个轻量级预测器负责学习如何根据当前的机器人上下文信息恢复这些先验信息,随后 WORLDBRIDGE 将预测出的先验信息作为记忆 Token 和注意引导信号注入到动作 Transformer 中。在推理阶段,教师模型和离线缓存均被移除;策略模型仅运行预测器以及以世界先验为条件的动作 Transformer。
请添加图片描述

1 问题表述与设计原则

研究基于多视角 RGB 观测、本体感知和语言指令的语言条件化操作任务。直接的 VLA模型学习映射 π_θ(a_t:t+H−1 | x_t),而 BRIDGE-WA 则转而预测一种紧凑的世界先验(world prior)。

其设计原则是用足以支持动作执行的世界变化摘要——即结果(outcome)、干预支持(intervention support)和局部运动(local motion)——来替代密集的未来图像预测。这种方法既保留对控制有用的预测信息,又过滤掉背景、光照及其他无关的外观干扰因素。

2 世界先验的蒸馏与预测

在训练过程中,一个冻结参数的“世界教师”模型 W_ψ 为 BRIDGE-WA 定义预测监督空间。W_ψ 并非现成的视频生成器:如下图 2(I) 所示,基于 Wan2.2-5B 生成式主干网络构建一个以机器人状态为条件的“世界模型”,使其预测目标与操作引发的场景变化相一致。在进行 Bridge-WA 蒸馏之前,W_ψ 先在 BridgeData V2 [50] 的真实机器人操作轨迹上进行预训练,学习将当前图像、语言和机器人状态映射到未来的观测结构;该阶段独立于动作策略参数。预训练完成后,W_ψ 的参数被冻结,仅用于构建下游缓存。
请添加图片描述

给定当前观测、语言和机器人状态,W_ψ 提供三个监督目标:T⋆_f(预测未来的紧摘要)、M⋆_c(软干预支持图,用于衡量未来场景与当前场景的差异区域)以及 M⋆_o(运动场,描述变化区域如何向未来状态移动)。这些目标可从 W_ψ 的潜表示(latents)、解码后的未来图像或导出的对应关系中提取,并存储为离线缓存。实际部署的组件是一个轻量级预测器 g_φ,它根据当前图像、本体感知和指令推断出 Zˆ_t = (Tˆ_f,t, Mˆ_c,t, Mˆ_o,t)。该预测器采用结构化蒸馏目标进行训练:针对未来 token 的潜回归与余弦相似度对齐,针对变化图的空间一致性,以及针对运动流的向量场一致性。因此,策略训练过程不会通过 W_psi 进行反向传播,也不需要反复解码未来的推演序列;在部署阶段,只需提取对动作决策有用的世界状态摘要,而无需生成逼真的未来图像。

3 基于世界状态条件的动作学习与部署

如上图 2(II) 所示,预测的先验信息通过 WORLDBRIDGE 层为动作 Transformer 提供条件输入。WORLDBRIDGE 将未来 Token、变化图(change maps)和运动流图(motion-flow maps)转换为策略可读取的条件记忆:未来 Token 提供全局结果上下文,变化 Token 标识干预的空间范围,而流 Token 则编码定向运动信息。查询(Query)操作保持以策略为中心,使动作 Transformer 能够决定从各个先验源读取信息的权重。此外,变化图和流图还能引导注意力机制关注可能发生变化或具有运动一致性的区域,且无需进行未来像素的重建。

该条件化方案采用分层而非均匀的方式。该方案遵循由粗-到-精的顺序:未来条件化作为任务层面的结果先验被优先使用;变化条件化将预期的交互与场景区域联系起来;而流条件化则被路由到更接近动作解码的位置,因为局部位移在此最为有效。

在激活层,非激活的先验信息将从投影条件化路径和调制路径中移除。这种渐进式接口在保持策略自注意流(stream)完整性的同时,以相容的抽象层级呈现结果、变化及运动信息。

训练过程结合动作模仿与世界先验(world-prior)蒸馏。动作模块可采用流(flow)、扩散(diffusion)、确定性或自回归形式的动作头;BRIDGE-WA 仅要求动作 Transformer 基于预测的世界先验摘要进行条件化生成。在推理阶段,教师模型和离线缓存被移除,仅保留轻量级的世界先验预测,随后进行基于世界先验条件约束的动作生成。


仿真实验设置。在三个评估目标互补的仿真基准上评估 BRIDGE-WA。所有策略均使用 RGB 观测、机器人状态和语言指令作为输入,并输出连续的动作片段(action chunks)。VLABench [51] 被用作主要的长期操作(long-horizo​​n manipulation)基准:采用其包含前视、侧视(secondary)和腕部观测的多视角设置,在五个任务轨道上进行训练与评估,并报告成功率(SR)、意图得分(IS)和进度得分(PS)。RoboTwin 2.0 [52] 用于评估域随机化(domain-randomized)场景下的双臂操作;遵循其官方的“简单/困难”(Easy/Hard)评估协议。LIBERO-Plus [53] 基于 LIBERO [54] 构建,用作零样本(zero-shot)鲁棒性基准:基础的语言条件操作任务保持不变,而评估分布则在摄像机视角、机器人初始状态、语言指令、光照、背景、图像噪声和物体布局等方面进行独立扰动。所有方法均在未针对 LIBERO-Plus 数据进行训练的情况下进行评估。

真实机器人实验设置。在 DoBot Nova2 平台上进行评估,该平台配备 Intel RealSense D455 第三视角摄像机和 D405 腕部摄像机。演示数据以 LeRobot 格式存储,包含同步的第三视角/腕部 RGB 图像、笛卡尔空间机器人状态以及绝对笛卡尔动作,其中 RGB 图像统一调整为 640 × 480 分辨率。该任务集包含五项任务:PickGrape(摘葡萄)、StackBowls(叠碗)、PushButtons(按按钮)、CollectFruits(收集水果)和 PutItemInDrawer(将物品放入抽屉),每项任务包含 50 个训练演示。简单评估(Easy evaluation)针对每项任务进行 10 次接近分布内(near in-distribution)的试验;困难评估(Hard evaluation)针对每项任务进行 15 次试验,涵盖桌布变化、干扰物和光照变化,每个因素各 5 次试验。所有方法均使用相同的初始状态、语言指令和成功判定标准。

概述。在两个单臂机器人平台(Dobot Nova2 和 Franka FR3)上评估BRIDGE-WA 的真实机器人任务执行能力及分布外(OOD)泛化能力。这两个平台均采用 LeRobot 格式的数据,包含同步的第三人称视角 RGB 图像、腕部 RGB 图像、笛卡尔坐标系下的机器人状态、笛卡尔坐标系下的末端执行器动作、时间戳以及任务指令。动作/状态向量为七维,表示为 [x, y, z, roll, pitch, yaw, g],其中 g ∈ [0, 1] 代表夹爪控制指令。演示数据的采集频率为 30 Hz。Dobot 平台配置使用 Intel RealSense D455 作为第三人称视角相机,Intel RealSense D405 作为腕部相机,两种视角的视频分辨率均为 480 × 480。Franka 平台配置使用 ORBBEC Femto Bolt 作为第三人称视角相机(分辨率 720 × 720),Intel RealSense D405 作为腕部相机(分辨率 480 × 480)。在训练阶段,图像会被调整为策略所需的输入分辨率,且不同机器人平台均采用相同的动作分块(action-chunk)接口。每次执行任务前,机器人都会重置到固定的初始位姿(home pose)。物体位姿在特定任务区域内随机采样,同时确保物体处于可触及范围内并避免初始碰撞。该数据集包含每个任务 50 条演示数据。如图 5 所示:
请添加图片描述


训练方案

训练过程包含两个阶段。首先,通过一个两步走的教师模型训练流程来构建“未来变化预测教师模型”(future-change teacher)。该教师模型基于 Wan2.2-TI2V-5B 初始化,首先在 BridgeData V2 机器人轨迹数据上进行预训练,以学习如何根据当前的图像、语言和机器人状态,推断由操作行为引发的未来观测结构。随后,在构建缓存之前,在目标基准测试集或真实机器人数据集上对该教师模型进行后训练(即微调),使其未来预测结果与下游策略所采用的具身形态、相机布局及任务分布相匹配。在针对目标数据集的后训练阶段,模型从 BridgeData 预训练的检查点(checkpoint)继续训练,且仅更新 5B 参数规模的 DiT 主干网络;Wan VAE、文本编码器及其他非 DiT 组件均保持冻结状态。在这两个训练阶段之间,利用冻结的教师模型处理各个下游训练集,以构建“世界先验缓存”(world-prior cache)。该过程利用下游数据集的元数据、任务相机顺序、未来视角选择、动作模式、动作时域(action horizo​​n)以及教师模型的未来时间偏移量等参数。其次,采用模仿学习结合世界先验蒸馏的方法来训练策略模型。其中,动作时域设定为 30,这与缓存生成阶段设定的动作数量(num actions=30)保持一致。

基线模型

OpenVLA [9] 是一种开源的视觉-语言-动作(VLA)模型,利用大规模预训练的视觉-语言先验知识,将 RGB 观测和语言指令映射为机器人动作。π0 [11] 是一种用于通用机器人控制的视觉-语言-动作流模型,而 π0.5 [39] 则属于同一系列,旨在实现更广泛的开放世界泛化能力。π_fast [55] 采用了高效的动作token化(action tokenization)技术;鉴于动作表征对长时程操作任务的性能有显著影响,在 VLABench 上评估该模型的“相对分块”(relative-chunk)和“增量分块”(delta-chunk)两种变体。X-VLA [35] 是一种基于软提示(soft-prompted)Transformer 架构的可扩展跨具身(cross-embodiment)VLA 模型。ACoT-VLA [56] 在 VLA 训练过程中引入动作思维链(action chain-of-thought)式的监督机制。ACT [14]、Diffusion Policy (DP) [15] 和 DP3 [63] 属于非 VLA 类的模仿学习控制器,它们分别对时间上连贯的动作分块、去噪扩散动作序列以及基于紧凑 3D 表征的扩散策略进行建模。RDT [64]、Vidar [65] 和 SeedPolicy [66] 为大型扩散 Transformer、基于视频扩散的通用操作模型以及具备长时程扩展能力且可自我进化的扩散策略提供强有力的近期参考。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐