GigaWorld-Policy-0.5:由 AutoResearch 赋能、更快更强的 WAM
26年7月来自的极佳科技和清华的论文“GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch”。
世界动作模型(WAMs)通过联合建模动作与未来视觉观测,利用场景的未来演变作为密集监督信号,从而生成符合物理规律的动作,进而提升机器人策略学习的效果。然而,现有 WAMs 的一种常见设计是在推理阶段显式生成未来视频,这不仅带来了巨大的计算开销,还阻碍了实时闭环部署。GigaWorld-Policy 提出一种以动作为核心的建模范式来解决这一问题:在训练阶段利用未来视觉动态信息,而在推理阶段仅进行动作解码。在此框架基础上,推出 GigaWorld-Policy-0.5,一种旨在实现更高效机器人控制的增强型动作中心化 WAM。在预训练阶段,GigaWorld-Policy-0.5 采用了“动作-条件世界建模(AC-WM)”与 WAM 相结合的混合训练策略。这种策略增强了视觉动态与机器人动作之间的耦合,并提升了动作表征在下游策略学习中的迁移能力。为了实现高效推理,GigaWorld-Policy-0.5 引入了Transformer 混合架构(Mixture-of-Transformers),将视觉动态建模与动作生成任务分配给专门的专家模块处理;这降低了仅执行动作推理时的计算负载,并在本地 RTX 4090 平台上实现了 85 毫秒的推理延迟。此外,利用基于智体(agent-based)的 AutoResearch 流程系统地搜索训练配置,从而更高效地确定最佳实验设置,并减少超参数调优所需的时间与人工干预。
1. GigaWorld-Policy-0.5 概览
GigaWorld-Policy-0.5 的整体框架如图 2 所示。它沿用 GigaWorld-Policy [55] 中提出的以动作为中心的世界动作模型(action-centered world action model)的表述方式。在此以动作为中心的设定下,策略预测问题就是:给定当前的“左、前、右”多视角观测 {o{left}_t, o{front}_t, o{right}_t、本体感知状态 s_t 以及语言指令 l,模型联合预测长度为 p 的动作片段 {a}t:t+p-1 以及未来的视觉观测 o {t+Delta:t+KDelta}{comp},其中Delta 表示未来视觉预测的时间步长(temporal stride),K = 【p/Delta】 表示在动作时域(action horizon)内预测的未来观测数量。

复合观测 o{comp}通过拼接左、前、右摄像头的视角图像构建而成。值得注意的是,GigaWorld-Policy-0.5 采用与 Motus [4] 类似的多视图组合策略:将前视图置于上方,并将左视图与右视图在下方一行进行拼接,从而构成用于视觉编码的统一图像输入。
为了更好地将世界模型先验知识迁移到策略学习中,GigaWorld-Policy-0.5 采用了与 GigaWorld-Policy [55] 相同的因果掩码(causal masking)策略。具体而言,该策略允许未来的视觉 Token 关注(attend to)动作 Token,同时禁止动作 Token 关注未来的视觉 Token。这种设计具有两大优势。首先,在训练过程中,因果注意力模式使得未来视觉预测隐式地依赖于动作 Token,从而促使模型学习出与世界模型先验及预期场景演变相一致的动作表征。其次,在推理阶段,未来视觉预测是可选的;当需要低延迟控制时,模型可以跳过大量的未来视觉 Token,直接解码动作 Token。
GigaWorld-Policy-0.5 采用流匹配(flow matching)框架 [13, 23] 进行优化。针对动作 Token 和未来视觉 Token,分别采样具有不同流偏移因子(flow-shift factors)的模态特定流时间步(flow timesteps)。随后,针对动作和未来视觉模态构建一个联合时间步向量。带有噪声的联合 Token 通过在噪声与数据之间对各模态进行线性插值而构建。
2. 模型架构
上图 2 展示 GigaWorld-Policy-0.5 基于 MoT 的架构。该模型以视觉观测、本体感觉状态、动作块和语言指令作为输入。对于视觉输入,用 Wan [41] 的视觉 VAE 将复合观测 o^comp 编码为视觉潜tokens。对于非视觉输入,机器人状态和动作块通过多层感知器 (MLP) 映射到视觉隐维度,生成状态token和动作token。语言指令由 umT5 [10] 编码,其文本嵌入用作指令跟踪控制的条件信号。基于这些tokens,GigaWorld-Policy-0.5 遵循以动作为中心的世界动作框架,但用 MoT 结构替换完全共享的 Transformer 主干架构。 MoT架构将以动作为中心的WAM模型的两个核心建模组件——视觉动态建模和动作生成——分离为视觉专家和动作专家。视觉专家处理当前和未来的视觉tokens,并在潜视觉空间中对场景演化进行建模;而动作专家则专注于动作tokens去噪和动作块预测。每个专家都配备了各自的跨注意机制和前馈网络(FFN)模块,从而实现特定模态的语言条件化和非线性变换。这两个专家通过多模态自注意力机制连接,实现了视觉、状态和动作tokens之间的信息交换,同时保持统一的token序列以进行联合世界动作建模。
具体而言,多模态自注意模块遵循GigaWorld-Policy[55]的思路,采用以动作为中心的因果掩码来调节跨模态信息流。具体来说,动作tokens可以关注当前的视觉token、状态token和语言条件化,但不能关注未来的视觉token。另一方面,未来的视觉token可以关注当前上下文和动作token,从而实现基于动作的未来视觉预测。这种因果注意掩码机制可以防止未来观测信息泄露到动作预测中,同时允许未来的视觉动态在训练阶段提供密集的监督信息。在推理阶段,未来的视觉token可以被忽略,模型直接解码动作token以实现低延迟控制。
对于参数初始化,GigaWorld-Policy-0.5 使用来自 GigaWorld-1 [39] 的预训练视觉权重来初始化视觉专家。GigaWorld-1 是一个大规模的预训练世界模型。这为视觉专家提供一个用于视觉动态建模的世界模型先验,使模型能够在适应机器人特定的观测和交互之前,继承关于场景演化的通用知识。
对于新引入的动作专家,用相应的视觉专家权重来初始化其参数。对于维度不一致的参数,通过取对应视觉专家权重的前 n 个维度来初始化动作专家参数,其中 n 表示动作专家参数的目标维度。
3 训练流程
GigaWorld-Policy-0.5 的训练流程包含两个阶段:机器人数据预训练和目标机器人后训练。在这两个阶段之前,用 GigaWorld-1 [39] 对视觉专家进行初始化,GigaWorld-1 已在超过一万小时的视频数据上进行了预训练。此初始化为 GigaWorld-Policy-0.5 提供了一个用于视觉动力学建模的通用世界模型先验。
在预训练阶段,用 2000 小时的过滤后的开源机器人数据 [7, 26, 35, 49] 和内部收集的真实机器人数据来训练 GigaWorld-Policy-0.5。此阶段将预训练的世界模型调整为以机器人为中心的场景,包括机器人本体、操作工作空间、相机视角和交互模式。该模型学习在与机器人相关的观察和动作下预测未来的视觉演变,从而在目标领域专业化之前更好地与机器人控制设置保持一致。值得注意的是,为了更好地建模动作和视觉动态之间的关系,还在此阶段加入基于动作的世界模型训练,即在与机器人相关的观察和动作下预测未来的视觉演变。这有助于模型在目标领域专业化之前学习机器人动作如何影响场景变化。
在训练后阶段,GigaWorld-Policy-0.5 模型在包含对齐的观察、语言指令、机器人状态和动作序列的目标真实机器人轨迹上进行训练。该模型在以动作为中心的因果结构下联合优化动作预测和未来视觉动态建模。动作目标教会模型生成指令条件动作块以进行闭环控制,而未来视觉目标提供辅助监督,鼓励动作表征保持连续性。
评估指标。主要报告成功率(SR)以评估任务完成表现。在真实世界实验中,在两种设置下评估基于夹爪的操作:文本指令遵循(text following)和长程任务执行(long-horizon task execution)。对于文本指令遵循,采用分级成功率(graded SR)以更准确地衡量任务的部分完成情况:每次试验的评分由四个权重相等的阶段构成(每阶段占0.25分),包括触达目标物体、抓取物体、移动至目标位置以及成功放置物体。对于长程任务,成功率遵循与仿真环境相同的二元定义:仅当完整任务序列完成时 SR 为 1,否则为 0。
基线方法。将 GigaWorld-Policy-0.5 与涵盖两大主要范式的几种代表性基线方法进行比较。在基于 VLM 的 VLA 方法中,纳入 𝜋0.5 [15],该方法利用大型视觉-语言骨干网络将视觉观测与语言指令对齐,并通过动作头(action head)解码底层控制动作。在基于 WAM 的方法中,纳入 Motus [4]、FastWAM [57] 和 GigaWorld-Policy [55],这些方法结合视觉动力学或世界建模目标以支持策略学习。
实现细节。用预训练的 GigaWorld-1 [39] 初始化视觉专家(visual expert),使模型能够继承强大的视觉生成表征。随后,通过复制相应权重,利用视觉专家初始化动作专家(action expert);对于维度不匹配的层,保留兼容的子矩阵,并截断其余部分以符合动作专家的配置。在实现中,视觉专家采用 3072 的隐层维度和 14336 的 FFN 维度,而动作专家则更为轻量化,采用 1024 的隐层维度和 4096 的 FFN 维度。关于动作块长度(action chunk length)和未来观测步长(future-observation stride),沿用 GigaWorld-Policy 中的设置。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)