26年9月来自港中文、港大和英国牛津大学的人类未来研究所(Future of Humanity Institute,FHI)的论文“WholeBodyWAM: Generalizing Pre-trained World–Action Priors to Humanoid Loco-Manipulation via WBC-Grounded Coordination”。

这篇论文 WholeBodyWAM 研究如何把预训练世界—动作模型(World Action Model,WAM)的操作能力,迁移到人形机器人的“移动—操作协同”任务。其核心观点是:已有模型具备较强的操作先验,关键是让这些先验能够指导底盘、腰部和腿部配合,而这需要有明确物理语义的控制接口和协调机制。

论文在仿真与真实机器人上取得了明显提升,但其证据主要支持“经过微调后的全身协调与跨控制器适配”,尚不足以证明任意控制器、任意机器人上的通用迁移。


1 研究问题与总体思路

如图 1 所示WholeBodyWAM 概览。与现有的通过扩展动作接口以实现全身适应或从零开始学习专用人形机器人“世界-动作”映射的方法不同,WholeBodyWAM 利用基于全身控制(WBC)的协调机制,保留并泛化了预训练 WAM 模型中的“世界-动作”先验知识,从而将其应用于人形机器人的移动-操作(loco-manipulation)任务。该模型结合语言指令、视觉历史和本体感觉信息,联合预测未来的视觉动态、操作意图以及统一全身控制器(UWBC)的指令。在六项仿真任务和八项现实世界任务中的评估结果显示,与基准方法相比,该模型实现了更高的整体任务成功率和更低的跨控制器性能方差,证明了其在多样化任务和异构 WBC 系统中实现高效移动-操作的能力。
请添加图片描述

桌面操作通常只需考虑手臂和物体之间的关系,人形机器人则需要同时决定:手往哪里伸、身体是否前移、腰部是否弯曲、腿部如何保持稳定。例如,从低处拿起箱子再放到桌上,单纯预测手臂动作无法完成任务。

作者认为,这里有三个主要困难:
协调复杂: 操作意图必须与全身运动在时间和空间上配合。
控制接口不统一: 不同全身控制器(WBC)可能分别接收关节目标、速度、身体高度或运动模式等指令。
人形机器人数据有限: 直接从头学习这些关系,需要较多全身操作示范。

WholeBodyWAM 对应提出三个设计:结构化动作分流、统一全身控制接口 UWBC、协调感知注意力 CASA。

2 方法如何工作

如图2 所示模型架构。左图:一个共享的扩散 Transformer(Diffusion Transformer)根据视觉历史和任务上下文构建的结构化 Token 序列,联合生成未来的视觉动态、操作动作及 UWBC 指令。右图:CASA 模块根据手臂在任务方向上的可操作性(manipulability)变化,自适应地增强从操作到 UWBC 的注意力权重,从而使操作意图能够引导全身协调动作。
请添加图片描述

模型接收语言指令、历史多视角图像和当前机器人状态,在同一个扩散 Transformer 中联合生成三类输出:
请添加图片描述

这里是联合生成,不是先生成一段视频、再根据视频规划动作。论文中的概率分解描述依赖关系,不代表串行执行流程。

第一个设计是结构化动作分解(SAF)。作者保留预训练 WAM 的视觉—操作通路,并增加独立的全身控制流。两类动作能够通过共享主干交换信息,同时保持各自可区分的语义。这样,模型可以利用原有抓取和操作知识,重点学习人形机器人执行这些操作时所需的身体配合。

第二个设计是 UWBC:统一指令含义。它定义一个 56 维控制向量:
16 维任务空间指令,如身体线速度、角速度、朝向、骨盆位置和高度、躯干姿态。
30 维下肢与腰部关节位置、速度。
10 维控制器专用扩展槽,如离散控制模式。

具体控制器只启用自己支持的字段,其余字段被屏蔽。UWBC 的价值在于让相同字段具有一致物理含义,减少不同接口之间的语义混淆。不过,它仍需要针对控制器登记字段和建立映射,也不直接取代底层全身控制器。

第三个设计是 CASA:根据手臂能力调整信息交互。这是论文最有辨识度的机制。

作者从连续观测的末端位置估计手臂运动方向,再结合当前关节状态,计算手臂沿该方向的可操作能力。如果某只手臂沿当前方向的运动能力相对较低,就提高协调门控值 g_t,增强全身控制流对操作流的注意力:
请添加图片描述

最后一项仅作用于同一预测块中的“全身控制查询—操作键”位置。直观地说,当手臂自身越来越难完成动作时,让身体控制更多参考手臂的操作需求。

需要注意,CASA 只改变模型内部的信息权重,并不直接计算“向前走多少”或保证动作稳定;具体全身动作仍由学习到的模型产生。

训练方面,作者基于一个 14B 预训练 WAM,使用约 1.5 万条全身操作示范进行后训练。示范通过人体运动表示和动作重定向转换为 G1 机器人参考运动,再生成 UWBC 监督信号。模型使用 LoRA 训练,推理采用 16 步去噪。

3 创新点

主要有三点。

首先,论文提出了较清晰的先验复用方式:保留操作通路,把新增学习任务集中在全身控制语义和协调关系上。它的贡献主要是架构与迁移方式,而非新的基础生成模型。

其次,UWBC 将控制接口的物理语义显式化。对于具有异构控制器的机器人系统,这种设计比简单拼接动作维度更容易组织监督和迁移知识。不过,其统一性目前是在固定字段和已评估控制器范围内成立。

最后,CASA 把机器人运动学知识引入注意力机制,使跨动作流的信息交互随身体状态变化。这比完全依赖有限示范去隐式学习“何时需要全身配合”更有针对性。

这三点组成了一个连贯设计:先保留操作知识,再统一执行语义,最后根据身体能力调节协调强度。

如图3 所示具有门控协调机制的分块因果注意力(Blockwise-Causal Attention)。该机制在视觉、操作和 UWBC 数据流之间保留原生的自注意力可见性,同时利用门控协调偏置(gated coordination bias)在每个预测块内有选择地增强从操作到 UWBC 的注意力。
请添加图片描述

4 实验部分

论文评估了六项仿真任务,以及 G1 机器人上的八项真实任务,包括搬运、倒水、开门、推车和清理桌面。
请添加图片描述

其中,DreamZero-PT 使用了与本文相同的后训练数据,因此比原始 DreamZero 更有助于判断结构设计的作用。WholeBodyWAM 对它仍有 18.3 个百分点的仿真优势,说明增益不能仅归因于增加训练数据。

消融实验也支持三个模块的作用:
请添加图片描述

从这些结果看,保留独立操作与全身控制通路的结构设计贡献尤其明显。但这不是严格的独立贡献分解,三个模块之间可能存在交互,下降幅度不能简单相加。

论文还展示了一个恢复案例:毛巾支撑物外移 10 厘米后,机器人首次抓取失败,随后通过前移和转身重新抓取成功。作者称该恢复序列未出现在示范中。它是有价值的定性观察,但单个案例还不足以证明普遍的自主恢复能力。

5 主要问题与证据边界

以下基于方法和实验设计分析得到:

1 跨控制器适配还不等于零样本泛化。
SONIC、AMO 和 GEAR WBC 的评估均进行了各自的任务微调。结果说明这种表示有利于适配不同接口,但没有证明同一个模型可以直接切换到未见过的控制器。三个控制器上的低方差,也不能外推为对任意控制器都稳健。

2 CASA 的触发信号只覆盖部分协调需求。
它主要衡量手臂沿当前运动方向的运动学能力,不能完整反映接触力、负载、平衡、碰撞和地面摩擦。实际运动方向也可能不同于期望方向,尤其是在动作受阻或尚未启动时。论文公式对近零末端速度时如何估计方向,也缺少明确说明。

3 UWBC 的跨形态能力尚未证明。
固定的下肢与腰部关节槽位仍具有身体结构依赖。真实实验只在 G1 上完成,因此目前证据更接近“同一机器人上的多控制器适配”,而不是跨
机器人形态的统一表示。

4 真实实验的强基线比较不足。
仿真包含多种模型,但真实实验只与 DreamZero 对比,没有加入同数据后训练的 DreamZero-PT 或仿真中更强的 Cosmos-3。因此,真实环境增益中,额外数据与结构设计各占多少,还需要更严格对照。

5 统计与泛化范围仍有限。
每个方法—任务组合采用 20 次独立试验,单个任务的成功率粒度为 5 个百分点。文中缺少清晰的置信区间和多训练种子结果。OOD 主要涉及物体配置与语言变化,尚不足以覆盖新环境、新身体参数、复杂接触和大幅动力学变化。

6 世界模型的必要性和部署成本尚不清楚。
论文没有通过移除未来视觉预测的消融,单独确认该分支的贡献。14B 模型与 16 步去噪的实际延迟、控制更新频率、部署硬件及计算成本也未充分报告,因此难以判断其在动态任务中的实时性。

此外,“保留预训练先验”主要得到架构设计和任务表现的间接支持;若要更严格证明,还应测试适配前后的原始操作能力是否保留。

6 未来工作的方向

请添加图片描述

如果以继续开展研究为目标,优先做两项:未见控制器的留出测试,以及CASA 与固定门控、可学习门控、期望方向门控之间的对比。前者能检验论文最重要的迁移主张,后者能检验运动学门控是否确实提供了不可替代的价值。
逐式讲解方法
设计后续研究实验
整理组会汇报稿

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐