单阶段统一运动模仿 RL 框架,仿真训练直接零样本部署真机 Atlas / Unitree G1 / Spot

——跨机复刻复杂运动

目录

01    ZEST核心整套技术管线拆解

异构运动素材统一重定向管线

极简PPO强化学习训练核心设计

跨形态零样本硬件部署

02    实验结果

三类机器人多动作跟踪指标

ZEST vs 传统MPC模型控制仿真对标

03    工程落地价值与后续研究方向

落地应用场景

未来拓展路线

04    总结


波士顿动力与RAI研究所联合推出ZEST框架,仅单阶段强化学习训练,无需接触标签、大量奖励手工设计,仅凭动作捕捉、普通手机视频、动画三类原始数据,就能零样本部署Atlas人形、宇树G1人形、Spot四足三类完全不同构型机器人

在全尺寸Atlas实现匍匐、霹雳舞等多接触全身动态动作,同时完成视频直接驱动人形爬箱、四足连续后空翻等跨形态任务,大幅降低机器人动态运动开发门槛。

01    ZEST核心整套技术管线拆解

整套框架分为三大完整链路:多源运动预处理、自适应强化学习训练、硬件零样本部署,全程无多阶段分步训练,不依赖接触标注、长观测窗口、复杂手工奖励。

▲ZEST完整框架流程图

异构运动素材统一重定向管线

ZEST支持三类完全不同的原始运动数据,统一做运动学重定向适配机器人骨骼,全程无需物理预优化修正:

  • 动作捕捉(MoCap)

Vicon/Xsens采集高精度人体运动,仅轻微平滑,适配Atlas、G1人形,生成慢跑、侧手翻、匍匐、霹雳舞等多接触动作;

  • 普通手机视频(ViCap)

依靠MegaSaM+TRAM重建全局人体3D姿态,即便存在足部滑移、姿态抖动等视频伪影,模型也能自动过滤噪声,实现跳舞、爬箱子、踢球等场景交互动作;

  • 关键帧动画

生成人类生理无法完成的动作(Atlas背部连续旋转倒立、Spot连续后空翻、侧滚),专门适配四足无人体参考的运动场景。

重定向仅做骨骼对齐、尺度缩放、时间重采样保证弹道重力匹配,不会强行修正视频里的不真实运动,依靠训练阶段策略自适应降噪,省去大量人工修正工作量。

极简PPO强化学习训练核心设计

训练采用非对称Actor-Critic架构。

Actor仅搭载机器人机载可获取的本体感知(IMU角速度、重力、关节位置速度、上一帧动作),完全不使用全局位姿、外部感知,保证部署时不需要状态估计器;

Critic额外拥有仿真内特权信息(接触力、质心位置)加速收敛,硬件推理仅运行轻量化Actor前向网络。

(1)残差动作输出机制

策略不直接输出关节目标,仅输出修正残差:q_j^{cmd}=\hat{q}_j+\sum a_t\hat{q}_j 是参考运动关节位置,残差叠加后送入关节PD控制器。相比直接预测完整关节角度,残差输出大幅降低训练探索难度,初始阶段不会出现巨大跟踪误差,稳定性显著提升。

PD增益依靠机器人并联执行器(PLA)解析模型计算,论文提出三层递进近似模型平衡仿真速度与真实匹配度。

▲并联驱动执行器 (PLA) 三层递进简化动力学模型示意图

PLA是人形膝、踝核心传动结构,精确闭环动力学仿真算力开销极大,ZEST设计三层简化方案:

局部投影模型(支撑连杆无质量)、动态电枢对角近似、固定标称电枢模型。

最终部署选用固定标称模型,单次计算关节刚度,仿真速度提升20%,同时硬件PD控制器参数统一仿真、真机,大幅缩小虚实差距。

消融实验证明,忽略PLA模型训练出的策略在爬箱、侧手翻动作真机全部失效。

(2)自适应采样+辅助力矩自动课程(两大核心训练创新)

  • 自适应分块采样

所有长运动轨迹切分为固定时长片段,用EMA指数移动平均记录每段跟踪失败率,采样概率和失败率正相关,同时保留最低采样权重避免遗忘简单动作。

比如侧手翻、后空翻这类高难度片段会被高频采样,慢跑、深蹲简单动作采样减少,同等GPU时长下多接触高难度动作收敛速度提升一倍。

▲仿真环境下的性能评估

图中是训练中段自适应采样四大信号:辅助力矩缩放系数、分段失败率、片段访问次数、采样概率,难度越高的片段采样权重越大。

  • 模型基虚拟辅助力矩

针对大幅度旋转、倒立、空翻这类极易训练中途失败动作,在机器人基座施加虚拟辅助空间力矩,力矩强度随分段失败率自动衰减,跟踪精度达标后完全归零。

相当于仿真内给机器人动态“辅助支撑”,不用人工设计分阶段训练流程。消融实验显示移除辅助力矩后,高难度动作训练时长翻倍,20小时训练效果仅等于完整框架10小时水平。

(3)轻量化统一奖励函数

总奖励仅三部分,全程无动作专属定制项,完全不用针对匍匐、跳舞设计差异化权重:

r_{\mathrm{total}} = r_{\mathrm{track}} + r_{\mathrm{reg}} + r_{\mathrm{survival}}

跟踪奖励:指数衰减误差损失,柔和贴合参考运动,不会因为微小偏差直接大幅降分;

正则奖励:约束动作平滑、关节加速度、力矩/位置极限,抑制畸形剧烈运动;

生存奖励:每一步固定正向奖励,减少训练中途提前终止。

整套奖励不存在接触相关惩罚/激励,机器人自主学习何时用手、膝、躯干接触地面,不用人工标注任何接触时序。

(4)域随机化仿真训练

仿真训练加入随机外力冲击、摩擦系数浮动、机身质量扰动、观测高斯噪声,训练策略适应建模偏差,实现零样本直接部署真机,无需硬件微调。单政策训练仅需单块NVIDIA L4 GPU,耗时约10小时。

跨形态零样本硬件部署

训练完成策略导出ONNX格式,自动化管线同步映射Atlas、G1、Spot三类机器人执行器参数,同一套训练逻辑只替换机身动力学参数即可通用,无需改动网络结构。

▲ZEST 框架在多数据源、多机型机器人上的实体部署效果

硬件部署仅依靠本体IMU与关节编码器,无外部视觉、激光输入,爬箱子等交互任务仅靠本体感知完成:

机器人与箱子初始xy偏移±10cm、航向±0.3rad范围内全部成功;额外搭载2kg载荷、0.55~0.95m高度变化箱子仍能稳定攀爬。

02    实验结果

实验分为三类数据源验证、和MPC模型基线对标、仿真消融三部分。

三类机器人多动作跟踪指标

指标定义:MAE(q)关节角度平均误差、MAD®机身姿态角平均误差、ML2(ω)机身角速度误差。

▲分数据源各类运动任务硬件跟踪量化指标汇总表

仅足部接触简单动作(行走、踢球):误差极低,MAE(q普遍0.04~0.06rad,运动流畅无冲击;

多接触复杂动作(匍匐、霹雳舞、侧手翻):误差小幅上升,但真机仍稳定完成,误差来源是仿真与真实摩擦、接触形变不匹配,属于可接受虚实间隙;

Spot四足动画动作(连续后空翻):姿态误差明显增大,甚至出现IMU饱和(桶滚动作),但策略会自主放宽参考轨迹贴合物理极限,不会直接失控;

视频驱动G1爬箱:初始位置偏移、载荷变化场景误差小幅上涨,但五次重复测试全部稳定成功。

ZEST vs 传统MPC模型控制仿真对标

核心差距:

  1. 简单行走两类方案误差接近,MPC依靠精准预设接触时序表现略优;
  2. 动态慢跑、侧手翻ZEST姿态、关节误差全面更低,MPC因接触标注噪声出现跟踪漂移;
  3. 多接触动作(倒立、四肢爬行、霹雳舞)MPC直接执行失败(表格标注“—”),无法处理膝、躯干、手部复合接触,这是模型控制路线无法逾越的短板。

▲仿真环境下传统 MPC 控制器与 ZEST 多技能强化学习策略性能对比表

MPC必须提前指定所有支撑末端,超出手脚的身体接触场景完全失效,而ZEST无接触约束,天然适配全身多动态交互任务。

03    工程落地价值与后续研究方向

落地应用场景

  1. 人形机器人研发:快速开发舞蹈、体操、匍匐、搬运爬箱等全身交互动作,省去动捕与控制器定制成本;
  2. 四足机器人杂技、巡检动作开发:依靠动画生成无人类参考的空翻、滚转运动;
  3. 机器人初创企业轻量化开发管线:无需专业模型控制团队,仅依靠视频素材快速拓展动作库;
  4. 硬件迭代快速验证:更换机身、增减载荷无需重新设计控制算法,一套框架复用。

未来拓展路线

  1. 运动嵌入表征学习,实现未知动作少样本/零样本适配,摆脱预训练单动作策略;
  2. 接入视觉感知,融合地形、障碍物信息,实现非平整环境自主运动;
  3. 上层生成式规划对接,文字、稀疏关键帧直接生成参考运动,打通“指令-运动”全链路;
  4. 全自动机器人系统辨识流程,降低仿真建模人工成本。

04    总结

ZEST解决了足式机器人动态全身控制长期存在的两大痛点:多接触动作控制困难、运动开发与机型适配成本过高。通过单阶段无约束模仿强化学习、自适应训练机制、跨形态统一建模,实现多源运动素材直接迁移至人形、四足实体机器人,是目前通用性较强的全身动态模仿学习完整工程管线。

但该框架现阶段仍属于“运动复刻”控制方案,不具备自主环境感知与高层规划能力,更适合作为机器人底层运动执行底座,需要搭配上层感知、规划模块才能实现完整自主机器人系统。

对于需要快速迭代动作库、多机型同步开发的机器人企业,这套方案具备极高实用价值。

Ref

论文标题:ZEST: Zero-shot embodied skill transfer for athletic robot control

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐