arXiv|BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion【文献解读】
文献:BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion
作者:Qiayuan Liao, Takara E. Truong, Xiaoyu Huang, Yuman Gao, Guy Tevet, Koushil Sreenath, C. Karen Liu
单位:Stanford University、University of California, Berkeley 等
论文地址:https://arxiv.org/abs/2508.08241
项目主页:https://beyondmimic.github.io/
运动跟踪训练代码:https://github.com/HybridRobotics/whole_body_tracking
C++/ROS 2 部署代码:https://github.com/HybridRobotics/motion_tracking_controller
数据与补充材料:https://doi.org/10.5281/zenodo.17529720
主要实验平台:Unitree G1 双足人形机器人、Isaac Lab、RSL-RL、MuJoCo、ROS 2
摘要
BeyondMimic 面向双足人形机器人提出了一套由“可扩展运动跟踪”走向“通用任务控制”的完整技术路线。论文首先使用统一的马尔可夫决策过程、奖励函数、域随机化和 PPO 超参数,为大量人类参考动作分别训练高质量运动跟踪策略;随后通过条件 VAE 与 DAgger 将这些策略蒸馏到平滑的运动潜空间,再利用状态—潜变量联合扩散模型学习人形机器人可执行运动的概率分布。部署阶段不再为每个任务重新训练策略,而是把速度跟踪、航点导航、障碍规避、关键帧补全等目标写成可微代价,通过扩散模型的分类器引导在推理时在线优化,从已有运动先验中合成满足新任务的动作。
这项工作的关键意义并不只是让机器人“更像人地模仿动作”,而是把大规模动作模仿获得的技能库转换为一种可查询、可组合、可在测试阶段优化的运动先验。其核心范式可概括为:
人类动作数据→PPO运动跟踪策略→VAE潜在动作表示→状态—潜变量扩散模型→测试时引导与任务组合 \boxed{ \text{人类动作数据} \rightarrow \text{PPO运动跟踪策略} \rightarrow \text{VAE潜在动作表示} \rightarrow \text{状态—潜变量扩散模型} \rightarrow \text{测试时引导与任务组合} } 人类动作数据→PPO运动跟踪策略→VAE潜在动作表示→状态—潜变量扩散模型→测试时引导与任务组合
与 AMP 不同,BeyondMimic 的核心不是 GAN 式判别器,也不是通过对抗奖励判断动作“像不像专家”;其第一阶段采用显式参考运动跟踪,第二阶段采用 VAE、DAgger 和扩散模型,将动作模仿进一步扩展为零样本任务控制。
1. 研究背景与问题定义
1.1 双足人形机器人控制的三项核心要求
双足机器人要在真实环境中实现实用运动控制,通常同时面临三项要求:
- 敏捷性:能够完成快速跑动、跳跃、转体、侧踢、侧手翻、起身等高动态动作;
- 自然性:运动节奏、接触时序、躯干与四肢协调以及地面反作用力应接近人类,而不是僵硬的关节位置回放;
- 通用性:同一控制系统应支持速度命令、航点导航、动作切换、障碍规避和关键帧补全,而不是每增加一个任务都重新设计奖励和训练策略。
传统方法很难同时满足这三项要求。模型控制能够提供明确的动力学约束,但对于高自由度、强接触、快速切换的全身动作,接触模式设计和在线优化成本较高;任务型强化学习能够学习单项技能,但往往依赖大量奖励塑形;动作模仿能获得自然动作,却通常被固定参考轨迹束缚,难以根据新目标灵活组合。
1.2 论文解决的关键科学问题
BeyondMimic 试图回答以下问题:
如何把大量人类运动数据转化为双足人形机器人的可执行运动先验,并在不重新训练策略的情况下,通过简单任务代价在线合成未见过的控制行为?
该问题可进一步拆分为四个技术挑战。
挑战一:动作种类增加后,跟踪策略难以规模化训练
不同参考动作的速度、接触序列、姿态范围和动力学难度差异很大。传统 DeepMimic 式方法常针对动作单独调节奖励权重、PD 增益、初始化分布和终止条件,动作库越大,人工调参成本越高。
挑战二:高动态动作的 Sim2Real 对时延和动力学误差极其敏感
双足机器人在腾空、单脚支撑和快速落地时,数毫秒的控制延迟、执行器反射惯量误差或过高的关节刚度都可能导致过冲、抖动和摔倒。单纯扩大域随机化范围又容易使策略过于保守,损失自然性和敏捷性。
挑战三:动作跟踪策略无法直接完成新的任务目标
一个跟踪侧手翻的策略擅长复现侧手翻,一个跑步策略擅长跟踪跑步参考,但它们并不会自动解决“绕过障碍后再侧手翻”“走到航点后躺下并重新起身”等组合任务。若每个任务都重新训练高层策略,系统仍然缺乏通用性。
挑战四:原始关节动作不适合直接进行扩散建模
机器人动作常表示为 PD 位置设定值。受接触切换和反馈控制影响,这些动作可能出现尖峰和不规则变化。直接对高维、非平滑动作序列建模会增加扩散模型的学习难度,同时大型扩散网络的推理延迟也会使动作滞后于最新机器人状态。
2. 相关研究脉络
BeyondMimic 位于“动作模仿强化学习—通用人形控制—生成式运动控制”三条研究路线的交汇处。
| 方法类别 | 代表工作 | 核心机制 | 主要局限 |
|---|---|---|---|
| 参考运动跟踪 | DeepMimic | PPO/策略梯度直接最小化参考状态与机器人状态误差 | 常需针对不同动作调参;策略被参考轨迹约束 |
| 对抗模仿学习 | AMP | 判别器区分专家运动与策略运动,将判别输出转为风格奖励 | 通常仍需针对任务训练;不直接提供测试时任务组合 |
| 通用运动跟踪 | PHC、OmniH2O、ExBody、HumanPlus、TWIST、UniTracker | 使用统一策略跟踪大量全身动作或视觉/遥操作目标 | 重点多为跟踪或指令条件控制,任意新代价的零样本组合能力有限 |
| 生成式控制 | Diffusion Policy、DiffuseLoco、PDP、Diffuse-CLoC | 用扩散模型生成动作或轨迹 | 若直接生成低层动作,容易受延迟、动作非平滑和闭环误差影响 |
| BeyondMimic | 本文 | PPO 跟踪技能库 + VAE/DAgger 潜空间 + 状态—潜变量扩散 + 测试时引导 | 依赖可靠状态估计;预测时域较短;引导权重仍需调节 |
2.1 与 DeepMimic 的关系
DeepMimic 奠定了物理角色通过强化学习跟踪参考动作的基本范式:将姿态、速度、末端位置等跟踪误差转化为奖励,再利用策略优化获得可恢复的动作控制器。BeyondMimic 的第一阶段延续了这一思想,但重点不是提出新的 PPO,而是重新设计一套运动无关的观测、奖励、阻抗参数和采样机制,使同一训练配方能够覆盖大量动作。
2.2 与 AMP 的关系
AMP 使用对抗判别器学习运动风格奖励:专家数据是真样本,策略运动是假样本,PPO 根据判别器奖励更新策略。BeyondMimic 不使用这一判别器机制,其跟踪奖励来自明确的目标刚体位姿和速度误差。因此:
AMP核心=对抗判别器学习风格奖励 \text{AMP核心}=\text{对抗判别器学习风格奖励} AMP核心=对抗判别器学习风格奖励
BeyondMimic核心=显式运动跟踪+潜变量扩散+推理时梯度引导 \text{BeyondMimic核心}=\text{显式运动跟踪}+\text{潜变量扩散}+\text{推理时梯度引导} BeyondMimic核心=显式运动跟踪+潜变量扩散+推理时梯度引导
AMP 的优势是无需逐项设计姿态风格奖励;BeyondMimic 的优势是先获得高保真技能,再把技能分布用于未见任务的在线组合。二者都利用示范数据,但解决的问题层级不同。
2.3 与通用运动跟踪策略的关系
PHC、OmniH2O、HumanPlus 等工作推动了单策略跟踪大规模动作数据。BeyondMimic 第一阶段仍为不同动作或动作序列训练独立策略,但所有策略共享同一 MDP 和超参数,其“可扩展”强调的是一套配方适配所有动作,而不是第一阶段已经得到一个万能策略。真正的统一发生在第二阶段:多个跟踪教师被蒸馏到一个条件 VAE,并进一步形成统一的扩散运动先验。
2.4 与扩散策略的关系
普通扩散策略通常直接预测动作序列。BeyondMimic 认为双足低层 PD 动作包含尖峰,且大型扩散网络会引入不可忽略的时延,因此不直接扩散原始动作,而是扩散由 VAE 编码的平滑运动意图潜变量;最新本体观测则交给轻量解码器,在每个控制周期生成当前动作。这一拆分兼顾了生成模型的表达能力和低层闭环控制的实时性。
3. 总体框架

图1 BeyondMimic 通用人形控制框架总览(原论文 Figure 1)
图1给出了完整技术路线。左侧是可扩展运动跟踪:人类动作经重定向后,利用统一 PPO 训练配方得到大量可在实机运行的跟踪策略。右侧是引导扩散:教师策略被蒸馏成条件 VAE,VAE rollout 产生状态—潜变量轨迹,扩散模型学习这些轨迹的分布;部署时将新任务写成可微代价,通过梯度引导生成满足任务的未来轨迹。
整体分为两个阶段:
阶段一:可扩展的人类运动跟踪
Motion Data→Retargeting→PPO Motion Tracker→Sim2Real Skill Policies \text{Motion Data} \rightarrow \text{Retargeting} \rightarrow \text{PPO Motion Tracker} \rightarrow \text{Sim2Real Skill Policies} Motion Data→Retargeting→PPO Motion Tracker→Sim2Real Skill Policies
目标是获得大量高质量、可恢复、可部署的基础技能,覆盖行走、跑步、平衡、跳跃、侧手翻、舞蹈、格斗和起身等行为。
阶段二:基于引导扩散的通用控制
Tracking Teachers→DAgger + VAEMotion Latent Space→State–Latent Diffusion→GuidanceNew Tasks \text{Tracking Teachers} \xrightarrow{\text{DAgger + VAE}} \text{Motion Latent Space} \rightarrow \text{State--Latent Diffusion} \xrightarrow{\text{Guidance}} \text{New Tasks} Tracking TeachersDAgger + VAEMotion Latent Space→State–Latent DiffusionGuidanceNew Tasks
目标不是继续精确跟踪某条参考动作,而是学习“哪些状态变化和运动意图在人形机器人上可实现”,再根据测试时目标对这一分布进行优化。
4. 实验结果与能力验证
论文采用先展示结果、后给出方法的组织方式。以下按照原论文图片顺序分析图2至图6,以确保图号、图片顺序和正文引用保持一致。
4.1 大规模动作跟踪与实机迁移

图2 真实 Unitree G1 上的多样化运动跟踪结果(原论文 Figure 2)
论文在约 2.5 小时的人类动作数据上训练运动跟踪策略,并在高保真仿真中验证全部动作。为测试 Sim2Real,作者从中选择了 30 个代表性片段,实机动作总时长约 15 分钟。动作覆盖:
- 单腿站立、不同姿态起身等平衡动作;
- 单腿跳、转身踢、180°/360°转体跳、侧手翻等高动态动作;
- 老年步态、舞蹈和体育动作等具有明显风格的行为;
- 爬行、躺倒、起身等多接触动作。
值得注意的是,第一阶段并非只在数秒短片上训练。部分策略对应超过三分钟的动作序列,且包含多个技能。统一训练配方仍能保留动作的节奏和风格细节,说明自适应采样与相对跟踪目标能够缓解长序列中难片段被忽略的问题。
4.2 高动态敏捷性

图3 连续高动态动作中的人类水平敏捷性(原论文 Figure 3)
作者把机器人部署到训练时未出现的室外环境,包括松软土壤、落叶和不平地面。这类场景会改变足底接触刚度、摩擦和落脚稳定性。机器人仍完成了空中侧手翻、连续侧手翻和武术动作。
论文记录的代表性动力学指标为:
| 指标 | 结果 | 含义 |
|---|---|---|
| 峰值加速度 | 31 m/s² | 起跳、腾空和落地阶段具有较强爆发性 |
| 骨盆角速度峰值 | 20 rad/s | 能完成快速空中转体 |
| 腾空阶段平均角速度 | 7.01 rad/s | 与论文引用的熟练人类空中动作均值 7.75 rad/s 接近 |
| 连续动作 | 连续侧手翻、连续庆祝跳转 | 反映落地状态控制与动作循环稳定性 |
这些结果表明策略并非简单依赖僵硬位置伺服完成“动画回放”。在较低且物理合理的阻抗参数下,机器人仍能利用动力学产生爆发动作,并通过闭环反馈修正落地误差。
4.3 自然性与生物力学特征

图4 行走与跑步中的自然性、地面反作用力及扰动恢复(原论文 Figure 4)
论文从生物力学和主观感知两个角度评估动作自然性。
地面反作用力对比
作者使用测力跑台比较人和机器人的地面反作用力,并按体重归一化。机器人行走时呈现类似人类的双峰结构:
- 第一个峰值对应脚跟着地和承重;
- 第二个峰值对应支撑末期的推进;
- 跑步时呈现单峰,接触周期更短。
机器人行走峰值更尖锐,作者认为主要原因是 Unitree G1 缺少脚趾关节,难以形成足底滚动和柔顺蹬地。这一现象也说明“视觉上像人”并不等同于生物力学完全一致,硬件形态仍决定了动作上限。
用户研究
用户研究共有 77 名参与者,观看 20 对、每段 5 秒的行走与跑步视频,在 BeyondMimic 与 Unitree 原生控制器之间选择更自然的一项。结果如下:
| 对比项目 | BeyondMimic | Unitree 原生控制器 | 统计结果 |
|---|---|---|---|
| 总体偏好 | 70.8% | 29.2% | p<0.001p<0.001p<0.001 |
| 行走 | 57.0% | 43.0% | p<0.001p<0.001p<0.001 |
| 跑步 | 84.7% | 15.3% | p<0.001p<0.001p<0.001 |
跑步偏好差异明显大于行走,说明运动数据先验在高速全身协调中更容易体现优势。论文还展示了柔顺扰动恢复:机器人行走时被轻推或短暂阻挡,会暂停并保持稳定,外力解除后平滑恢复,而不是以高刚度强行追赶参考相位。
4.4 零样本指令运动

图5 基于引导扩散的速度控制、航点导航与步态切换(原论文 Figure 5)
图5展示了扩散控制器如何根据速度或航点代价,在没有为任务重新训练策略的情况下生成运动。
航点导航
给定目标位置,代价函数推动预测根节点位置接近航点,并在接近目标时降低速度。扩散模型不需要显式指定“应当使用哪段走路动作”,而是在运动先验中选择能完成位移目标且保持人形自然性的轨迹。
摇杆速度控制
给定期望线速度和偏航角速度,模型通过引导调整未来状态序列,实现前后、横向和转向运动。论文报告仿真平均速度跟踪误差为:
Walking Error=12.14%,Running Error=13.65%. \text{Walking Error}=12.14\%,\qquad \text{Running Error}=13.65\%. Walking Error=12.14%,Running Error=13.65%.
机器人在实机上连续跑动超过 50 m,并能在受到踢击等扰动后继续执行速度命令。
多模态步态与步行—跑步过渡
相似的低速命令可能对应行走或轻跑等不同合理解,说明模型没有把命令映射成唯一动作模板。随着速度目标提高,模型能从步行平滑切换到跑步,而训练数据中这类过渡样本稀少且没有专门标签。这是生成式运动先验相对于离散技能选择器的重要优势:动作之间的连接由轨迹分布与任务代价共同产生。
4.5 动作补全、技能切换与任务组合

图6 稀疏关键帧补全、长时技能组合与障碍规避(原论文 Figure 6)
图6展示了 BeyondMimic 从“跟踪参考动作”向“合成任务行为”的关键跨越。
关键帧补全
作者每隔 0.2 s 给出侧手翻关键帧,扩散模型补全关键帧之间的连续状态和潜变量,使机器人从行走平滑进入侧手翻,完成后再回到指令行走。这里并没有输入完整关节轨迹,模型必须同时完成:
- 关键帧之间的时间插值;
- 起始状态与目标动作之间的动态过渡;
- 接触序列和落地姿态生成;
- 动作结束后的稳定恢复。
长时技能串联
论文展示了行走、跑步与连续三个侧手翻的组合。扩散模型每次只优化有限预测时域,但通过滚动执行和历史条件持续生成,从而形成更长的任务序列。
障碍规避与目标组合
作者把航点代价与基于有符号距离场的障碍代价相加,机器人即可在前往目标的同时绕开障碍;同样,摇杆速度目标也能与避障代价组合。其本质是:
Gtotal(τ)=wgoalGgoal(τ)+wvelGvel(τ)+wobsGobs(τ)+wkeyGkey(τ). G_{\text{total}}(\tau) =w_{\text{goal}}G_{\text{goal}}(\tau) +w_{\text{vel}}G_{\text{vel}}(\tau) +w_{\text{obs}}G_{\text{obs}}(\tau) +w_{\text{key}}G_{\text{key}}(\tau). Gtotal(τ)=wgoalGgoal(τ)+wvelGvel(τ)+wobsGobs(τ)+wkeyGkey(τ).
只要各项目标对预测轨迹可微,就能在推理时组合,而不必重新收集数据或训练策略。
5. 方法原理

图7 可扩展运动跟踪、VAE 蒸馏与状态—潜变量扩散的完整方法(原论文 Figure 7)
图7是论文方法部分的核心。左侧描述第一阶段 PPO 运动跟踪,右侧描述第二阶段条件 VAE、DAgger、扩散训练及推理时引导。
5.1 第一阶段:基于 PPO 的可扩展运动跟踪
5.1.1 参考运动与目标刚体集合
参考动作表示为广义位置和广义速度:
qref=(pref,Rref,θref), \mathbf q^{\mathrm{ref}} =(\mathbf p^{\mathrm{ref}},\mathbf R^{\mathrm{ref}},\boldsymbol\theta^{\mathrm{ref}}), qref=(pref,Rref,θref),
νref=(vref,ωref,θ˙ref). \boldsymbol\nu^{\mathrm{ref}} =(\mathbf v^{\mathrm{ref}},\boldsymbol\omega^{\mathrm{ref}},\dot{\boldsymbol\theta}^{\mathrm{ref}}). νref=(vref,ωref,θ˙ref).
通过正运动学得到每个刚体 bbb 的位姿与 twist:
Tbref=(pbref,Rbref),Vbref=(vbref,ωbref). \mathbf T_b^{\mathrm{ref}} =(\mathbf p_b^{\mathrm{ref}},\mathbf R_b^{\mathrm{ref}}), \qquad \mathbf V_b^{\mathrm{ref}} =(\mathbf v_b^{\mathrm{ref}},\boldsymbol\omega_b^{\mathrm{ref}}). Tbref=(pbref,Rbref),Vbref=(vbref,ωbref).
论文没有对所有相邻连杆重复跟踪,而是选取紧凑的目标刚体集合 Btarget\mathcal B_{\mathrm{target}}Btarget,其中包含手、脚等末端。这能降低冗余,同时保留动作风格和全身协调信息。
5.1.2 锚点中心化的相对运动目标
若全局位置和朝向被强制精确跟踪,受到推力或模型误差后,机器人会试图急剧返回原轨迹,容易破坏平衡。论文选择躯干或根节点作为锚点 banchorb_{\mathrm{anchor}}banchor,将其余刚体的期望位姿转换到锚点中心、偏航对齐且保持高度的坐标系中:
Tbdes=A(Tbref,Tanchor),b≠banchor. \mathbf T_b^{\mathrm{des}} =\mathcal A \left( \mathbf T_b^{\mathrm{ref}}, \mathbf T_{\mathrm{anchor}} \right), \qquad b\neq b_{\mathrm{anchor}}. Tbdes=A(Tbref,Tanchor),b=banchor.
期望 twist 保持参考值:
Vbdes=Vbref. \mathbf V_b^{\mathrm{des}}=\mathbf V_b^{\mathrm{ref}}. Vbdes=Vbref.
该设计允许机器人在全局空间发生可接受的漂移,但仍保持躯干、手脚和身体各部分之间的相对运动。这是抗扰恢复和 Sim2Real 的重要基础。
5.1.3 统一任务空间奖励
对位置、姿态、线速度和角速度分别计算目标刚体集合上的均方误差:
eˉs=1∣Btarget∣∑b∈Btargetes,b,s∈{p,R,v,ω}. \bar e_s =\frac{1}{|\mathcal B_{\mathrm{target}}|} \sum_{b\in\mathcal B_{\mathrm{target}}} e_{s,b}, \qquad s\in\{p,R,v,\omega\}. eˉs=∣Btarget∣1b∈Btarget∑es,b,s∈{p,R,v,ω}.
每项误差通过高斯型指数函数转为奖励:
r(eˉs,σs)=exp(−eˉsσs2). r(\bar e_s,\sigma_s) =\exp\left(-\frac{\bar e_s}{\sigma_s^2}\right). r(eˉs,σs)=exp(−σs2eˉs).
任务奖励为:
rtask=∑s∈{p,R,v,ω}r(eˉs,σs). r_{\mathrm{task}} =\sum_{s\in\{p,R,v,\omega\}} r(\bar e_s,\sigma_s). rtask=s∈{p,R,v,ω}∑r(eˉs,σs).
论文采用的误差尺度为:
| 跟踪项 | 尺度参数 |
|---|---|
| 位置 | σp=0.3\sigma_p=0.3σp=0.3 |
| 姿态 | σR=0.4\sigma_R=0.4σR=0.4 |
| 线速度 | σv=1.0\sigma_v=1.0σv=1.0 |
| 角速度 | σω=3.14\sigma_\omega=3.14σω=3.14 |
与依赖大量动作特定奖励的方案不同,本文只增加三类通用正则项:动作平滑、软关节限位和非期望自碰撞。按补充材料的带符号权重,整体可写为:
r=rtask−0.1rsmooth−10.0rlimit−0.1rcontact. r =r_{\mathrm{task}} -0.1r_{\mathrm{smooth}} -10.0r_{\mathrm{limit}} -0.1r_{\mathrm{contact}}. r=rtask−0.1rsmooth−10.0rlimit−0.1rcontact.
可选的锚点全局位置和姿态跟踪项权重均为 0.5。奖励设计的重点是保持简洁,避免为侧手翻、跑步或舞蹈分别增加不同的脚高、相位和姿态塑形项。
5.1.4 Actor 观测
Actor 使用不堆叠历史的机器人中心观测:
ot=[ψt,eanchor,t,Vimu,t,θt−θ0,θ˙t,at−1]. \mathbf o_t =[ \boldsymbol\psi_t, \mathbf e_{\mathrm{anchor},t}, \mathbf V_{\mathrm{imu},t}, \boldsymbol\theta_t-\boldsymbol\theta_0, \dot{\boldsymbol\theta}_t, \mathbf a_{t-1} ]. ot=[ψt,eanchor,t,Vimu,t,θt−θ0,θ˙t,at−1].
各部分含义如下:
- ψ=[θref,θ˙ref]\boldsymbol\psi=[\boldsymbol\theta^{\mathrm{ref}},\dot{\boldsymbol\theta}^{\mathrm{ref}}]ψ=[θref,θ˙ref]:参考动作相位提示。论文强调它只提供进度信息,并不要求策略直接复制参考关节值;
- eanchor\mathbf e_{\mathrm{anchor}}eanchor:锚点三维位置误差和 Rot6D 姿态误差;
- Vimu\mathbf V_{\mathrm{imu}}Vimu:IMU 坐标系中的线速度和角速度;
- θ−θ0\boldsymbol\theta-\boldsymbol\theta_0θ−θ0、θ˙\dot{\boldsymbol\theta}θ˙:相对关节位置和关节速度;
- at−1\mathbf a_{t-1}at−1:上一时刻动作,为当前隐式关节力矩和接触状态提供线索,并配合动作变化惩罚抑制抖动。
论文的消融结果表明,在其紧凑域随机化设置下,增加显式历史堆叠反而降低性能。原因可能是历史中的偏差和噪声会增加输入维度,并使策略更依赖训练域内的时序模式。该结论并非说明所有足式任务都不需要历史,而是表明此处的 IMU、关节状态和上一动作已经提供了足够的短时动态信息。
5.1.5 非对称 Actor–Critic
Actor 只使用部署时可获得的本体感知和参考信息。Critic 在训练阶段额外接收目标刚体相对于锚点的完整位姿,用更充分的仿真状态估计价值函数:
Vϕ(otactor,{Tbrel}b∈Btarget). V_\phi \left( \mathbf o_t^{\mathrm{actor}}, \{\mathbf T_b^{\mathrm{rel}}\}_{b\in\mathcal B_{\mathrm{target}}} \right). Vϕ(otactor,{Tbrel}b∈Btarget).
这里的“非对称”指 Actor 与 Critic 的输入信息不同,而不是 Critic 直接评价 Actor 输出动作的 Q(s,a)Q(s,a)Q(s,a)。PPO 中 Critic 主要估计状态价值 V(s)V(s)V(s),为 GAE 和策略更新提供基线。
Actor 与 Critic 均采用三层 MLP:
[512,256,128],ELU activation. [512,256,128],\qquad \text{ELU activation}. [512,256,128],ELU activation.
PPO 的关键训练参数为:
| 参数 | 数值 |
|---|---|
| 每环境 rollout 步数 | 24 |
| 最大迭代次数 | 30,000 |
| 学习率 | 1×10−31\times10^{-3}1×10−3 |
| PPO Clip | 0.2 |
| 熵系数 | 0.005 |
| 折扣因子 γ\gammaγ | 0.99 |
| GAE λ\lambdaλ | 0.95 |
| 每轮 Epoch | 5 |
| Mini-batch 数 | 4 |
| 目标 KL | 0.01 |
5.1.6 动作与低层阻抗控制
策略输出归一化关节位置设定值:
θsp=θ0+α⊙a. \boldsymbol\theta_{\mathrm{sp}} =\boldsymbol\theta_0 + \boldsymbol\alpha\odot\mathbf a. θsp=θ0+α⊙a.
低层 PD 控制器将其转换为关节力矩:
τ=Kp(θsp−θ)−Kdθ˙. \boldsymbol\tau =\mathbf K_p (\boldsymbol\theta_{\mathrm{sp}}-\boldsymbol\theta) -\mathbf K_d\dot{\boldsymbol\theta}. τ=Kp(θsp−θ)−Kdθ˙.
论文特别指出,θsp\boldsymbol\theta_{\mathrm{sp}}θsp 不是必须高精度跟踪的运动学轨迹,而是形成期望力矩的中间变量,因此不按关节机械限位直接裁剪。若把 PD 增益设置得过高,关节会成为高带宽位置伺服器,虽然仿真跟踪误差可能降低,却会放大传感器噪声、削弱冲击柔顺性并增加硬件应力。
作者用二阶系统启发式确定增益:
kp,j=Ijωn2, k_{p,j}=I_j\omega_n^2, kp,j=Ijωn2,
kd,j=2Ijζωn, k_{d,j}=2I_j\zeta\omega_n, kd,j=2Ijζωn,
其中 Ij=kg,j2Irotor,jI_j=k_{g,j}^2I_{\mathrm{rotor},j}Ij=kg,j2Irotor,j 是折算到关节侧的电机—减速器反射惯量。作者在这套启发式中有意只使用反射惯量,因为连杆子树惯量会随构型变化,难以用一个固定值准确表示;同时取过阻尼比 ζ=2\zeta=2ζ=2,补偿忽略构型相关连杆惯量造成的低估,名义自然频率设为 10 Hz。动作尺度采用:
αj=0.25τmax,jkp,j. \alpha_j=0.25\frac{\tau_{\max,j}}{k_{p,j}}. αj=0.25kp,jτmax,j.
这使不同关节的动作幅值与最大力矩和反馈刚度相匹配。
5.1.7 反射惯量的重要性
电机转子和减速器惯量经过传动比反射到关节侧后,可能占末端轻质关节总有效惯量的大部分。对多级传动,论文按 Jarm=Jr(g1g2)2+J1g22+J2J_{\mathrm{arm}}=J_r(g_1g_2)^2+J_1g_2^2+J_2Jarm=Jr(g1g2)2+J1g22+J2 计算关节侧 armature;总有效惯量可理解为连杆子树关于关节轴的惯量与 armature 之和。论文给出的例子中,腕部和踝部部分关节的反射惯量占比超过 70% 甚至 90%。忽略 armature 会使仿真关节响应过快,策略在实机上出现过冲、自碰撞或落脚失稳。
因此,armature 在此不是为了数值稳定随意添加的仿真参数,而是执行器真实动力学的一部分。该点对于快速双足动作的 Sim2Real 尤其重要。
5.1.8 紧凑域随机化
作者没有无限扩大随机化范围,而是保留对跨动作最有效的少数参数:
| 随机化项 | 分布 |
|---|---|
| 静摩擦系数 | U[0.3,1.6]U[0.3,1.6]U[0.3,1.6] |
| 动摩擦系数 | U[0.3,1.2]U[0.3,1.2]U[0.3,1.2] |
| 恢复系数 | U[0,0.5]U[0,0.5]U[0,0.5] |
| 大部分关节零位偏差 | U[−0.01,0.01]U[-0.01,0.01]U[−0.01,0.01] rad |
| 踝关节零位偏差 | 约 U[−0.1,0.1]U[-0.1,0.1]U[−0.1,0.1] rad |
| 躯干 COM 的 xxx 偏移 | U[−0.025,0.025]U[-0.025,0.025]U[−0.025,0.025] m |
| 躯干 COM 的 y,zy,zy,z 偏移 | U[−0.05,0.05]U[-0.05,0.05]U[−0.05,0.05] m |
| 根节点线速度扰动 | vx,vy∈[−0.5,0.5]v_x,v_y\in[-0.5,0.5]vx,vy∈[−0.5,0.5] m/s,vz∈[−0.2,0.2]v_z\in[-0.2,0.2]vz∈[−0.2,0.2] m/s |
| 根节点角速度扰动 | roll/pitch ∈[−0.52,0.52]\in[-0.52,0.52]∈[−0.52,0.52] rad/s,yaw ∈[−0.78,0.78]\in[-0.78,0.78]∈[−0.78,0.78] rad/s |
| 扰动间隔 | 1~3 s |
其设计思想是:随机化应覆盖主要 Sim2Real 误差并促进恢复能力,但不能把策略训练成只会保守维持平衡的控制器。
5.1.9 终止条件与自适应采样
当锚点或手脚末端的高度误差超过约 0.25 m,或锚点姿态误差超过约 0.8 rad 时终止回合。对于长动作序列,均匀随机初始化会导致简单片段被重复采样,而困难的腾空或接触切换片段学习不足。论文将参考动作划分为约 1 s 的时间 bin,并维护每个 bin 的失败率指数滑动平均:
fi←0.999fi+0.001f^i. f_i \leftarrow 0.999f_i+0.001\hat f_i. fi←0.999fi+0.001f^i.
随后对失败率进行非因果卷积,使困难片段之前的状态也获得更高采样概率,再以多项分布选择重置位置。策略掌握困难段后,失败率下降,采样逐渐回归均匀。该方法相当于一种面向时间片段的自动课程学习。
5.2 第二阶段:条件 VAE 与 DAgger 蒸馏
第一阶段产生多个高质量教师策略,但直接维护大量策略不利于统一控制。论文首先训练条件 VAE,将“参考运动意图”编码成低维潜变量。
5.2.1 编码器与解码器分工
编码器只接收参考相关信息:
z=E(ψ,eanchor). \mathbf z =E(\boldsymbol\psi,\mathbf e_{\mathrm{anchor}}). z=E(ψ,eanchor).
潜变量 z\mathbf zz 描述动作意图,而不携带完整当前动力学状态。解码器接收潜变量和本体感知:
a^=D(z,[g,Vimu,θ,θ˙,at−1]), \hat{\mathbf a} =D \left( \mathbf z, [ \mathbf g, \mathbf V_{\mathrm{imu}}, \boldsymbol\theta, \dot{\boldsymbol\theta}, \mathbf a_{t-1} ] \right), a^=D(z,[g,Vimu,θ,θ˙,at−1]),
其中 g\mathbf gg 为根坐标系中的投影重力。这样,同一潜在运动意图可以根据机器人当前偏差生成不同的闭环动作。
5.2.2 VAE 目标
VAE 使用重构损失和 KL 正则:
LVAE=EqE[∥a^−ateacher∥22]+βDKL(qE(z∣ψ,eanchor)∥N(0,I)). \mathcal L_{\mathrm{VAE}} =\mathbb E_{q_E} \left[ \|\hat{\mathbf a}-\mathbf a^{\mathrm{teacher}}\|_2^2 \right] + \beta D_{\mathrm{KL}} \left( q_E(\mathbf z|\boldsymbol\psi,\mathbf e_{\mathrm{anchor}}) \|\mathcal N(0,\mathbf I) \right). LVAE=EqE[∥a^−ateacher∥22]+βDKL(qE(z∣ψ,eanchor)∥N(0,I)).
KL 项使潜空间连续并接近标准高斯,便于后续扩散建模。论文设置潜变量维数为 32,KL 权重为 0.01;学生编码器和解码器均采用 [2048,1024,512][2048,1024,512][2048,1024,512] 的 MLP。
5.2.3 为什么使用 DAgger
若只在教师策略产生的理想状态上做监督学习,学生部署后出现小偏差便可能进入训练数据之外的状态,误差继续累积。DAgger 在学生 rollout 访问的状态上查询教师动作,再将这些样本加入训练集,使解码器学习从自身状态分布中恢复。其作用不是提高单步拟合精度,而是减小闭环分布偏移。
5.3 状态—潜变量联合扩散模型
5.3.1 为什么不直接扩散原始 PD 动作
论文给出两点理由:
- PD 位置设定值受到冲击和反馈修正影响,可能存在尖峰,直接建模不满足扩散模型偏好的平滑数据结构;
- 大型扩散网络推理较慢,若直接输出当前关节动作,动作可能基于过时状态;使用潜变量后,轻量 VAE 解码器可以结合最新观测生成动作。
因此模型学习的是未来状态与运动潜变量的联合轨迹:
τ=[st−N,zt−N,…,st,zt,…,st+H,zt+H]. \boldsymbol\tau =[ \mathbf s_{t-N},\mathbf z_{t-N},\ldots, \mathbf s_t,\mathbf z_t, \ldots, \mathbf s_{t+H},\mathbf z_{t+H} ]. τ=[st−N,zt−N,…,st,zt,…,st+H,zt+H].
5.3.2 状态表示
状态采用混合的角色—偏航中心表示:
- 根节点位姿和 twist 相对当前根坐标系表达;
- 目标刚体位置和速度相对各时刻局部根坐标系表达;
- 消除无意义的绝对平移和全局偏航,使相同动作在不同位置和朝向下具有一致表示。
5.3.3 前向加噪与反向去噪
对干净潜变量 z0\mathbf z^0z0,前向扩散为:
q(zk∣z0)=N(αˉkz0,(1−αˉk)I). q(\mathbf z^k|\mathbf z^0) =\mathcal N \left( \sqrt{\bar\alpha_k}\mathbf z^0, (1-\bar\alpha_k)\mathbf I \right). q(zk∣z0)=N(αˉkz0,(1−αˉk)I).
网络采用 x0x_0x0 预测形式,从噪声样本恢复干净轨迹:
Ldiff=E[∥fϕ(τk,k)−τ∥22]. \mathcal L_{\mathrm{diff}} =\mathbb E \left[ \|f_\phi(\boldsymbol\tau^k,k)-\boldsymbol\tau\|_2^2 \right]. Ldiff=E[∥fϕ(τk,k)−τ∥22].
推理时从高斯噪声开始迭代去噪,得到时间一致的状态—潜变量轨迹。论文为每个历史、当前和未来状态分配独立噪声等级,从而支持:
- 将已观测历史固定为低噪声条件;
- 对未来未知部分进行生成;
- 将关键帧作为已知条件进行 inpainting;
- 对不同时间位置施加不同强度的约束。
5.3.4 扩散模型结构与参数
| 参数 | 数值 |
|---|---|
| 预测时域长度 | 16 步 |
| 历史观测长度 | 4 步 |
| 嵌入维度 | 512 |
| 注意力头数 | 8 |
| Transformer 层数 | 6 |
| 去噪步数 | 20 |
| Batch Size | 512 |
| 训练 Epoch | 1000 |
| 学习率 | 1×10−41\times10^{-4}1×10−4 |
| Weight Decay | 0.001 |
| 学习率调度 | Cosine,预热 10,000 step |
论文报告扩散模型使用 20 次去噪,约 20 ms 完成一次预测;轻量 VAE 解码器同步使用最新观测输出动作。该架构把较慢的轨迹生成和快速低层反馈分离。
5.4 基于分类器引导的测试时优化
扩散模型学习无条件轨迹分布的 score:
∇τlogp(τ). \nabla_{\boldsymbol\tau} \log p(\boldsymbol\tau). ∇τlogp(τ).
给定任务目标 τ∗\boldsymbol\tau^*τ∗,由贝叶斯关系:
∇τlogp(τ∣τ∗)=∇τlogp(τ)+∇τlogp(τ∗∣τ). \nabla_{\boldsymbol\tau} \log p(\boldsymbol\tau|\boldsymbol\tau^*) =\nabla_{\boldsymbol\tau} \log p(\boldsymbol\tau) + \nabla_{\boldsymbol\tau} \log p(\boldsymbol\tau^*|\boldsymbol\tau). ∇τlogp(τ∣τ∗)=∇τlogp(τ)+∇τlogp(τ∗∣τ).
将任务条件写成可微代价 G(τ)G(\boldsymbol\tau)G(τ):
p(τ∗∣τ)∝exp[−G(τ)], p(\boldsymbol\tau^*|\boldsymbol\tau) \propto \exp[-G(\boldsymbol\tau)], p(τ∗∣τ)∝exp[−G(τ)],
则:
∇τlogp(τ∗∣τ)=−∇τG(τ). \nabla_{\boldsymbol\tau} \log p(\boldsymbol\tau^*|\boldsymbol\tau) =-\nabla_{\boldsymbol\tau}G(\boldsymbol\tau). ∇τlogp(τ∗∣τ)=−∇τG(τ).
因此每个去噪步骤不仅向高概率、自然且可执行的运动分布移动,也沿任务代价负梯度调整:
Guided Score=Motion Prior Score−λg∇τG(τ). \text{Guided Score}=\text{Motion Prior Score} -\lambda_g\nabla_{\boldsymbol\tau}G(\boldsymbol\tau). Guided Score=Motion Prior Score−λg∇τG(τ).
这与传统在线轨迹优化不同。优化器不是从任意轨迹开始依靠大量动力学约束寻找可行解,而是在已经学到的可执行人形运动分布内部搜索。因此速度、航点和障碍等简单代价即可触发复杂的全身协调行为。
5.5 滚动时域闭环执行
控制循环可概括为:
- 读取最新 IMU、关节状态和历史动作;
- 将已观测历史写入状态—潜变量轨迹;
- 从噪声初始化未来轨迹;
- 执行多步去噪,并在每步加入任务代价梯度;
- 取当前潜变量 zt\mathbf z_tzt;
- VAE 解码器结合最新本体观测生成关节动作;
- PD 控制器输出力矩;
- 下一控制周期重新规划。
该过程相当于带学习运动先验的生成式 MPC,但其“模型”不是显式刚体动力学,而是由跟踪策略 rollout 学到的状态—潜变量轨迹分布。
6. 消融实验与设计验证

图8 运动跟踪关键设计与潜变量扩散的消融实验(原论文 Figure 8)
图8集中验证了论文中若干看似工程细节、实际决定 Sim2Real 成败的设计。
6.1 姿态误差表示
论文比较 Rot6D、四元数和轴角表示。Rot6D 整体表现最好,轴角在一次实验中训练失败。原因在于轴角在接近 π\piπ 时存在不连续,四元数存在双覆盖符号歧义,而 Rot6D 提供连续、易学习的局部表示。
6.2 是否堆叠历史观测
在本文配置下,无历史堆叠优于显式历史。作者认为当前 IMU twist、关节速度和上一动作已经包含足够的动态信息,额外历史会扩大输入维度并引入冗余。该结论应结合任务解释:对于存在盲区、接触估计或严重时延的问题,历史编码仍可能有价值。
6.3 执行器反射惯量
使用准确 armature 的策略取得最好跟踪效果;不准确或设置为零会导致局部过摆、自碰撞和实机性能下降。该结果强调模型参数中“执行器侧惯量”与连杆质量、摩擦同等重要。
6.4 控制时延
论文在三个动作上加入额外时延:
- 约 2 ms 时,速度误差已经明显增大;
- 约 5 ms 时,三个动作中出现一次失败;
- 约 10 ms 时,三个动作中有两个失败。
这说明高动态双足控制中,低延迟 C++ 部署、推理—控制周期同步和稳定通信不是简单工程优化,而是算法成立的必要条件。
6.5 自适应采样
取消自适应采样后,四个测试动作中有三个在 30,000 次迭代后仍失败;对能成功学习的动作,自适应采样也把收敛时间从约 4,000 次迭代缩短到约 2,000 次。其收益主要来自将训练资源集中到失败频繁的高难片段。
6.6 潜变量扩散与原始动作扩散
在 MuJoCo 侧手翻实验中,潜变量方案成功率约 95%,直接对原始动作扩散的成功率约 5%。结果支持论文的核心判断:动作潜空间不仅用于降维,更承担了平滑控制意图、吸收动作尖峰和补偿扩散推理时延的作用。
7. 补充材料中的关键实现细节

图S1 运动跟踪阶段的非对称 Actor–Critic、奖励与域随机化结构(原论文 Figure S1)
图S1直观说明了 Actor 和 Critic 的非对称输入。Actor 使用可部署观测;Critic 在此基础上增加各目标刚体相对锚点的位姿。仿真环境根据动作执行动力学,并计算位置、姿态、线速度、角速度跟踪奖励与三项正则。域随机化只覆盖接触参数、关节零位和躯干质心等关键变量。

图S2 不同 PD 自然频率与既有增益设置的跟踪误差对比(原论文 Figure S2)
图S2表明,中等自然频率下的惯量匹配增益取得最佳全局跟踪性能。继续提高自然频率可以降低部分局部误差,却会引起明显力矩过冲、可听抖动和硬件应力。评价双足策略时,不能只看仿真局部跟踪误差,还要同时考虑全局漂移、力矩峰值、噪声放大和实机冲击。
8. 技术路线总结
BeyondMimic 的完整训练和部署流程如下。
8.1 数据准备
- 收集 LAFAN1、体育动作、舞蹈、武术、平衡和起身等人类运动;
- 将人体骨架动作重定向到 Unitree G1 关节和身体结构;
- 计算机器人广义位置、广义速度以及目标刚体的位姿和 twist;
- 检查足底穿透、关节限位、根节点高度和接触时序,避免重定向伪影污染训练。
8.2 运动跟踪训练
- 按锚点中心方式构造相对目标;
- 使用统一任务空间奖励和三项正则;
- 采用非对称 Actor–Critic PPO;
- 加入紧凑域随机化和速度扰动;
- 采用失败率驱动的时间片段自适应采样;
- 对每段动作或动作序列训练独立策略;
- 在 Isaac Lab 中完成大规模并行训练。
8.3 Sim2Sim 与 Sim2Real 验证
- 将策略导出为 ONNX;
- 在 MuJoCo 中进行 Sim2Sim,检查动力学参数、关节方向、PD 增益、控制频率和延迟;
- 通过 C++/ROS 2 部署框架在 CPU 上推理;
- 保证状态采样、策略推理、动作发送和电机控制周期同步;
- 由低风险动作逐步过渡到跑跳和腾空动作。
8.4 VAE 蒸馏与扩散训练
- 以跟踪策略作为教师;
- 条件 VAE 编码参考动作意图,解码器结合本体观测模仿教师动作;
- 通过 DAgger 收集学生访问状态并持续标注;
- rollout VAE,记录状态和潜变量序列;
- 训练 Transformer 状态—潜变量扩散模型;
- 对真实 rollout 适当加入扰动,增强模型对部署偏差的恢复能力。
8.5 推理时任务控制
- 将速度、航点、障碍或关键帧写为可微代价;
- 在每次去噪中加入代价梯度;
- 生成满足任务且位于运动先验高概率区域的未来轨迹;
- 仅执行当前潜变量解码出的第一个动作;
- 下一周期重新规划并形成闭环。
9. 主要创新点与学术贡献
9.1 提出“一套配方适配多动作”的高质量运动跟踪框架
论文没有依赖针对动作的奖励工程,而是用统一目标刚体、锚点中心表示、简洁任务空间奖励、合理阻抗参数和自适应采样覆盖大量动作。其贡献不在于修改 PPO 损失,而在于解决了 PPO 运动跟踪在动作规模扩大后难以复用的问题。
9.2 将相对运动跟踪与低阻抗实机控制结合
锚点中心目标允许全局漂移,避免机器人在扰动后强行追赶绝对参考;惯量匹配 PD 和准确 armature 又保证了真实执行器的闭环动力学。这使高动态动作兼具参考风格和扰动恢复能力。
9.3 以条件 VAE 分离运动意图和当前闭环状态
编码器提取参考动作意图,解码器利用最新本体状态生成动作。该结构比直接压缩原始动作更符合机器人控制逻辑,也为扩散模型提供了连续、平滑、可解码的低维控制变量。
9.4 提出状态—潜变量联合扩散控制
扩散模型同时预测未来机器人状态和潜在动作,而不是只输出动作。状态提供可施加任务代价的物理语义,潜变量提供可执行运动意图,两者联合建模使关键帧补全、轨迹约束和任务引导成为可能。
9.5 将分类器引导转化为零样本人形任务优化器
速度、航点、障碍和关键帧目标均在测试时加入,无需重新训练或新增任务标签。该机制把扩散运动先验转化为可组合的在线优化器,突破了传统模仿策略“一条参考对应一种行为”的限制。
9.6 在真实双足机器人上同时验证敏捷性、自然性和通用性
论文不仅展示单项动作成功,还提供高动态指标、地面反作用力、用户研究、速度误差、长距离运行和多任务组合结果。实机演示覆盖单脚支撑、腾空、多接触和连续动作,体现了方法在高自由度真实系统上的完整性。
10. BeyondMimic、AMP 与普通 PPO 的区别
| 维度 | 普通任务型 PPO | PPO + AMP | BeyondMimic |
|---|---|---|---|
| 专家数据 | 可不使用 | 必须使用专家运动 | 必须使用参考运动与教师 rollout |
| 模仿机制 | 人工任务奖励 | 判别器学习风格奖励 | 显式刚体运动跟踪 + VAE 蒸馏 |
| 核心网络 | Actor–Critic | Actor–Critic + Discriminator | 多个 PPO Tracker + VAE + Transformer Diffusion |
| 策略更新 | PPO | PPO 使用任务奖励和 AMP 奖励 | 第一阶段 PPO;第二阶段监督/生成式学习 |
| 是否 GAN 式 | 否 | 是,对抗判别 | 否,不以 GAN 判别器为核心 |
| 新任务适应 | 通常重新训练 | 通常仍需任务训练 | 可通过可微代价在测试时零样本引导 |
| 主要目标 | 完成固定任务 | 完成任务且动作像示范 | 从跟踪技能库形成可组合运动先验 |
一句话概括:
AMP 学习“什么动作像专家”,BeyondMimic 学习“哪些状态—运动意图轨迹可由机器人实现”,再用任务梯度从这些轨迹中在线选择。
11. 实验设计评价
11.1 实验设计的优点
- 覆盖面广:从静态平衡到腾空翻转、从行走到多接触起身;
- 真实环境验证充分:包含室外松软地面、不平地形、外力扰动和长距离运行;
- 自然性评价不局限于视频:加入地面反作用力和用户研究;
- 消融针对关键工程变量:姿态表示、历史观测、armature、时延、PD 增益和自适应采样均直接影响实机表现;
- 第二阶段展示了组合性:不仅给出速度控制,还包含关键帧补全和障碍代价叠加。
11.2 实验设计仍可加强之处
- 论文没有给出覆盖所有动作的统一定量跟踪指标分布,例如成功率、末端误差和能耗的全数据集统计;
- 与 PHC、OmniH2O、TWIST 等通用跟踪方法缺少严格同平台、同动作集和同硬件的直接对比;
- 用户研究对“自然”的评价有价值,但受视角、视频选择和参与者经验影响;
- 速度误差仅覆盖行走和跑步,未系统报告转向、横移、障碍和动作切换误差;
- 任务引导仍需设置代价权重,论文未给出跨任务自动权重选择方法;
- 扩散推理计算量与控制频率之间的关系可以进一步量化,包括不同去噪步数的性能—时延曲线。
12. 方法局限性
12.1 依赖可靠状态估计
状态—潜变量扩散模型需要根节点姿态、速度和身体状态。实机状态估计漂移会同时影响历史条件、任务代价和 VAE 解码,误差可能沿滚动预测传播。户外视觉退化、脚底打滑和强冲击下的状态估计仍是系统瓶颈。
12.2 预测时域有限
论文扩散预测覆盖约 0.64 s。该时域足以处理短期速度控制、障碍绕行和动作过渡,但不足以直接规划复杂地形中的长距离路线或多阶段任务。长时行为主要依靠滚动执行而非全局规划保证。
12.3 历史条件可能导致动作模式锁定
历史状态有助于保持时间一致性,也可能使模型停留在当前周期步态中。若任务要求快速从重复行走切换到罕见动作,过强历史约束会阻碍转移;若增大引导强度,又可能把轨迹推离运动分布并导致不稳定。
12.4 细粒度控制能力有限
测试时引导适合速度、位置、距离场和稀疏关键帧等连续目标。对于精确手部操作、严格接触力控制或复杂物体交互,仅靠粗粒度状态代价可能不足,需要视觉条件、接触模型或任务适配器。
12.5 动作质量受重定向数据制约
若人体动作重定向到机器人后存在足底穿透、比例失真、关节超限或不合理接触,运动跟踪策略会把这些误差学成控制目标。后续扩散模型还会进一步吸收该分布。因此,重定向不是简单预处理,而是决定运动先验质量的上游环节。
12.6 硬件结构限制不能由学习完全消除
G1 缺少脚趾关节,行走地面反作用力峰值更尖锐。类似地,关节行程、峰值力矩、足底尺寸和传动刚度都会限制动作自然性。生成式模型可以优化控制方式,但不能突破硬件本身的可达动力学范围。
13. 对双足机器人项目复现的启示
13.1 第一阶段应先追求“可部署的高质量教师”
扩散模型无法修复质量很差的运动教师。如果 PPO 跟踪策略存在高频抖动、足底滑移或落地不稳定,VAE 和扩散只会学习这些缺陷。复现时应先对每类动作完成:
- 仿真跟踪成功率和误差检查;
- 关节力矩、速度和机械限位检查;
- 足底接触和自碰撞检查;
- MuJoCo Sim2Sim;
- 低风险实机验证。
13.2 不要把关节设定值误认为严格位置轨迹
策略动作在 PD 控制中主要用于塑造力矩。过度提高 KpK_pKp 可能在仿真中降低姿态误差,却会使实机变得僵硬并放大时延。PD 增益、动作尺度、armature 和控制周期需要联合标定。
13.3 域随机化应围绕真实误差来源设计
BeyondMimic 的经验不是“随机化越多越好”,而是优先覆盖:
- 地面接触变化;
- 关节零位误差;
- 躯干质心误差;
- 外部速度扰动;
- 执行器惯量和实际时延。
若随机化范围远超真实系统,策略会牺牲动作质量来适应极端样本。
13.4 将潜变量定义为“运动意图”而非压缩动作
条件 VAE 编码参考运动,解码器根据当前状态输出动作。这种设计比普通自编码器直接压缩关节命令更适合闭环控制。对于自行实现,可把 latent 视为步态、身体协调和动作阶段的低维描述。
13.5 测试时引导要同时考虑任务和先验
引导权重过小,轨迹满足自然运动先验但无法完成目标;权重过大,轨迹可能偏离训练分布并失稳。应分别记录:
- 任务误差;
- 扩散去噪残差;
- 解码动作变化率;
- 身体姿态和接触稳定性;
- 引导梯度范数。
通过归一化代价和限制梯度幅值,减少任务之间的手工调节。
13.6 部署时应把延迟作为显式指标
建议将总时延拆分为:
Ttotal=Tsense+Tstate+Tdiffusion+Tdecode+Tcomm+Tmotor. T_{\mathrm{total}} =T_{\mathrm{sense}} +T_{\mathrm{state}} +T_{\mathrm{diffusion}} +T_{\mathrm{decode}} +T_{\mathrm{comm}} +T_{\mathrm{motor}}. Ttotal=Tsense+Tstate+Tdiffusion+Tdecode+Tcomm+Tmotor.
只报告神经网络推理时间并不足以说明闭环性能。应测量从传感器采样到电机命令实际生效的端到端延迟和抖动。
14. 开源实现分析
14.1 whole_body_tracking
该仓库主要开放第一阶段运动跟踪训练,基于 Isaac Lab 2.1.0 和 RSL-RL PPO。其代码结构将 MDP 拆分为:
commands.py:参考运动和目标命令;observations.py:Actor/Critic 观测;rewards.py:目标刚体跟踪和正则奖励;events.py:域随机化及扰动;terminations.py:失败判据;- 环境与 Agent 配置:网络、PPO 和仿真参数。
仓库说明使用与论文相同的 MDP 和超参数,并提供 LAFAN1 相关流程。它适合验证论文第一阶段,但并不等同于完整 BeyondMimic 扩散控制代码。
14.2 motion_tracking_controller
该仓库负责策略部署,采用 C++、ONNX Runtime 和 ROS 2 Jazzy,支持 MuJoCo Sim2Sim 与真实机器人。其意义在于把 Python 训练环境与低延迟执行解耦,避免 Python 调度、消息队列和异步推理造成周期抖动。
15. 结论
BeyondMimic 的研究价值在于建立了一条从高质量动作模仿到通用人形控制的清晰路径:
- 用统一 PPO 配方把大量人类动作转化为可在双足机器人上执行的技能;
- 用条件 VAE 与 DAgger 将不同教师策略压缩为平滑、闭环可解码的运动潜空间;
- 用状态—潜变量扩散模型学习可执行运动轨迹分布;
- 用分类器引导在推理时加入速度、航点、障碍和关键帧代价;
- 通过滚动去噪与轻量解码器,在真实 G1 上完成零样本任务组合。
它没有用一个更复杂的奖励函数替代传统控制,也没有把 PPO 简单换成扩散模型,而是把三种学习范式分别放在最合适的位置:PPO 负责获得稳定的闭环技能,DAgger/VAE 负责统一和压缩技能表示,扩散模型负责建模多模态轨迹与测试时优化。对于双足机器人研究而言,这种分层设计比“端到端一个网络解决全部问题”更具工程可解释性。
从学术脉络看,DeepMimic 解决了“如何跟踪动作”,AMP 解决了“如何从数据学习动作风格”,BeyondMimic 进一步探索“如何把动作先验变成可组合的通用控制器”。其后续关键方向将集中在视觉感知、长时规划、接触丰富操作、更可靠的状态估计和自动化任务代价调节。
16. 相关文献
-
Liao, Q., Truong, T. E., Huang, X., Gao, Y., Tevet, G., Sreenath, K., Liu, C. K. BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion. arXiv:2508.08241, 2025.
https://arxiv.org/abs/2508.08241 -
Peng, X. B., Abbeel, P., Levine, S., van de Panne, M. DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills. ACM Transactions on Graphics, 2018.
https://arxiv.org/abs/1804.02717 -
Peng, X. B., Ma, Z., Abbeel, P., Levine, S., Kanazawa, A. AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control. ACM Transactions on Graphics, 2021.
https://arxiv.org/abs/2104.02180 -
Ho, J., Jain, A., Abbeel, P. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
https://arxiv.org/abs/2006.11239 -
Dhariwal, P., Nichol, A. Diffusion Models Beat GANs on Image Synthesis. NeurIPS, 2021.
https://arxiv.org/abs/2105.05233 -
Ho, J., Salimans, T. Classifier-Free Diffusion Guidance. 2022.
https://arxiv.org/abs/2207.12598 -
Chi, C., Feng, S., Du, Y., Xu, Z., Cousineau, E., Burchfiel, B., Song, S. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion.
https://arxiv.org/abs/2303.04137 -
Luo, Z. et al. Perpetual Humanoid Control for Real-time Simulated Avatars. ICCV, 2023.
https://arxiv.org/abs/2305.06456 -
He, T. et al. OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning.
https://arxiv.org/abs/2406.08858 -
He, T. et al. ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills.
https://arxiv.org/abs/2502.01143 -
Huang, X. et al. Diffuse-CLoC: Guided Diffusion for Physics-Based Character Look-ahead Control. 2025.
https://arxiv.org/abs/2503.11801 -
Araujo, J. P., Ze, Y., Xu, P., Wu, J., Liu, C. K. Retargeting Matters: General Motion Retargeting for Humanoid Motion Tracking. arXiv:2510.02252, 2025.
https://arxiv.org/abs/2510.02252
https://github.com/YanjieZe/GMR -
Ross, S., Gordon, G., Bagnell, D. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning(DAgger). AISTATS, 2011.
https://arxiv.org/abs/1011.0686 -
Zhou, Y. et al. On the Continuity of Rotation Representations in Neural Networks(Rot6D). CVPR, 2019.
https://arxiv.org/abs/1812.07035
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)