按训练阶段、运动泛化、评判标准、奖励、观测、架构、随机化与工程难点整理

一、总览:模仿学习核心路线

人形机器人全身控制的目标不是让机器人在仿真中完成一个孤立动作,而是让高自由度、强耦合、接触丰富的系统在真实硬件上稳定、自然、可恢复地执行任务。这使模仿学习和强化学习自然结合:模仿学习提供人类动作先验,强化学习负责在物理约束、接触、扰动和硬件限制下寻找可执行策略。

可以把多数框架放进统一的 POMDP:真实状态 s_t 包含机器人、环境、接触、外物和执行器热/电状态;策略只能观察 o_t,输出动作 a_t,仿真动力学或真实动力学给出转移 s_{t+1}。不同论文的区别在于:参考运动怎么来,奖励怎么构造,策略是否有未来信息,是否分阶段训练,是否显式建模 sim-to-real gap,以及是否把恢复和硬件安全纳入目标。

POMDP:  s_{t+1} ~ p(s_{t+1}|s_t,a_t,ξ),  o_t = h(s_t),  a_t ~ π_θ(a_t|o_t,c_t)

RL objective:  J(θ)=E_{τ~π_θ}[Σ_{t=0}^{T} γ^t r(s_t,a_t)]

Behavior cloning:  L_BC(θ)=E_{(o,a*)~D}[||π_θ(o)-a*||_2^2]

RL+BC / distillation:  L(π_stu)=L_RL(π_stu)+λ D_KL(π_stu || π_tea)

从教学角度看,当前文献可分为六条主线:经典单阶段运动跟踪、多阶段通用基座、遥操作与视频数据、恢复安全、动态对象交互、Sim-to-Real 与在线适应。这些主线并非互斥。一个实际系统通常先用运动跟踪训练底层基座,再通过遥操作或视频扩展数据,通过 distillation 降低部署观测需求,通过 domain randomization 或系统辨识处理现实差距,最后加入恢复和任务层策略。

大类

代表框架

核心问题

典型解决思路

单阶段运动跟踪

DeepMimic、PHC/MHC、GMT、ZEST

如何让机器人稳定复现一段参考运动

参考状态初始化、提前终止、姿态/速度/末端奖励、PPO

多阶段通用基座

ExBody2、ASAP、BumbleBee、VMS、SONIC、FAST、OmniXtreme、BeyondMimic、LIFT

如何从单动作扩展到多动作/通用控制

专家到通才、教师学生、MoE、生成式先验、残差适配

遥操作与数据

H2O、OmniH2O、HumanPlus、TWIST、TWIST2、HuMI

如何低成本获得机器人可执行演示

人到机器人重定向、影子模式、VR/RGB/稀疏点控制、LfD

视频模仿

VideoMimic、GenMimic、ZeroWBC、HumanX/XGen

如何从日常视频或生成视频得到可训练数据

4D 人体/场景重建、物理先验数据合成、VLM 运动生成

恢复与安全

Learning to Get Up、HOST、FRASA、SafeFall、FIRM、KungFuAthlete

摔倒、冲击、恢复和任务连续性

跌倒预测、损伤奖励、关键帧增强、恢复课程、低动能采样

交互与竞技

Badminton、LATENT、HITTER、InterReal、HumanX

高速物体、人-物交互、长视界任务

分层规划、多阶段 RL、潜变量控制、自动奖励学习

Sim-to-Real / 适应

PACE、Any2Track、RMA、LSWM、两阶段 SysID、UFO/BFM-Zero

仿真与真实差距、扰动和长期泛化

系统辨识、域随机化、world model、adapter、无监督 RL

二、两条核心分类轴:训练阶段与运动泛化能力

2.1 单阶段训练与多阶段训练

单阶段训练把动作复现、稳定、鲁棒性和部署约束尽量放进同一个 RL 问题,优点是流程简单、误差链短,缺点是复杂目标容易相互冲突。多阶段训练把问题拆开:先学习运动、再蒸馏、再适配、再做硬件后训练。它更符合复杂系统工程,但误差会在阶段之间传递。

类型

代表

优点

风险

单阶段跟踪

DeepMimic、ZEST、部分 FastSAC 运动控制

实现直接、消融清楚、调参面小

复杂动作和真实部署约束容易冲突

两阶段师生

GMT、VMS、ExBody2、OmniH2O、TWIST

教师可用特权信息,学生适合部署

DAgger/BC 可能平均化动作,学生分布偏移

预训练 + 后训练

OmniXtreme、ASAP、LIFT、Any2Track

先保留表达能力,再处理硬件和扰动

后训练可能破坏预训练动作风格

生成器 + 控制器

BeyondMimic、ZeroWBC、BFM-Zero、UFO

可提示、可组合、具备基础模型潜力

采样延迟、目标可执行性和安全验证困难

任务多阶段课程

Badminton、HOST、SafeFall、VideoMimic

适合探索困难的长视界任务

课程设计依赖经验,阶段边界影响最终策略

2.2 单运动跟踪、多运动跟踪与通用基座

单运动跟踪关注一段或一类参考动作;多运动跟踪关注在同一策略内覆盖多个动作;通用基座进一步要求策略成为下游任务的底层接口,可以被遥操作、语言、视觉、扩散规划器或高层策略调用。

层级

目标

常见输入

评价重点

代表框架

单运动跟踪

复现固定参考轨迹

phase、当前/未来参考帧

姿态误差、成功率、稳定性

DeepMimic、ZEST 单技能

多运动跟踪

单策略覆盖多类运动

未来运动窗口、动作类别、目标关键点

MPJPE/MPKPE、完成率、OOD 动作

GMT、VMS、ExBody2、SONIC

通用控制基座

作为下游任务和接口的低层能力

命令、稀疏关键点、潜变量、语言/视觉生成目标

零样本任务、适配效率、恢复能力

BeyondMimic、OmniXtreme、BFM-Zero、UFO、Any2Track

交互任务策略

完成对象交互或竞技任务

物体状态、球轨迹、视觉、高层目标

任务成功率、连续回合、碰撞安全

Badminton、LATENT、HITTER、InterReal、HumanX

三、评判标准、奖励、观测、动作与架构工具箱

3.1 模仿学习评判标准

教学中要避免只看视频效果。一个可部署的人形控制器至少应从以下维度评估:

指标

含义

常见公式或测量

MPJPE

平均关节位置误差,衡量全身姿态保真度

MPJPE=(1/J)Σ_j ||p_j-p_j^ref||_2

MPKPE / 关键点误差

末端、膝、肘、脚等关键点误差

(1/K)Σ_k ||x_k-x_k^ref||_2

根部误差

根位置、朝向、速度是否跟上参考

||v_root-v_ref||, d_R(R,R_ref)

成功率 / 完成率

动作未跌倒并完成目标的比例

N_success / N_total

稳定性

是否摔倒、打滑、越界、自碰撞

跌倒率、接触异常数、COM/ZMP 余量

平滑性

动作是否抖动、力矩是否突变

Σ||a_t-a_{t-1}||^2, Σ||qddot||^2

能耗

执行动作的电/机械成本

CoT=E/(mgd), Σ|τ·qdot|

恢复性

失稳后能否继续任务

恢复成功率、恢复时间、任务续行率

泛化

未见动作、未见地形、不同硬件/负载

OOD 成功率、zero-shot 任务成功率

真实部署

仿真到真实是否一致

硬件成功率、故障率、温升、过流次数

3.2 一般奖励设计

多数运动模仿奖励采用指数误差核,把距离映射到 0 到 1 的平滑奖励;任务奖励、能耗和安全项再做加权组合。DeepMimic 的四项模仿奖励是基础模板,后续框架通常在这个模板上做简化、重加权或加入接触/硬件项。

r_imit = w_p exp(-α_p e_pose) + w_v exp(-α_v e_vel) + w_e exp(-α_e e_ee) + w_c exp(-α_c e_com)

e_pose = Σ_j ||q_j ⊖ q_j^ref||^2,   e_vel = Σ_j ||ω_j-ω_j^ref||^2

r_total = w_imit r_imit + w_task r_task - λ_a||a_t-a_{t-1}||^2 - λ_τ||τ_t||^2 - λ_col I_collision

奖励项

目的

典型用途

姿态/关节奖励

匹配参考关节姿态

DeepMimic、GMT、VMS、GenMimic

速度奖励

匹配关节/根部速度,减少滞后

高动态运动跟踪

末端执行器奖励

保证手、脚、球拍等关键部位准确

交互、击球、操控

COM/root 奖励

保持整体平衡和全局运动

跑跳、起身、恢复

接触奖励

鼓励正确落脚、减少脚滑

步态、楼梯、竞技任务

动作平滑

减少抖动和机械冲击

几乎所有真实部署

能耗/功率

降低电耗、避免过流和热应力

PACE、OmniXtreme

任务奖励

击球、搬运、导航、目标到达

Badminton、HITTER、InterReal

安全/损伤奖励

降低跌倒冲击和脆弱部件碰撞

SafeFall、FIRM

判别器奖励

使行为更像人类数据

AMP/BFM-Zero 类方法

GAN-style style reward:  r_D(o,s,z)=D(o,s,z)/(1-D(o,s,z))

Power-safe penalty:  L_power = λ · max(0, -τ·qdot - P_dead)^2

Cost of Transport:  CoT = E / (m g d)

3.3 观测与动作空间

类型

内容

优点

风险

本体感受

关节位置/速度、IMU、投影重力、上一动作

真实可得、低延迟

缺少接触和环境信息

参考运动

当前帧、未来窗口、相位、关键点目标

提高跟踪精度

强依赖参考会降低泛化

历史窗口

过去 k 步观测和动作

隐式估计速度、延迟、摩擦、外力

高维、可能引入因果混淆

特权信息

接触力、真实速度、摩擦、物体精确位姿

教师训练更容易

真实部署不可用,需要蒸馏

环境感知

高度图、点云、视觉、物体状态

支持场景条件和交互

感知延迟、噪声、sim-to-real gap

语言/视频条件

VLM 输出、运动 token、视频重建动作

扩展任务来源

实时性和可执行性验证困难

动作空间常见选择包括:绝对目标关节角、相对参考的残差目标、关节速度更新、潜变量动作、高层关键点或末端目标。

PD low-level control:  τ = K_p(q_des-q) - K_d qdot

Residual action:  q_des = q_ref + scale ⊙ a_t

MoE action:  a = Σ_i g_i(o,c) a_i(o,c),  Σ_i g_i = 1

3.4 常见策略架构

架构

代表框架

解决的问题

注意事项

MLP Actor-Critic

DeepMimic、ZEST、HOST

稳定的基础 RL 控制

容量有限,难覆盖高度多样动作

非对称 Actor-Critic

SafeFall、HITTER、InterReal

训练时用特权 critic,部署 actor 只用可观测信息

特权信息不能泄漏到 actor

教师-学生 / DAgger

GMT、VMS、OmniH2O、ExBody2

压缩特权教师到可部署学生

可能平均化动作,需在线数据聚合

MoE / OMoE

GMT、VMS

多运动分工,提高容量

专家塌缩或切换不平滑

Transformer

HumanPlus、ZeroWBC

处理长序列、视觉/语言/运动 token

推理延迟和数据需求高

Diffusion / Flow

BeyondMimic、FIRM、OmniXtreme、HuMI

建模多模态动作分布和生成式控制

采样成本、物理可执行性

World Model / Adapter

Any2Track、LSWM、LIFT

从历史中估计动力学或未来趋势

预测误差累积,安全验证更难

无监督潜空间

BFM-Zero、UFO/TeCH

零样本提示和行为基础模型

行为边界受训练数据和潜空间质量限制

3.5 随机化与 Sim-to-Real

随机化不是越多越好。资料库中有两类观点:BeyondMimic 和 PACE 强调紧凑、物理可解释的随机化;FastSAC 和某些高鲁棒部署强调强随机化。判断标准是:参数是否可测、是否任务相关、是否会牺牲动作保真度。

随机化对象

常见范围/形式

作用

潜在副作用

质量 / 质心 / 惯量

link mass、COM 偏移

适应负载和建模误差

动作变保守

摩擦 / 恢复系数

地面、脚底、物体接触

适应地面差异

接触时序不准

PD 增益 / 扭矩限制

Kp/Kd、最大力矩、速度包络

适应执行器差异

降低跟踪精度

动作延迟 / 控制频率

延迟、丢包、保持动作

适应通信和计算延迟

策略过度迟缓

传感器噪声

IMU、编码器、视觉高度图

提高部署鲁棒性

状态估计不稳定

外力扰动

push、pull、冲击、物体碰撞

训练恢复和抗扰动

改变动作风格

地形

高度图、楼梯、斜坡、台阶

复杂场景部署

训练难度显著上升

四、各大类框架详解与创新点

4.1 单阶段运动跟踪:从 DeepMimic 到极简真实部署

DeepMimic

维度

要点

分类定位

经典单阶段参考运动跟踪;物理动画到机器人模仿学习的起点。

核心创新

提出姿态、速度、末端、质心四项模仿奖励,并用参考状态初始化 RSI 与提前终止 ET 解决探索难题。

训练方式

PPO 训练单技能或多技能策略;可叠加任务奖励实现击打、投掷等任务。

观测 / 动作 / 奖励

观测为角色状态和参考相位;动作为 PD 目标关节角;奖励为 r_pose/r_vel/r_ee/r_com + task。

策略架构

MLP 高斯策略,底层 PD 控制。

随机化 / Sim-to-Real

原始工作侧重仿真,真实机器人后续工作再加入随机化和蒸馏。

评判指标

姿态误差、技能成功率、自然度、任务完成率。

重点难点与解决方案

难点是高动态动作探索和跌倒;RSI 从参考轨迹采样初始状态,ET 提高样本效率。

ZEST

维度

要点

分类定位

极简单阶段运动模仿,强调零样本部署和跨平台演示。

核心创新

明确避免接触标签、参考窗口、状态估计器、大量奖励塑形和多阶段训练;用自适应采样、辅助扳手和残差动作支撑训练。

训练方式

Isaac Lab 中 PPO 单阶段训练,约 10 小时完成单技能策略。

观测 / 动作 / 奖励

本体感受 + 参考;动作是残差关节目标;中等域随机化。

策略架构

简单 MLP/Actor-Critic + PD 控制。

随机化 / Sim-to-Real

脉冲推力、传感器噪声、摩擦和质量变化;依赖执行器精细建模。

评判指标

硬件成功演示、动作完成率、零样本部署效果。

重点难点与解决方案

难点是保持极简同时可部署;通过模型辅助扳手降低早期探索难度,训练后逐步撤销辅助。

FastSAC / FlashSAC

维度

要点

分类定位

大规模离策略 RL,用于快速训练人形运动控制和跟踪策略。

核心创新

将 SAC/TD3 适配到大规模并行仿真:大回放缓冲、大模型、大批次、低 UTD、稳定 critic 技巧和噪声重复。

训练方式

离策略训练,强调分钟级墙钟效率;可用于运动控制或全身跟踪。

观测 / 动作 / 奖励

本体感受、命令或参考;奖励倾向少于 10 项的最小化设计。

策略架构

大容量网络、分布式 critic、批归一化/层归一化、联合限感知动作边界。

随机化 / Sim-to-Real

较强域随机化:动作延迟、PD、质量、摩擦、COM、推搡、粗糙地形。

评判指标

训练时间、真实部署成功率、鲁棒性、自然度。

重点难点与解决方案

挑战 PPO 主导地位;难点是离策略在高维控制中稳定,解决方案是约束 critic 更新和高覆盖探索。

4.2 多运动跟踪与通用基座

ExBody2

维度

要点

分类定位

真实世界表达性全身控制;通才-专才多阶段训练。

核心创新

自动数据筛选、通才到专才微调、解耦运动-速度控制,平衡表达性和稳定性。

训练方式

先训练通才,再按类别微调专才;教师 PPO + 学生 DAgger 蒸馏。

观测 / 动作 / 奖励

教师使用特权信息,学生只用历史本体观测;跟踪局部关键点和根速度。

策略架构

Teacher-student,PPO + DAgger。

随机化 / Sim-to-Real

通过学生历史观测和特权蒸馏实现部署;具体随机化服务于 sim-to-real。

评判指标

MPKPE、MPJPE、真实 Unitree G1 表现。

重点难点与解决方案

数据可行性是瓶颈;自动筛选剔除不可行下肢运动,但多个专才难以无缝组合。

GMT

维度

要点

分类定位

General Motion Tracking,单一策略跟踪多样 AMASS/LAFAN 动作。

核心创新

自适应采样、运动 MoE、未来 2 秒运动卷积编码,提升多动作覆盖。

训练方式

教师 PPO 训练 + DAgger 学生蒸馏,两阶段数据清洗。

观测 / 动作 / 奖励

未来运动窗口 + 当前状态;强调根速度而非全局位置,减少失败但可能产生漂移。

策略架构

Motion MoE:门控网络加权多个专家。

随机化 / Sim-to-Real

真实 Unitree G1 部署;以数据筛选和蒸馏处理现实部署。

评判指标

Empkpe、Empjpe、Epos、Evel、成功率。

重点难点与解决方案

难点是动作多样性和高动态长尾;自适应采样聚焦困难片段,MoE 增加容量。

VMS / KungFuBot2

维度

要点

分类定位

多样动态技能的统一全身控制器。

核心创新

正交 MoE 强制专家表征正交,混合全局根轨迹和局部关键体跟踪,分段级跟踪奖励。

训练方式

PPO 教师策略 + DAgger 学生策略;AMASS 重定向后经策略评估筛选。

观测 / 动作 / 奖励

本体感受和历史信息;参考运动目标;分段级奖励允许短窗口内匹配。

策略架构

OMoE 教师,学生蒸馏部署。

随机化 / Sim-to-Real

真实 G1 上演示武术、舞蹈、跑步等;微调适应 OOD 极端动作。

评判指标

训练/测试集跟踪指标、真实部署、文本生成运动零样本泛化。

重点难点与解决方案

GMT 的根速度设计会漂移,VMS 用混合跟踪和分段奖励改善精度与鲁棒性。

BumbleBee / BeingBeyond

维度

要点

分类定位

专家-通才框架,解决多类行为数据冲突。

核心创新

先做运动聚类,为每组训练专家,再通过知识蒸馏整合成通才控制器;结合 Delta Action 做 sim-to-real 微调。

训练方式

聚类 -> 专家训练 -> 通才蒸馏 -> 残差/Delta Action 微调。

观测 / 动作 / 奖励

按运动类别组织参考数据;奖励为多运动跟踪奖励。

策略架构

专家策略集合 + 通才网络。

随机化 / Sim-to-Real

使用残差动作模型缩小现实差距。

评判指标

不同运动类别成功率、通才对专家性能保持程度。

重点难点与解决方案

难点是异质技能在同一策略中冲突;聚类和专家蒸馏降低梯度冲突。

ASAP

维度

要点

分类定位

仿真到现实对齐框架,强调 Delta Action 残差补偿。

核心创新

收集真实轨迹,学习残差动作模型补偿动力学不匹配,再在调整后仿真中微调预训练策略。

训练方式

第一阶段仿真 mocap 跟踪,第二阶段真实数据残差建模和微调。

观测 / 动作 / 奖励

参考运动 + 本体感受;动作为基线动作加残差。

策略架构

HumanoidVerse 模块化训练,PPO/DAgger 可组合。

随机化 / Sim-to-Real

残差动作显式对齐现实动力学,优于单纯 SysID 或广泛随机化。

评判指标

真实 G1 跟踪精度、sim-to-real 成功率。

重点难点与解决方案

真实数据成本和残差泛化是难点;通过增量学习把差距限制在动作修正层。

BeyondMimic

维度

要点

分类定位

从运动跟踪到通用控制的两阶段框架。

核心创新

第一阶段用紧凑奖励和紧凑随机化训练数百技能;第二阶段用潜在扩散、状态-动作共扩散和引导扩散实现零样本任务组合。

训练方式

阶段一 PPO 跟踪;阶段二 VAE/LDM 学习技能分布,推理时用目标梯度引导。

观测 / 动作 / 奖励

跟踪阶段用锚点中心相对姿态;生成阶段条件为任务目标、关键帧或命令。

策略架构

RL tracker + latent diffusion model。

随机化 / Sim-to-Real

只随机化摩擦、恢复系数、默认关节位置和质心等紧凑项。

评判指标

新任务零样本、运动自然度、高动态动作硬件演示。

重点难点与解决方案

难点是扩散生成动作必须物理可执行;用第一阶段 tracker 数据训练状态-动作共扩散降低不可执行性。

OmniXtreme

维度

要点

分类定位

高动态统一控制,解决通用性障碍。

核心创新

流匹配基础策略预训练 + 执行器感知后训练;功率安全正则化、扭矩-速度约束和激进随机化用于真实高动态动作。

训练方式

每个运动先训练专家,DAgger + flow matching 蒸馏成统一基础策略;冻结基础策略后训练残差 MLP。

观测 / 动作 / 奖励

动作分布由流匹配生成,残差策略修正硬件可执行性。

策略架构

Flow Matching policy + residual MLP。

随机化 / Sim-to-Real

后训练中强随机化、执行器包络、负机械功率惩罚。

评判指标

真实 G1 24 种极端运动、总成功率、过流/热保护事件。

重点难点与解决方案

高动态动作在仿真可行但真实过流;通过功率安全和执行器约束把控制目标从“像”推进到“硬件能承受”。

SONIC / UMR 相关路线

维度

要点

分类定位

规模化运动跟踪基础模型。

核心创新

用统一运动重定向数据和大规模 tracking 训练验证机器人参考轨迹质量;强调运动跟踪作为 foundation task。

训练方式

大规模运动集合训练,可接 SMPL 编码器或机器人参考轨迹。

观测 / 动作 / 奖励

多运动目标、潜在运动编码、本体感受。

策略架构

大容量 tracker,可与通用 token/representation 结合。

随机化 / Sim-to-Real

以数据质量和大规模训练提升泛化;随机化依具体实现。

评判指标

大规模测试集跟踪误差、OOD 运动效果。

重点难点与解决方案

难点是数据规模和质量;统一重定向把人类运动变成机器人可训练参考。

FAST

维度

要点

分类定位

通用基础策略 + 快速残差适配。

核心创新

质心感知基础策略结合 Parseval/KL 残差适配,对新动作分布快速特化。

训练方式

先训练基础策略,再训练轻量残差适配器。

观测 / 动作 / 奖励

基础观测 + 新动作目标;残差修正动作。

策略架构

Base policy + adapter/residual module。

随机化 / Sim-to-Real

强调适配效率,随机化不是核心卖点。

评判指标

新动作适配样本效率、基础能力保持、真实执行。

重点难点与解决方案

路线容易与其他 adapter 方法趋同;关键创新方向是把可恢复性显式注入先验或奖励。

LIFT

维度

要点

分类定位

大规模预训练与高效微调桥接。

核心创新

SAC 大规模预训练获得零样本能力,随后用物理信息 world model 做安全高效微调。

训练方式

阶段一离策略 SAC 预训练;阶段二模型内随机探索、真实环境确定性执行。

观测 / 动作 / 奖励

本体状态和任务命令;世界模型结合拉格朗日动力学和残差预测。

策略架构

SAC + physics-informed world model。

随机化 / Sim-to-Real

通过模型内探索降低真实微调风险。

评判指标

零样本部署、微调样本效率、真实安全性。

重点难点与解决方案

PPO 微调样本效率低;SAC 的 replay 和随机策略更适合预训练-微调流程。

SoftMimic

维度

要点

分类定位

柔顺全身控制,不盲目最小化跟踪误差。

核心创新

通过柔顺运动增强和刚度调制,让机器人可控地偏离参考以响应外力。

训练方式

离线生成柔顺响应轨迹,在线 RL 学习同时跟踪参考和柔顺目标。

观测 / 动作 / 奖励

本体感受 + 非柔顺参考 + 外力导致的状态变化;奖励匹配柔顺响应。

策略架构

RL tracker,隐式推断外力。

随机化 / Sim-to-Real

关注交互安全,随机化服务于外力和环境变化。

评判指标

外力响应、任务泛化、可调刚度、安全性。

重点难点与解决方案

传统 tracking 过硬;SoftMimic 把“软硬程度”作为可控行为维度。

4.3 遥操作、视频模仿与数据管线

H2O

维度

要点

分类定位

Human-to-Humanoid 实时全身遥操作基础框架。

核心创新

Sim-to-Data 流程:将 AMASS 重定向到人形,训练特权模仿器筛掉不可行序列,得到机器人可行运动库。

训练方式

特权策略筛数据,真实可得观测训练控制器。

观测 / 动作 / 奖励

本体感受 + 8 个身体部位目标;动作是关节目标。

策略架构

RL tracker。

随机化 / Sim-to-Real

摩擦、质量、COM、PD、扭矩噪声、延迟、地形等广泛随机化。

评判指标

遥操作成功率、真实动态动作、抗扰动。

重点难点与解决方案

单 RGB 姿态估计有延迟和误差;Sim-to-Data 用策略可行性筛选降低无效数据。

OmniH2O

维度

要点

分类定位

多模态人到人形遥操作和自主控制。

核心创新

用头部和双手三点稀疏目标作为通用接口,统一 VR、RGB、语音/大模型高层控制;发布 OmniH2O-6 数据集。

训练方式

教师-学生 + DAgger;遥操作演示再用于扩散策略/LfD。

观测 / 动作 / 奖励

稀疏 3 点目标 + 本体感受;不需要全局线速度。

策略架构

特权教师、学生策略、扩散策略用于高层演示学习。

随机化 / Sim-to-Real

Sim-to-real 流水线依赖重定向增强和蒸馏。

评判指标

远程操作跟踪精度、自主任务成功率。

重点难点与解决方案

稀疏输入欠约束;通过大规模数据、课程和教师学生学习生成合理全身运动。

HumanPlus

维度

要点

分类定位

低成本影子模式和高级模仿学习系统。

核心创新

用低级 Humanoid Shadowing Transformer 跟踪人类姿态,在线收集 egocentric 数据;高级 HIT 通过 BC 学自主技能,并用前向动力学预测正则化。

训练方式

低级策略用 AMASS + PPO;高级策略用 shadowing 数据行为克隆。

观测 / 动作 / 奖励

单目 RGB 人体/手部姿态、机器人自我视觉、本体感受。

策略架构

低级 tracker + 解码器-only Transformer 高级策略。

随机化 / Sim-to-Real

低级策略零样本迁移,数据来自真实 shadowing。

评判指标

任务成功率、数据收集成本、泛化。

重点难点与解决方案

固定重定向和遮挡是难点;影子模式绕过高保真仿真视觉和软物体建模。

TWIST

维度

要点

分类定位

全身遥操作与模仿学习系统。

核心创新

离线/在线重定向结合,教师拥有未来 2 秒参考帧,学生用 RL+BC 学当前帧可部署控制。

训练方式

PPO 教师 -> RL+BC 学生;少量在线动捕数据弥合分布偏移。

观测 / 动作 / 奖励

教师未来参考,学生本体感受 + 当前参考;KL 到教师。

策略架构

Teacher-student,RL+BC。

随机化 / Sim-to-Real

末端执行器扰动训练提高接触鲁棒性;真实 OptiTrack 部署。

评判指标

延迟、真实 G1/Booster T1 操控、跨形态泛化。

重点难点与解决方案

纯 RL 保守,纯 BC 泛化弱;RL+BC 兼顾探索和平滑。

TWIST2

维度

要点

分类定位

便携、低成本、全身数据采集系统。

核心创新

VR 追踪器 + 主动视觉颈部 + GMR 重定向 + 通用运动跟踪器,摆脱固定光学动捕实验室。

训练方式

便携遥操作采集数据,再训练分层视觉运动策略。

观测 / 动作 / 奖励

VR/脚踝追踪、ZED 视觉、本体感受、全身目标。

策略架构

低层通用 tracker + 高层 visuomotor policy。

随机化 / Sim-to-Real

真实采集为主,低层策略需 sim-to-real。

评判指标

设置时间、采集吞吐量、复杂移动操作成功率。

重点难点与解决方案

便携性和全身精度存在冲突;主动视觉和整体重定向增强长视距任务能力。

VideoMimic

维度

要点

分类定位

从随手单目视频学习场景条件全身技能。

核心创新

真实到仿真到真实:联合人体和场景重建,四阶段策略学习,部署时只用本体感受和 11x11 高度图。

训练方式

MoCap 预训练 -> 场景条件跟踪 -> DAgger 蒸馏 -> 欠条件 RL 微调。

观测 / 动作 / 奖励

训练含重建地形和视频参考;部署用高度图、本体和摇杆命令。

策略架构

场景条件教师 + 学生蒸馏。

随机化 / Sim-to-Real

真实 G1 用 LiDAR 建图;地形和感知噪声是主要迁移因素。

评判指标

楼梯、坐椅子、复杂地形成功率。

重点难点与解决方案

单目 4D 重建不稳定;MoCap 预训练和欠条件微调提高对噪声数据的鲁棒性。

GenMimic

维度

要点

分类定位

从生成视频到物理可行机器人动作。

核心创新

两阶段像素到 4D 人体再到机器人动作;加权关键点奖励和对称性损失增强跟踪。

训练方式

4D 人体重建/重定向 -> 教师 RL -> DAgger 学生。

观测 / 动作 / 奖励

关键点目标、本体感受;末端关键点权重更高。

策略架构

Teacher-student。

随机化 / Sim-to-Real

摩擦、质量、PD、延迟、外部冲击随机化。

评判指标

GenMimicBench、VSR、真实 G1 简单动作成功率。

重点难点与解决方案

生成视频动作可能物理不可行;通过加权关键点和对称约束提升可执行映射。

ZeroWBC

维度

要点

分类定位

从第一人称视频到零样本全身控制。

核心创新

VQ-VAE 运动令牌化 + VLM 微调生成动作 token,再用课程式通用 tracker 执行。

训练方式

两阶段:多模态运动生成,通用运动跟踪。

观测 / 动作 / 奖励

VLM 输入视频/语言,输出运动 token;tracker 用多尺度未来运动目标。

策略架构

Qwen2.5-VL + VQ-VAE + asymmetric actor-critic tracker。

随机化 / Sim-to-Real

真实任务零样本,跟踪器需处理生成运动分布。

评判指标

FID、R-Precision、MPJPE、真实任务成功率。

重点难点与解决方案

VLM 延迟和力反馈缺失;解耦生成与跟踪让系统可扩展但实时性受限。

HuMI

维度

要点

分类定位

机器人免接触的全身操控数据采集与学习。

核心创新

人在环运动学适配,操作者实时看虚拟机器人可行性;高层扩散策略生成关键点轨迹,低层 RL 跟踪。

训练方式

采集 robot-free demonstrations -> diffusion high-level -> RL low-level。

观测 / 动作 / 奖励

腕部摄像头图像到目标关键点动作块;低层跟踪目标位姿。

策略架构

分层策略:Diffusion Policy + RL tracker。

随机化 / Sim-to-Real

真实演示数据为核心,低层控制器在仿真中训练再部署。

评判指标

数据吞吐量、接受率、任务成功率、未见环境泛化。

重点难点与解决方案

人体动作和机器人运动学差距;人在环 IK 预览让数据采集阶段就规避不可行动作。

HumanX / XGen / XMimic

维度

要点

分类定位

从单目视频编译交互技能的全栈框架。

核心创新

物理先验优于精确重建;XGen 合成多样物体交互数据,XMimic 统一模仿学习,无需任务特定奖励。

训练方式

视频人体提取 -> GMR 重定向 -> 接触/非接触阶段物体轨迹合成 -> 模仿策略训练。

观测 / 动作 / 奖励

人-物关系、接触阶段锚点、机器人本体和物体状态。

策略架构

数据生成管线 + 统一模仿策略。

随机化 / Sim-to-Real

零样本部署到 G1,支持 NEP 和 MoCap 模式。

评判指标

多领域 10 种技能成功率、泛化倍数。

重点难点与解决方案

精确重建难且脆弱;通过物理先验数据增强优先保证可执行和泛化。

4.4 恢复、跌倒安全与鲁棒执行

Learning to Get Up / HumanUP

维度

要点

分类定位

跨形态零样本起身恢复。

核心创新

训练单一恢复策略覆盖多种人形形态,证明形态多样性可带来未见机器人零样本恢复。

训练方式

CrossQ/DRL 在多机器人形态上训练。

观测 / 动作 / 奖励

姿态、关节、速度、本体历史;动作为关节目标。

策略架构

统一策略而非每形态专家。

随机化 / Sim-to-Real

形态随机化和留一法验证。

评判指标

未见形态成功率、恢复时间。

重点难点与解决方案

不同尺寸/质量/比例机器人动作差异大;连续重叠形态空间覆盖提升泛化。

HOST

维度

要点

分类定位

从多姿态站起的强化学习框架。

核心创新

多评论家、多地形、力课程、动作缩放器和 L2C2 平滑正则化,让 G1 从坐/卧/斜坡等姿态起身。

训练方式

PPO 从零学习,无需预定义轨迹。

观测 / 动作 / 奖励

本体感受和地形/姿态相关状态;奖励拆分到多个 critic。

策略架构

Multi-critic actor-critic。

随机化 / Sim-to-Real

域随机化,真实零样本部署。

评判指标

四类地形成功率、抗冲击、负载和湿滑斜坡鲁棒性。

重点难点与解决方案

起身探索极难;向上拉力课程降低探索门槛,动作缩放防止暴力动作。

FRASA

维度

要点

分类定位

端到端摔倒恢复和站立 agent。

核心创新

用简洁状态、速度级动作和 Cross-Q 快速训练,实现小型人形机器人快速起身。

训练方式

Cross-Q/SAC 变体训练,13-37 分钟完成。

观测 / 动作 / 奖励

s_t=[q,qdot,q_desired,θ,θdot,a历史];动作为 qdot_desired。

策略架构

两层 MLP 策略。

随机化 / Sim-to-Real

关节偏移、质量、COM、摩擦、电压、阻尼和摩擦损失随机化。

评判指标

站立速度、恢复速度、真实震颤情况。

重点难点与解决方案

对称性简化提高效率但限制侧向干扰;需要人工选择行为候选。

SafeFall

维度

要点

分类定位

跌倒预测与损伤缓解框架。

核心创新

正常时只运行 GRU 预测器,不干扰标称控制;不可避免跌倒时切换到保护策略。

训练方式

先生成跌倒轨迹训练预测器,再两阶段课程训练 PPO 保护策略。

观测 / 动作 / 奖励

IMU、关节编码器、投影重力、历史 5 帧;动作为 29 关节目标位置。

策略架构

GRU predictor + PPO policy + asymmetric critic。

随机化 / Sim-to-Real

复现传感噪声、外力、脚滑、脚绊、延迟、动态不匹配。

评判指标

提前预警时间、误报率、峰值扭矩/接触力降低、真实跌倒保护。

重点难点与解决方案

不能让安全策略一直干扰任务;预测器-保护器分离降低正常操作影响。

FIRM

维度

要点

分类定位

统一摔倒缓解和恢复策略。

核心创新

少量人类演示 + 稀疏关键帧增强 + 后轨迹拼接 + 扩散自适应记忆,统一预防、缓冲和恢复。

训练方式

阶段一技能先验学习,阶段二把多模态轨迹蒸馏成扩散策略并用在线 adapter 检索目标。

观测 / 动作 / 奖励

本体状态到关键帧目标;奖励含跟踪、风格和损伤降低。

策略架构

PPO policy + diffusion memory + adapter/codebook。

随机化 / Sim-to-Real

测试未见扰动和地形;依赖本体感觉。

评判指标

平地/光滑地/负载/不平地恢复成功率。

重点难点与解决方案

密集轨迹跟踪太死板;稀疏关键帧让机器人按自身形态探索更安全的缓冲和恢复。

KungFuAthlete

维度

要点

分类定位

高动态运动跟踪与自主摔倒恢复统一策略。

核心创新

低动能采样避免从不可恢复动态状态开始;DGRSI 通过自由落体生成摔倒初始状态;混合奖励统一跟踪和恢复。

训练方式

端到端训练单一策略,失败归因到锚点并提高采样权重。

观测 / 动作 / 奖励

运动参考、本体状态、恢复状态;奖励含物理稳定跟踪和恢复控制。

策略架构

FastSAC/高效 RL 路线。

随机化 / Sim-to-Real

摔倒初始状态随机化、重力自由落体数据增强。

评判指标

高动态动作成功率、摔倒后恢复率、任务续行。

重点难点与解决方案

BeyondMimic 跌倒后无法恢复;把恢复作为策略内能力而非失败后的独立模块。

4.5 动态对象交互与竞技任务

Humanoid Badminton

维度

要点

分类定位

真实世界人形机器人羽毛球,多阶段 RL。

核心创新

三阶段课程:步法获取、精确挥拍、任务聚焦优化;提出无预测变体。

训练方式

S1 学移动稳定,S2 引入稀疏击球奖励,S3 去除步态正则聚焦击球。

观测 / 动作 / 奖励

球轨迹/EKF 预测、机器人本体、击球目标;动作由全身策略输出。

策略架构

PPO + asymmetric critic + PD。

随机化 / Sim-to-Real

中等域随机化,零样本迁移。

评判指标

真实击球成功率、回球速度、连续对打次数、预测误差。

重点难点与解决方案

步法和挥拍强耦合;分阶段课程先学到位再学击球,降低稀疏奖励探索难度。

LATENT

维度

要点

分类定位

从非完美人体数据学习网球技能。

核心创新

可纠正潜在动作空间、潜在动作屏障、混合控制和可学习条件先验,允许高层修正不完美演示。

训练方式

采集技能片段 -> 训练 tracker 构建 latent space -> 高层策略修正组合。

观测 / 动作 / 奖励

高层输出潜在动作控制身体大部分关节,并直接修正右手腕。

策略架构

低层 Any2Track tracker + 高层 PPO policy。

随机化 / Sim-to-Real

真实 G1 与人/机器人对打,依赖光学动捕。

评判指标

连续回合、真实对打、与 PPO/AMP/ASE/PULSE 对比。

重点难点与解决方案

人体演示不完美且手腕必须精确;潜在动作屏障防止策略钻空子产生抖动动作。

HITTER

维度

要点

分类定位

人形机器人乒乓球分层规划与学习。

核心创新

高层模型规划球轨迹和虚拟击球平面,低层 RL 全身控制器执行类人击球。

训练方式

模型参数估计 + PPO 低层控制,正/反手视频参考。

观测 / 动作 / 奖励

球位置速度、虚拟击球目标、机器人本体;奖励含模仿、正则和稀疏击球。

策略架构

Model-based planner + RL whole-body controller。

随机化 / Sim-to-Real

真实 OptiTrack;零样本部署到真实 G1。

评判指标

击球率、返回率、连续对打拍数、预测误差。

重点难点与解决方案

高速球需要长期预测;分层架构把精确球路规划和鲁棒全身执行分离。

InterReal

维度

要点

分类定位

统一人-物交互物理模仿框架。

核心创新

HOI 运动增强、自动奖励学习器、非对称 actor-critic,用元学习自动调整奖励权重。

训练方式

SMPL/OMOMO 预处理 -> 物理验证 -> HOI 增强 -> PPO 内循环 + SAC 外循环奖励学习。

观测 / 动作 / 奖励

物体位置特征、交互图、机器人本体;critic 有物体速度/旋转等特权信息。

策略架构

PPO actor-critic + SAC meta reward learner。

随机化 / Sim-to-Real

MuJoCo sim-to-sim,再用 FoundationPose 部署到真实 G1。

评判指标

搬箱、推箱成功率,对 ASAP/InterMimic 基线。

重点难点与解决方案

HOI 奖励手工调参困难;自动奖励学习根据关键误差变化率调整奖励重点。

HumanX

维度

要点

分类定位

从单目人类视频到敏捷交互技能。

核心创新

XGen 以物理先验合成接触/非接触物体轨迹,XMimic 用扰动初始化和交互终止训练泛化策略。

训练方式

单视频 -> 多样交互数据 -> 统一模仿训练。

观测 / 动作 / 奖励

人-物锚点、物体状态、机器人本体,可无外部感知或 MoCap。

策略架构

数据合成 + imitation/RL policy。

随机化 / Sim-to-Real

Unitree G1 零样本部署,覆盖篮球、足球、羽毛球、搬运、格斗。

评判指标

10 种技能泛化成功率。

重点难点与解决方案

单视频数据太少;通过物体几何和轨迹增强扩展分布。

4.6 Sim-to-Real、在线适应与无监督基础模型

PACE

维度

要点

分类定位

系统化 sim-to-real 与执行器/能耗建模。

核心创新

用悬空扫频真实数据、CMA-ES 识别紧凑动力学参数;不随机化已识别参数;引入 PMSM 能耗模型和 CoT。

训练方式

真实数据采集 -> 参数辨识 -> 在拟合仿真中训练 -> 零样本部署。

观测 / 动作 / 奖励

速度命令、本体状态;奖励含速度跟踪、能耗、碰撞、足端触地速度。

策略架构

RL locomotion policy。

随机化 / Sim-to-Real

只随机化任务/环境,不随机化已辨识动力学。

评判指标

CoT、真实速度跟踪、不同四足平台部署。

重点难点与解决方案

大范围随机化可能掩盖可测误差;PACE 先校准执行器和系统动力学,提高物理可解释性。

两阶段系统辨识 / Projected Universal Policy

维度

要点

分类定位

早期双足 sim-to-real 的实用辨识路线。

核心创新

pre-sysID 用真实通用轨迹估计参数边界,训练条件通用策略;post-sysID 用少量真实任务测试选择潜在条件。

训练方式

pre-sysID -> domain randomization -> projected universal policy -> Bayesian post-sysID。

观测 / 动作 / 奖励

策略以低维潜变量表示动力学条件。

策略架构

Universal policy + latent projection。

随机化 / Sim-to-Real

随机化范围来自真实辨识,不是盲目设定。

评判指标

Darwin OP2 真实行走、少样本选择效果。

重点难点与解决方案

任务相关真实轨迹训练前不可得;先找 useful bounds,部署时再用真实任务选策略条件。

Any2Track / AnyTracker / AnyAdapter

维度

要点

分类定位

任意运动跟踪与任意扰动适应的双阶段框架。

核心创新

把表达性 tracking 和扰动适应解耦:AnyTracker 在无动力学随机化下学习干净运动,AnyAdapter 冻结 tracker 后用历史和 world model 学适应。

训练方式

阶段一 specialist-to-generalist tracker;阶段二 adapter + dynamics randomization。

观测 / 动作 / 奖励

AnyTracker 用本体状态和下一帧目标,动作是 residual PD;AnyAdapter 用历史状态动作编码。

策略架构

Frozen base policy + zero-initialized adapters + dynamics-aware world model。

随机化 / Sim-to-Real

适应阶段随机化复杂地形、外力、摩擦、质量、COM。

评判指标

运动跟踪精度、扰动下成功率、真实 G1 部署。

重点难点与解决方案

随机化会损伤动作表达;adapter 把鲁棒性作为附加能力,保护基础 tracker。

LSWM

维度

要点

分类定位

长短时世界模型增强双足运动。

核心创新

SRM 重建短时特权状态,SPM 预测未来短时特权状态,同时利用长历史和短历史。

训练方式

SRM/SPM 与策略在一个 asymmetric actor-critic 框架中联合优化。

观测 / 动作 / 奖励

长时历史 noisy observation,输出隐式状态和未来趋势。

策略架构

State reconstruction + state prediction + PPO。

随机化 / Sim-to-Real

面向复杂地形和传感噪声,未扩展到全身。

评判指标

楼梯成功率、噪声鲁棒性。

重点难点与解决方案

仅靠历史重建当前不够;预测未来趋势改善台阶等高度突变环境决策。

BFM-Zero

维度

要点

分类定位

无监督 RL 行为基础模型。

核心创新

用前向-后向表示学习共享潜在空间 Z,通过 reward/goal/motion prompt 实现零样本任务。

训练方式

无监督预训练 -> 零样本推理 -> 少样本潜空间适应。

观测 / 动作 / 奖励

运动数据正则 + 仿真交互;潜在向量条件策略。

策略架构

Forward-backward representation、潜在条件判别器、辅助 critic、历史条件策略。

随机化 / Sim-to-Real

非对称训练、域随机化、判别器奖励和辅助正则。

评判指标

运动跟踪、目标到达、奖励优化、真实 zero-shot。

重点难点与解决方案

不为单任务设计奖励,但行为边界受数据集限制;潜空间质量决定可提示能力。

UFO / TeCH

维度

要点

分类定位

开源无监督人形控制框架与时间距离算法。

核心创新

UFO 提高 BFM 训练效率并支持多算法;TeCH 用对比学习建模时间可达性,奖励为朝潜在目标的距离进度。

训练方式

在线交互、经验回放、多目标优化;UFO-FB 和 UFO-TeCH 可切换。

观测 / 动作 / 奖励

状态/目标编码到潜在空间,策略以潜在目标为条件。

策略架构

分布式训练 + mjlab + 多 critic;TeCH 对比表征。

随机化 / Sim-to-Real

支持多机器人配置和技能注入。

评判指标

训练时间、目标到达、轨迹跟踪、遥操作、快速恢复。

重点难点与解决方案

无监督策略可能不自然或不安全;判别/正则和技能注入把探索限制到类人可用行为。

五、重点难点与典型解决方案

难点

表现

代表解决方案

相关框架

高动态动作不可执行

空翻、旋转、落地在仿真成功但真实过流/摔倒

执行器包络、功率安全正则、低动能采样、残差后训练

OmniXtreme、KungFuAthlete、PACE

长尾动作和数据冲突

统一策略平均化,动作风格丢失

MoE/OMoE、专家到通才、运动聚类、自适应采样

GMT、VMS、BumbleBee、ExBody2

视频/生成动作噪声

人体重建漂移、接触错、尺度不准

MoCap 预训练、物理先验合成、加权关键点、场景联合优化

VideoMimic、GenMimic、HumanX

Sim-to-Real gap

仿真跟踪好,真实延迟、摩擦、执行器不同

系统辨识、紧凑/强随机化、残差动作、adapter、world model

PACE、ASAP、Any2Track、RMA

恢复和任务断裂

跌倒后 episode 结束,真实任务无法续行

把恢复纳入策略目标,跌倒预测切换,关键帧恢复记忆

KungFuAthlete、SafeFall、FIRM、HOST

稀疏任务奖励探索

击球、搬运、起身早期难以成功

多阶段课程、辅助扳手、力课程、模型规划

Badminton、HOST、ZEST、HITTER

观测不可部署

训练需要接触力、精确物体位姿、真实速度

非对称 actor-critic、教师学生蒸馏、DAgger

OmniH2O、GMT、InterReal、SafeFall

动作抖动与硬件寿命

高频动作、脚滑、过大制动功率

动作平滑、L2C2、Lipschitz、功率/能耗模型

HOST、Smooth、OmniXtreme、PACE

泛化评估不足

视频好看但缺少 OOD 指标

标准化测试集、留一法、真实扰动测试、任务成功率

Learning to Get Up、BFM-Zero、ZeroWBC

工程建议

  1. 如果目标是单一动作真实部署,优先采用 ZEST/DeepMimic 式极简单阶段跟踪,加中等随机化和执行器建模。
  2. 如果目标是多运动库,优先采用 GMT/VMS/ExBody2 式数据筛选、自适应采样、MoE 或通才-专才流程。
  3. 如果目标是高动态极限动作,必须把执行器约束、负功率、扭矩-速度曲线和热/过流保护作为训练目标。
  4. 如果目标是遥操作数据闭环,先保证低层 tracker 稳定,再让高层 BC/diffusion 学任务;不要把所有问题交给端到端视觉策略。
  5. 如果目标是交互或竞技任务,采用分层规划或多阶段课程,把“到位”和“执行接触动作”拆开训练。
  6. 如果目标是真实长期运行,把恢复、安全和故障切换纳入系统,而不是只做 episode 级成功率。

六、教学公式速查

主题

公式

MDP/POMDP

s_{t+1} ~ p(s_{t+1}|s_t,a_t,ξ),  o_t=h(s_t),  a_t~π_θ(a_t|o_t)

折扣回报

J(θ)=E_{τ~π_θ}[Σ_t γ^t r_t]

GAE

A_t=Σ_{l=0}^{∞}(γλ)^l δ_{t+l},  δ_t=r_t+γV(s_{t+1})-V(s_t)

PPO clip

L^CLIP(θ)=E[min(r_t(θ)A_t, clip(r_t(θ),1-ε,1+ε)A_t)]

SAC 最大熵

J(π)=Σ_t E[r(s_t,a_t)+α H(π(·|s_t))]

BC

L_BC=E[||π_θ(o)-a^*||_2^2]

DAgger

D ← D ∪ {(o_t,π_E(o_t)) | o_t~π_i};  π_{i+1}=argmin_π E_D[L(π(o),a_E)]

模仿奖励

r_imit=Σ_i w_i exp(-α_i ||e_i||^2)

姿态误差

e_pose=Σ_j ||q_j ⊖ q_j^ref||^2

末端误差

e_ee=Σ_k ||x_k-x_k^ref||^2

PD 控制

τ=K_p(q_des-q)-K_d qdot

残差动作

q_des=q_ref+s⊙a_t

MoE 动作

a=Σ_i g_i(o)c_i(o),  Σ_i g_i=1

功率安全

L_power=λ max(0,-τ·qdot-P_dead)^2

能耗

E≈Σ_t [P_Joule + max(τ·qdot,0) + η_reg min(τ·qdot,0)]Δt

CoT

CoT=E/(mgd)

系统辨识

ξ*=argmin_ξ Σ_t ||y_t^real-y_t^sim(ξ)||^2

域随机化

max_θ E_{ξ~p(ξ)}[J(θ;ξ)]

TeCH 进度奖励

r_TeCH=||z-zbar(s_t)||^2-||z-zbar(s_{t+1})||^2

潜在动作屏障

d_M(z)=sqrt((z-μ)^TΣ^{-1}(z-μ));  penalize max(0,d_M(z)-β)

七、结论:如何理解这一领域的演化

这批框架的演化可以概括为:从“跟踪一段动作”走向“构建可复用的全身控制基座”,再走向“可从视频、语言、遥操作和物理交互中持续扩展的真实机器人系统”。DeepMimic 给出了奖励与训练技巧的原型;GMT、VMS、ExBody2、SONIC 把它扩展到多运动集合;BeyondMimic、OmniXtreme、BFM-Zero、UFO 把策略推向生成式或无监督基础模型;H2O、OmniH2O、HumanPlus、TWIST、VideoMimic、HumanX 则解决数据来源问题;SafeFall、FIRM、HOST、KungFuAthlete 补上真实部署不可缺少的恢复和安全能力。

教学时最重要的不是背每个框架名字,而是抓住五个问题:参考动作从哪里来,参考动作是否物理可执行,策略训练时看到了什么,真实部署时缺了什么,以及硬件失败模式是否被写进奖励、随机化或系统架构。能回答这五个问题,就能判断一个新框架的创新到底是数据、奖励、架构、训练流程、Sim-to-Real,还是工程系统集成。

公式为教学归纳形式,部分是文献常用表达,部分是为了统一比较而重写的抽象形式;具体实现应以对应论文和代码为准。

八、算法底层原理专题:从名字到机制

前文按框架总结了方法谱系。本节把其中反复出现的算法拆到底层原理:每个算法解决什么问题、优化目标是什么、为什么适合人形机器人,以及工程上最容易踩的坑。理解这些机制后,再看 ExBody2、GMT、VMS、OmniH2O、BeyondMimic、OmniXtreme、Any2Track、UFO 等框架,会更容易判断其真正创新点。

8.1 算法地图

算法族

核心问题

典型框架

一句话原理

行为克隆 BC

从专家数据直接学动作

HumanPlus、HuMI、TWIST 高层策略

把控制问题变成监督学习,最小化策略动作和专家动作距离。

DAgger

缓解 BC 的分布偏移

OmniH2O、GMT、VMS、ExBody2

让学生自己跑到会犯错的状态,再请教师标注这些状态。

师生学习

训练时可用特权信息,部署时不能用

GMT、VMS、OmniH2O、SafeFall、InterReal

教师看完整状态学强策略,学生只看真实可得观测模仿教师。

RL+BC

兼顾 RL 泛化和 BC 平滑

TWIST

同一学生同时最大化奖励并贴近教师动作。

聚类/专家到通才

多运动数据冲突

BumbleBee、ExBody2

先按运动模式分组训练专家,再蒸馏成统一策略。

MoE / OMoE

单网络容量不足

GMT、VMS

门控网络按状态动态组合多个专家输出。

PPO

稳定在线策略优化

DeepMimic、GMT、HOST、Badminton

限制新旧策略比值,避免一次更新过大。

SAC / FastSAC

高样本效率和快速训练

LIFT、FRASA、FastSAC、InterReal 外循环

最大熵离策略 RL,用回放缓冲复用经验。

扩散策略

多模态动作生成

BeyondMimic、FIRM、HuMI

从噪声逐步去噪生成动作序列或未来轨迹。

流匹配

更快的生成式策略

OmniXtreme

学习从噪声分布到专家动作分布的连续速度场。

VAE/VQ-VAE/CVAE

压缩运动或保持多样性

BeyondMimic、ZeroWBC、UniTracker

把高维连续运动映射到低维潜变量或离散 token。

系统辨识

让仿真更像真实

PACE、两阶段 SysID、ASAP

优化物理参数,使仿真轨迹贴近真实轨迹。

域随机化

让策略对未知误差鲁棒

H2O、SafeFall、FastSAC、AnyAdapter

训练时随机化动力学/传感/环境参数。

Adapter / World Model

在线适应动态变化

Any2Track、LSWM、LIFT

用历史推断隐式动力学上下文,再调节基础策略。

对抗模仿 / 判别器奖励

让无监督或 RL 行为更像人类

AMP、BFM-Zero

判别器区分人类数据和策略数据,其输出转成奖励。

无监督 RL 表示

不为每个任务重训

BFM-Zero、UFO/TeCH

预训练可提示的潜在行为空间,测试时用目标或奖励提示策略。

安全过滤 / CBF

保证约束不被动作破坏

CBF 模仿、安全人到人形模仿

把策略动作投影到满足安全约束的可行动作集合。

8.2 模仿学习:BC、DAgger、师生学习与 RL+BC

行为克隆 BC

维度

内容

解决的问题

当有专家演示数据 D={(o_i,a_i^*)} 时,直接学习从观测到动作的映射。

底层原理

BC 本质是监督学习。它不关心动作执行后的长期后果,只要求当前观测下输出接近专家动作。优点是简单稳定,缺点是策略一旦因为小误差进入专家数据没有覆盖的状态,就会继续犯错。

核心公式

L_BC(θ)=E_{(o,a*)~D}[||π_θ(o)-a*||_2^2] 或 E[-log π_θ(a*|o)]

在人形框架中的用法

高层 visuomotor policy、遥操作演示学习、扩散策略训练前的动作数据拟合都可以看作 BC 或条件生成式 BC。

常见坑与修正

最大问题是 covariate shift。单步误差 ε 会沿轨迹累积,长时任务中错误状态越来越偏离数据分布。修正方法包括 DAgger、噪声注入、数据增强、闭环 RL 微调和动作块预测。

DAgger:Dataset Aggregation

维度

内容

解决的问题

解决 BC 只在专家状态分布上训练、部署却在学生状态分布上运行的问题。

底层原理

DAgger 让当前学生策略上机或进仿真滚动,收集学生实际会遇到的观测 o_t,再让教师/专家给出标签 a_t^E,把这些新数据并入训练集。这样训练分布逐步靠近部署分布。

核心公式

D_{k+1}=D_k ∪ {(o_t,π_E(o_t)) | o_t~π_k};  π_{k+1}=argmin_π E_{D_{k+1}}[L(π(o),a_E)]

在人形框架中的用法

OmniH2O、GMT、VMS、ExBody2 等用 DAgger 把特权教师蒸馏为只用本体和历史观测的学生。

常见坑与修正

如果教师动作本身不光滑,学生也会学到抖动;如果学生容量不足,多样动作会被平均化。常见修正是 RL+BC、随机策略蒸馏、CVAE、多专家或分阶段蒸馏。

师生学习 / 特权学习

维度

内容

解决的问题

训练时仿真器能提供接触力、真实速度、摩擦、物体精确位姿等特权信息,但真实部署不能用。

底层原理

先训练教师 π_T(a|x,c),其中 x 是完整状态或未来参考;再训练学生 π_S(a|o,c),其中 o 是真实可得观测。教师负责学会高质量行为,学生负责把行为压缩到可部署输入上。

核心公式

L_distill=E[||μ_S(o)-μ_T(x)||^2] + β D_KL(π_S(.|o)||π_T(.|x))

在人形框架中的用法

教师常见于运动跟踪、恢复和交互任务:critic 或 teacher 看接触和完整状态,部署 actor/student 只看 IMU、关节编码器、高度图或稀疏目标。

常见坑与修正

三类失败最常见:学生缺少关键信息导致不可辨识;教师依赖真实不可得变量导致蒸馏困难;学生学到平均动作导致动作多样性下降。解决方向是历史观测、状态估计器、world model、MoE、CVAE 和在线数据聚合。

RL+BC 混合训练

维度

内容

解决的问题

纯 BC 平滑但泛化弱;纯 RL 能探索但动作可能抖动、保守或不自然。

底层原理

把 RL 的长期奖励目标和 BC/KL 的动作约束放在同一个优化目标里。早期 λ 大,让学生贴近教师;后期 λ 变小,让 RL 奖励修正教师无法覆盖的状态。

核心公式

L(π)=L_RL(π)+λ D_KL(π||π_T),  通常 λ 随训练衰减

在人形框架中的用法

TWIST 用它训练学生,使学生既继承教师未来规划带来的平滑性,又能通过奖励在当前观测条件下修正误差。

常见坑与修正

λ 太大时学生只会模仿,遇到新状态不会恢复;λ 太小时退化为纯 RL,动作抖动和脚滑增加。应结合验证集跟踪误差和平滑指标调度 λ。

8.3 运动聚类、专家策略与通才蒸馏

多运动训练的核心困难是梯度冲突:跑步、舞蹈、起身、空翻、挥拍的最优动作分布差异很大,用一个 MLP 从头学,容易得到平均化的保守动作。聚类和专家-通才范式把数据先分块,让每个专家在相对一致的数据分布上学得更好,再把专家知识合并。

K-means:  min_{C_1,...,C_K, μ_1,...,μ_K} Σ_{k=1}^{K} Σ_{x_i∈C_k} ||x_i-μ_k||_2^2

Expert distillation:  L=E_{(o,c)~D_k}[||π_G(o,c)-π_{E_k}(o,c)||^2]

步骤

底层机制

在人形运动中的设计点

特征构造

把运动片段编码成固定维向量

可用关节角/速度、根速度、接触序列、末端轨迹、运动 token 或预训练 encoder embedding。

距离度量

衡量两个动作是否属于同一模式

直接欧氏距离会受时间相位影响;可用 DTW、相位对齐、统计特征或 latent embedding。

聚类

把动作分成 K 组

K 太小冲突仍大,K 太大专家数据不足;可用轮廓系数、验证成功率或人工语义调节。

专家训练

每组训练一个策略

专家可以更激进、更准确,但不能单独覆盖全部任务。

通才蒸馏

把专家动作压缩到一个策略

通才便于部署,但要防止专家差异被平均掉。

残差/适配

真实部署或新动作上做轻量修正

BumbleBee/ASAP/FAST 类方法常把残差作为最后一层修正。

聚类不是越复杂越好。教学上可强调三点:第一,聚类特征决定了专家学到什么语义;第二,聚类只是降低冲突,不等于解决 sim-to-real;第三,通才蒸馏是信息压缩,必须用验证集监控动作多样性是否下降。

8.4 MoE、正交 MoE 与门控网络

Mixture-of-Experts 把“训练多个专家”内化到一个网络中。门控网络 g(o,c) 根据当前状态和目标给每个专家分配权重,最终动作是专家输出的加权和。

g=softmax(W_g φ(o,c)),  a=Σ_{i=1}^{K} g_i a_i(o,c),  Σ_i g_i=1

Load-balance / entropy:  L_gate = -λ_H H(g) + λ_B Σ_i (mean_batch(g_i)-1/K)^2

Orthogonal MoE:  L_orth = Σ_{i≠j} ||h_i^T h_j||^2  或对专家特征做 Gram-Schmidt 正交化

概念

作用

风险

软门控

不同专家可平滑混合,适合连续动作过渡

可能所有样本都用同一个专家,发生专家塌缩。

硬门控

选择单个专家,解释性强

切换不连续,容易产生动作跳变。

正交专家

鼓励专家学习互补特征,VMS/OMoE 类方法使用

正交约束过强可能牺牲任务性能。

负载均衡

防止某个专家独占训练样本

过度均衡会强迫无关专家参与。

8.5 强化学习优化:PPO、SAC 与 FastSAC

PPO

维度

内容

解决的问题

高维连续控制中稳定更新策略,避免策略一步变化过大导致崩溃。

底层原理

PPO 用重要性采样比值 r_t(θ)=π_θ(a_t|s_t)/π_{old}(a_t|s_t) 衡量新旧策略差异,并用 clip 限制更新幅度。

核心公式

L_CLIP=E[min(r_t A_t, clip(r_t,1-ε,1+ε)A_t)]

在人形框架中的用法

DeepMimic、GMT、VMS、HOST、Badminton、HITTER 等大量框架使用 PPO,因为它在并行仿真和高维动作上稳定、实现成熟。

常见坑与修正

PPO 样本效率低,强随机化或稀疏奖励时训练慢;优势估计、奖励尺度、熵系数和 early termination 都会显著影响结果。

GAE:  A_t=Σ_{l=0}^{∞}(γλ)^l [r_{t+l}+γV(s_{t+l+1})-V(s_{t+l})]

SAC

维度

内容

解决的问题

提高样本效率,并通过熵项鼓励探索。

底层原理

SAC 是离策略最大熵 actor-critic。Critic 学 Q 值,Actor 最大化 Q 同时保持动作分布熵。Replay buffer 允许反复使用历史数据。

核心公式

J_π=E_{s~D,a~π}[α log π(a|s)-Q(s,a)],  y=r+γ(E_{a'~π}[Q(s',a')-α logπ(a'|s')])

在人形框架中的用法

LIFT 选择 SAC 做大规模预训练,FRASA/Cross-Q 和 FastSAC 也沿着离策略高效率方向发展。

常见坑与修正

离策略更高效但更难稳定;高维人形任务中 Q 值爆炸、分布偏移和归一化问题很常见,需要稳定 critic 技巧。

FastSAC / FlashSAC

维度

内容

解决的问题

让 SAC 在大规模并行人形控制中快速稳定训练。

底层原理

核心不是改一个公式,而是一组工程配方:大 replay buffer、大批次、低 UTD、稳定 critic、归一化、噪声重复和最小奖励设计。

核心公式

UTD=更新步数/环境步数;FastSAC 常用低 UTD 避免在非平稳数据上过拟合 critic

在人形框架中的用法

用于分钟级训练人形运动控制器或跟踪策略,挑战 PPO 在 sim-to-real 人形 RL 中的默认地位。

常见坑与修正

训练快不等于部署一定安全。强随机化能提高鲁棒性,也可能让动作保守;需要和跟踪误差、能耗、过流、脚滑等指标一起评估。

8.6 生成式策略:扩散、流匹配、VAE 与运动 token

Diffusion Policy / 潜在扩散

维度

内容

解决的问题

动作分布多峰时,单个高斯策略会平均化;扩散模型能表示多个合理动作模式。

底层原理

正向过程逐步给动作或轨迹加噪,反向网络学习去噪。条件 c 可以是观测、目标、语言、关键帧或任务奖励梯度。

核心公式

q(x_t|x_0)=sqrt(αbar_t)x_0+sqrt(1-αbar_t)ε;  L=E[||ε-ε_θ(x_t,t,c)||^2]

在人形框架中的用法

BeyondMimic 用潜在扩散组合已学技能;FIRM 把多模态恢复轨迹蒸馏进扩散记忆;HuMI 用扩散策略生成高层关键点动作块。

常见坑与修正

缺点是采样慢、实时控制难、生成结果未必物理可执行。常见解决是 latent diffusion、少步采样、动作块 receding horizon 和用 RL tracker 执行生成目标。

Classifier / objective guidance:  x_{t-1} ← x_{t-1} + η ∇_{x_t} R_task(x_t)

Flow Matching

维度

内容

解决的问题

保留生成式策略容量,同时比扩散去噪更快。

底层原理

在噪声 x_0 和数据 x_1 之间构造连续路径 x_t=(1-t)x_0+t x_1,网络学习该路径上的速度场 v_θ(x_t,t,c)。推理时积分 ODE 从噪声流向动作。

核心公式

L_FM=E_{t,x_0,x_1}[||v_θ(x_t,t,c)-(x_1-x_0)||^2]

在人形框架中的用法

OmniXtreme 用流匹配把多个专家动作分布蒸馏为统一基础策略,再用残差后训练处理真实硬件约束。

常见坑与修正

速度场学得不好会导致动作分布外插;高动态任务仍需执行器约束和后训练。

VAE / CVAE / VQ-VAE

维度

内容

解决的问题

压缩高维运动并保留多样性,或把连续运动离散化为 token。

底层原理

VAE 学编码器 q(z|x) 和解码器 p(x|z),用 KL 让潜变量服从简单先验;CVAE 加条件 c;VQ-VAE 把 z 量化到离散码本。

核心公式

L_VAE=E_q[-log p_θ(x|z)] + β KL(q_φ(z|x)||p(z));  z_q=e_k, k=argmin_j ||z_e-e_j||

在人形框架中的用法

BeyondMimic 的潜在扩散、ZeroWBC 的运动 token、UniTracker 用 CVAE 保持多样性,都依赖这类压缩思想。

常见坑与修正

潜空间太小会丢动作细节,太大又难生成;VQ 码本可能塌缩,需要码本使用率和重建误差共同监控。

8.7 Sim-to-Real 算法:系统辨识、随机化、残差与在线适应

系统辨识 SysID

维度

内容

解决的问题

减少仿真参数和真实硬件之间的差距。

底层原理

给定真实轨迹 y^real 和仿真轨迹 y^sim(ξ),优化物理参数 ξ,使二者误差最小。PACE 识别惯量、阻尼、摩擦、位置偏置和延迟等紧凑参数。

核心公式

ξ*=argmin_ξ Σ_t ||y_t^real-y_t^sim(ξ)||^2

在人形框架中的用法

PACE 用 CMA-ES 做 bottom-up 动力学识别;Darwin OP2 两阶段 SysID 先找参数范围,再用真实任务试验选择潜在条件。

常见坑与修正

SysID 不是追求所有参数真实,而是追求任务相关预测准确。接触、温度、磨损和电机保护逻辑常难以完全辨识。

CMA-ES 与贝叶斯优化

维度

内容

解决的问题

当系统参数不可微或仿真不稳定时,用黑盒优化搜索参数。

底层原理

CMA-ES 维护一个高斯采样分布 N(m,C),每轮采样候选参数,按真实-仿真误差排序,更新均值和协方差;贝叶斯优化用代理模型估计哪里值得试。

核心公式

CMA-ES: ξ_i~N(m,C),  rank by f(ξ_i),  update m,C toward elite samples

在人形框架中的用法

PACE 用 CMA-ES 拟合执行器/系统参数;post-sysID 可用贝叶斯优化在真实机器人上少量试验选择策略潜变量。

常见坑与修正

黑盒优化样本贵,目标函数必须稳定;真实硬件试验要加安全边界。

Domain Randomization

维度

内容

解决的问题

无法精确知道真实参数时,让策略在参数分布上鲁棒。

底层原理

训练时从 p(ξ) 采样质量、摩擦、延迟、PD、噪声和外力等参数,优化期望回报。策略如果在整个参数分布上都能工作,就更可能迁移到真实。

核心公式

max_θ E_{ξ~p(ξ)}[J(θ;ξ)]

在人形框架中的用法

H2O、SafeFall、FastSAC、AnyAdapter 使用较强随机化;BeyondMimic/PACE 则强调紧凑随机化或不随机化已识别参数。

常见坑与修正

随机化太小覆盖不了真实,太大会让策略保守、降低跟踪精度。原则是可测参数先辨识,不可测或变化快的参数再随机化。

Residual / Delta Action

维度

内容

解决的问题

基线策略动作大体正确,但真实硬件需要小幅修正。

底层原理

让策略输出基线动作 a_base 和残差 Δa,或学习一个残差模型补偿 sim-to-real 动力学误差。残差层通常初始化为零,避免一开始破坏基础策略。

核心公式

a = a_base + Δ_ψ(o,h,c),  q_des=q_ref+s⊙(a_base+Δa)

在人形框架中的用法

ASAP 的 Delta Action、OmniXtreme 的后训练残差策略、FAST 的快速残差适配都属于这一路线。

常见坑与修正

残差不能无限制放大,否则会掩盖基础策略问题并产生不自然动作。需加 L2、动作边界、KL 或功率约束。

Adapter / World Model Online Adaptation

维度

内容

解决的问题

真实环境会随地形、负载、摩擦和外力变化,固定策略无法覆盖所有情况。

底层原理

从最近历史 h_t=(o_{t-k:t},a_{t-k:t-1}) 编码隐式上下文 z_t,再让 adapter 修改基础策略的中间特征或最终动作。world model 预测未来状态,迫使 z_t 携带动力学信息。

核心公式

z_t=E_φ(h_t),  L_WM=Σ_i ||s_{t+i}-f_ψ(s_t,a_{t:t+i-1},z_t)||^2,  a_t=π_base(o_t)+A_η(o_t,z_t)

在人形框架中的用法

AnyAdapter、RMA、LSWM 和 LIFT 都用历史/世界模型思想,只是分别侧重 adapter、隐式系统辨识、状态重建预测和安全模型内微调。

常见坑与修正

在线适应提高鲁棒性,但也让系统更难验证。adapter 应零初始化或小步更新,避免一开始破坏已学运动。

8.8 安全、恢复与约束算法

跌倒预测器

维度

内容

解决的问题

正常控制器不应一直被安全策略干扰,但必须提前判断不可避免跌倒。

底层原理

用历史本体观测训练二分类器,输出 safe/fall 概率。SafeFall 用 GRU 在时间序列上识别跌倒趋势,并在触发后切换控制权。

核心公式

p_fall=σ(f_GRU(o_{t-k:t})),  trigger if p_fall>τ for n consecutive steps

在人形框架中的用法

SafeFall 把预测器和保护策略分离:正常时只监控,危险时接管。

常见坑与修正

误报会打断任务,漏报会来不及保护。训练数据要覆盖外力、脚滑、脚绊、延迟和动力学不匹配等失败模式。

Control Barrier Function / 安全过滤

维度

内容

解决的问题

RL 策略可能输出违反安全约束的动作,需要最后一道约束层。

底层原理

定义安全函数 h(s),安全集为 h(s)≥0。选择动作时要求下一步仍留在安全集,常用 QP 把原始动作投影到最近的安全动作。

核心公式

min_a ||a-a_RL||^2  s.t.  h(s_{t+1})-(1-κ)h(s_t) ≥ 0

在人形框架中的用法

用于安全人到人形模仿、窄空间行走、跌倒风险控制等需要硬约束的场景。

常见坑与修正

CBF 需要较可靠的动力学模型或可微近似;约束过强会让动作僵硬,过弱则没有安全保证。

关键帧记忆与恢复扩散

维度

内容

解决的问题

跌倒缓冲和恢复不是一条唯一轨迹,不同姿态需要不同目标。

底层原理

从少量人类演示提取稀疏关键帧,通过增强生成多模态恢复轨迹;再把状态到关键帧目标的映射存入码本或扩散模型,在线检索/生成最适合当前状态的恢复目标。

核心公式

g_t = Retrieve(Codebook, φ(s_t)) 或 g_{0:H} ~ p_θ(g_{0:H}|s_t)

在人形框架中的用法

FIRM 用稀疏关键帧增强、后轨迹拼接和自适应记忆统一摔倒预防、冲击缓解和恢复。

常见坑与修正

最近邻检索在分布外状态可能失败;需要足够覆盖的关键帧库和损伤/稳定性奖励共同约束。

8.9 数据、奖励与课程算法

运动重定向 / IK 优化

维度

内容

解决的问题

人体骨架和机器人形态不同,不能直接复制关节角。

底层原理

优化机器人关节 q,使关键点、末端、朝向和接触关系接近人体参考,同时满足关节限位、自碰撞和动力学可行性。

核心公式

q*=argmin_q Σ_k w_k||x_k(q)-x_k^human||^2 + λ||q-q_prev||^2  s.t. q_min≤q≤q_max

在人形框架中的用法

H2O、TWIST、VideoMimic、HumanX、HITTER 等都依赖重定向把人类动作变成机器人参考。

常见坑与修正

只匹配关键点会忽略接触力和动态可执行性;需要策略可行性筛选、物理验证或 kinodynamic optimization。

自适应采样与课程学习

维度

内容

解决的问题

动作库中简单片段太多,困难片段学不会;任务太难时稀疏奖励无法探索。

底层原理

根据片段完成率、跟踪误差或失败频率调整采样概率;课程学习则从容易任务逐步增加难度。

核心公式

p_i ∝ (ε + error_i)^α 或 p_i ∝ (1-success_i)^α

在人形框架中的用法

GMT、BeyondMimic、ZEST 用自适应采样;Badminton、HOST、SafeFall 用多阶段课程或力课程。

常见坑与修正

过度采样困难片段会忘记简单片段;课程切换太快会训练崩溃。应保留基础数据混合比例。

自动奖励学习 / 元强化学习

维度

内容

解决的问题

复杂人-物交互中手工设置奖励权重困难。

底层原理

外循环策略根据训练进展调整内循环 PPO 的奖励权重,使学习重点从粗跟踪逐步转向精细接触或任务成功。

核心公式

r_t=Σ_i w_i r_i,  w=MetaPolicy_ψ(features of learning progress)

在人形框架中的用法

InterReal 用 SAC 作为外循环元学习器,依据关键误差变化率调整 HOI 任务奖励权重。

常见坑与修正

奖励学习本身可能过拟合训练任务;需要固定测试任务、消融和权重范围限制。

对抗模仿 / AMP 式判别器奖励

维度

内容

解决的问题

手工奖励难以描述“像人”的风格。

底层原理

训练判别器 D 区分真实 mocap 片段和策略生成片段,再把 D 的输出转为风格奖励,鼓励策略生成接近数据分布的行为。

核心公式

max_D E_{x~D_data}[logD(x)] + E_{x~π}[log(1-D(x))];  r_style=-log(1-D(x_π))

在人形框架中的用法

BFM-Zero 使用 GAN 风格判别器奖励引导无监督行为更类人,AMP/ASE 类方法也基于此思想。

常见坑与修正

判别器太强会导致奖励稀疏,太弱则无法约束风格。需做梯度惩罚、数据平衡和奖励归一化。

8.10 无监督 RL 表示:Forward-Backward 与 TeCH

Forward-Backward Representation

维度

内容

解决的问题

不为每个任务重训,而是预训练一个可提示的行为空间。

底层原理

把长期可达性或 successor measure 分解为前向表示 F(s,a,z) 和后向表示 B(g)。给定目标或奖励后,可以在潜空间中选择 z,直接调用条件策略。

核心公式

Successor feature:  ψ^π(s,a)=E[Σ_t γ^t φ(s_t)];  Q_w(s,a)=ψ^π(s,a)^T w

在人形框架中的用法

BFM-Zero 用前向-后向表示构建潜在任务空间,实现运动跟踪、目标到达和奖励优化的 zero-shot 推理。

常见坑与修正

潜空间能否线性表达任务决定 zero-shot 上限;训练行为分布之外的任务仍需要适应或微调。

TeCH / 时间距离对比表示

维度

内容

解决的问题

让潜空间表达状态之间的时间可达性,而不只是几何相似。

底层原理

采样未来状态作为伪目标,用对比损失让时间接近、行为相关的状态在潜空间更近;策略奖励来自向目标潜变量靠近的进度。

核心公式

r_TeCH(s_t,s_{t+1},z)=||z-zbar(s_t)||^2-||z-zbar(s_{t+1})||^2

在人形框架中的用法

UFO-TeCH 用它做目标到达、轨迹跟踪和强扰动恢复,通常恢复速度快。

常见坑与修正

强调时间效率可能牺牲动作自然度;需要和风格正则或运动数据注入一起使用。

8.11 选型建议:看到一个新框架时先问什么

问题

对应算法判断

教学解释

它是否有专家数据?

有则 BC/DAgger/扩散;没有则 RL/无监督 RL

数据决定算法起点。

部署观测是否少于训练观测?

少则需要师生、非对称 actor-critic 或状态估计器

特权信息必须被蒸馏或重建。

动作是否多峰或多技能?

多峰则 MoE/CVAE/扩散/专家聚类

单高斯会平均化动作。

是否存在真实硬件差距?

SysID、随机化、残差、adapter

先判断参数是否可测,再决定辨识还是随机化。

任务是否稀疏或长视界?

课程学习、分层规划、辅助力、模型预测

不要指望端到端 RL 自己探索出全部结构。

是否有安全硬约束?

CBF/QP、安全切换、损伤奖励

奖励只能倾向安全,约束才更接近保证安全。

是否要成为通用基座?

无监督表示、生成式策略、adapter、技能注入

基座重点不是单任务最高分,而是可提示、可扩展、可恢复。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐