RSS 2026 | 面向基于 MoE 的鲁棒四足运动:可靠 Sim-to-Real 可预测性【文献解读】
文献:Toward Reliable Sim-to-Real Predictability for MoE-based Robust Quadrupedal Locomotion
会议:Robotics: Science and Systems(RSS)2026
作者:Tianyang Wu, Hanwei Guo, Yuhang Wang, Junshu Yang, Xinyang Sui, Jiayi Xie, Xingyu Chen, Zeyang Liu, Xuguang Lan
单位:Xi’an Jiaotong University
项目主页:https://robogauge.github.io/complete/
实验平台:Unitree Go2 / Go2-Edu;训练仿真器 Isaac Gym;评估仿真器 MuJoCo
关键词:Quadrupedal Locomotion、Reinforcement Learning、Mixture-of-Experts、Teacher–Student、Proprioception、Sim-to-Real、Sim-to-Sim、RoboGauge、Domain Randomization
1. 一句话概括论文在做什么
这篇论文同时解决两个彼此耦合的问题:如何让只依赖本体感知的四足机器人策略,在多地形、多速度指令和强扰动下形成更有区分度、更稳定的隐空间表示;以及如何在真正上实机之前,用一个比“训练 reward/训练 terrain level”更可信的仿真指标判断策略到底能不能完成 Sim-to-Real。
作者给出的答案是两部分:
- 在原有 one-stage / teacher–student locomotion 框架的 student latent encoder 中引入 Mixture-of-Experts(MoE),让不同 expert 对不同地形与运动指令形成条件化特征表示;
- 构造独立于训练引擎的 RoboGauge,把策略从 Isaac Gym 放到 MuJoCo 中,通过地形难度、domain randomization、多种运动目标以及 tracking / safety / quality 指标做分层压力测试,再据此进行 checkpoint 选择和部署决策。
论文真正值得关注的地方并不只是“把 MoE 用到四足 RL”,而是把 策略表示学习 + 部署前可预测评估 放到同一个闭环中:训练阶段追求能力,RoboGauge 阶段检查这种能力是否能跨物理引擎保持,从而尽量把“实机上才暴露的问题”提前到 Sim-to-Sim 阶段发现。
2. 论文总体框架
图 1 论文总体框架。左侧为 Isaac Gym 中的多地形 MoE 策略训练,中间为 RoboGauge 的 Sim-to-Sim 评估与策略筛选,右侧为真实 Unitree Go2 的复杂环境部署。来源:Wu et al., RSS 2026, Fig. 1。
从图 1 可以把全文理解为三个阶段:
训练(Train) → 评估(Evaluate) → 部署(Deploy)。
其中 RoboGauge 并不是一个参与反向传播的可微模块,也不是训练 reward 的组成部分。它更接近一个外部模型选择与压力测试系统:同一训练过程产生多个 checkpoint 后,用跨引擎的 Sim-to-Sim 评估判断哪个 checkpoint 更可能在真实机器人上稳定工作。如果评估暴露出某类短板,再回到训练侧调整 reward、command curriculum、domain randomization 或模型结构。
因此,论文中所谓的“closed-loop training framework”应理解为工程迭代闭环,而不是一个端到端联合优化的数学闭环。
3. 论文要解决的关键科学问题与技术挑战
3.1 挑战一:训练 reward 高,不等于实机可迁移
四足机器人强化学习通常在 Isaac Gym、Isaac Sim、MuJoCo 等仿真器中完成大规模并行训练。问题在于:
- 仿真中的接触模型、摩擦、碰撞恢复、执行器响应、通信延迟与真实机器人不完全一致;
- policy 可能通过利用仿真器特有的动力学细节获得高 reward;
- terrain curriculum 中达到更高 level,也可能只是更适应该训练环境,而不是更具真实鲁棒性;
- 多个训练 checkpoint 的 reward 非常接近,但实机表现可能完全不同。
论文因此提出一个关键问题:
能否构造一种低风险、可重复、可量化的代理指标,在真正实机测试前预测策略的 Sim-to-Real 质量?
作者的核心假设是:如果一个策略不仅在训练用 Isaac Gym 中表现好,而且在动力学实现不同的 MuJoCo 中仍能通过大量 terrain / randomization / command stress test,那么该策略对训练仿真器细节的依赖更弱,因而更可能具有真实部署鲁棒性。
这并不意味着 Sim-to-Sim 与 Sim-to-Real 完全等价,而是把跨物理引擎一致性作为一个更保守、更便宜的部署前 proxy。
3.2 挑战二:单一 latent encoder 难以同时表示多地形与多命令
仅依赖 proprioception 时,机器人没有相机、LiDAR 或显式 terrain map。它只能从:
- IMU;
- 关节位置与速度;
- 历史动作;
- 一小段时间历史观测;
间接推断当前环境动力学和地形特征。
问题是,平地高速、波浪地、斜坡、上楼梯、下楼梯、障碍物等任务的最优运动模式差异非常大。如果使用一个单一编码器把所有场景压进同一个 latent,容易发生:
- 表示耦合;
- 不同地形特征互相干扰;
- 不同速度/转向 command 的 latent 混叠;
- 某些困难场景被大量简单样本“淹没”。
作者因此把 MoE 放在 student representation encoder 而不是最终 action output 上,希望通过 gating 让多个 expert 学习具有专门化倾向的表示。
3.3 挑战三:MoE 直接混合动作会破坏控制训练稳定性
MoE 在机器人控制中一个自然做法是让不同 expert 直接产生动作,再由 gating 混合动作。但连续控制的动作空间高度敏感:
- gating 权重变化会直接改变关节目标;
- expert 与 gate 同时更新会导致输出分布快速漂移;
- 小的 mixture 权重变化可能造成明显的足端运动或接触模式变化;
- 训练中容易产生 loss divergence 和危险动作。
论文通过 AC-MoE、MCP 等消融发现:把 MoE 放到 action network / actor 输出侧更容易不稳定;放在 latent representation 层则更加平稳。
因此作者的设计不是“多个控制器投票”,而是:
多个 expert 先形成环境/命令条件化 latent,再由统一 actor 把 latent 映射成动作。
这是本文结构选择中非常重要的一点。
3.4 挑战四:评价指标不能只看“有没有摔倒”
一个策略即使能完成任务,也可能存在:
- 速度跟踪误差大;
- 关节越界;
- 电机功耗高;
- 力矩震荡;
- 姿态晃动;
- ZMP 接近支撑域边缘;
- 足端切向力接近摩擦极限。
这些问题可能不会立刻导致仿真失败,却会明显降低实机安全裕度。因此 RoboGauge 不是单一 success rate,而是将任务完成能力 + 控制质量 + 安全裕度共同纳入评价。
4. 强化学习运动控制问题建模
4.1 POMDP 建模
作者将仅依赖本体感知的四足运动建模为无限时域 POMDP:
( S , A , O , P , Ω , R , ρ 0 ) (\mathcal{S},\mathcal{A},\mathcal{O},P,\Omega,R,\rho_0) (S,A,O,P,Ω,R,ρ0)
策略目标为最大化累计折扣回报:
J ( π ) = E s 0 ∼ ρ 0 , τ ∼ π [ ∑ t = 0 ∞ γ t R ( s t , a t , s t + 1 ) ] . J(\pi)=\mathbb{E}_{s_0\sim\rho_0,\tau\sim\pi} \left[ \sum_{t=0}^{\infty}\gamma^t R(s_t,a_t,s_{t+1}) \right]. J(π)=Es0∼ρ0,τ∼π[t=0∑∞γtR(st,at,st+1)].
其中:
- s t s_t st:训练时可使用的 privileged state;
- o t o_t ot:真实机器人能得到的本体观测;
- a t a_t at:策略动作;
- P ( s ′ ∣ s , a ) P(s'|s,a) P(s′∣s,a):动力学转移;
- Ω ( o ∣ s ) \Omega(o|s) Ω(o∣s):观测模型;
- R R R:奖励函数;
- ρ 0 \rho_0 ρ0:初始状态分布。
因为真实部署时无法获得完整地形和真实线速度等 privileged information,所以这是一个典型的部分可观测控制问题。
4.2 Actor 的本体观测
论文给出的部署观测包括:
| 类别 | 变量 | 物理含义 |
|---|---|---|
| IMU | ω \boldsymbol{\omega} ω | 机体角速度 |
| IMU | g p r o j \boldsymbol{g}_{proj} gproj | 重力向量投影到机体坐标系,用于描述姿态 |
| Joint | q \boldsymbol q q | 12 个驱动关节位置 |
| Joint | q ˙ \dot{\boldsymbol q} q˙ | 关节速度 |
| Command | v x c m d v_x^{cmd} vxcmd | 纵向线速度指令 |
| Command | v y c m d v_y^{cmd} vycmd | 横向线速度指令 |
| Command | ω z c m d \omega_z^{cmd} ωzcmd | yaw 角速度指令 |
| History | a t − 1 \boldsymbol a_{t-1} at−1 | 上一时刻动作 |
此外 student encoder 使用长度为 5 的历史观测序列,从时间变化中推断隐含地形/动力学信息。
4.3 Privileged information
训练阶段 privileged state 还可包含:
- 机体线速度 v \boldsymbol v v;
- 周围地形高度 h \boldsymbol h h;
- 环境参数 latent μ \boldsymbol\mu μ;
- 接触力、关节力矩、加速度等仿真状态。
论文中地形高度在约 1.0 m × 1.6 m 的区域内,以 0.1 m 间隔采样,用于 teacher 侧获得更完整的环境信息。
4.4 动作与底层控制
高层 RL policy 不直接输出关节 torque,而是输出关节位置 offset / target。底层 PD 控制器将目标位置转换为关节力矩:
τ = k p ( q d e s − q ) − k d q ˙ . \tau = k_p(q^{des}-q)-k_d\dot q. τ=kp(qdes−q)−kdq˙.
论文实验配置中:
k p = 20 , k d = 0.5. k_p=20,\qquad k_d=0.5. kp=20,kd=0.5.
控制频率为 50 Hz,物理仿真频率为 200 Hz。
这种“policy 输出 position target + 低层 PD”结构的优点是把一部分高速关节稳定性留给确定性反馈环,降低 RL 直接 torque control 的训练难度与实机风险。
5. MoE Latent Representation:论文核心策略结构
5.1 为什么是 latent-space MoE
论文沿用 CTS 一类 teacher–student / asymmetric information 的思想:训练时 teacher 可以看到 privileged information,而部署时 student 只能根据 proprioceptive history 重构一个 latent,再交给 actor 决策。
作者的改动不是简单把一个 MLP 变大,而是把 student encoder 替换为 K K K 个并行 expert:
E 1 , E 2 , … , E K . E_1,E_2,\ldots,E_K. E1,E2,…,EK.
同时引入 gating network:
g ( o t − H : t ) . g(o_{t-H:t}). g(ot−H:t).
gating 输出经 softmax 得到每个 expert 的权重:
ω k = softmax ( g ( o t − H : t ) ) k . \omega_k= \operatorname{softmax}\left(g(o_{t-H:t})\right)_k. ωk=softmax(g(ot−H:t))k.
最终 student latent 为:
z s = ∑ k = 1 K ω k E k ( o t − H : t ) . z_s= \sum_{k=1}^{K}\omega_k E_k(o_{t-H:t}). zs=k=1∑KωkEk(ot−H:t).
这意味着不同 expert 并不是固定对应“楼梯 expert”“斜坡 expert”,而是由训练自动形成条件化分工。gating 根据当前一段 proprioceptive history 与 command 动态决定组合比例。
5.2 MoE 为什么有助于四足多地形控制
从函数逼近角度看,单一 encoder 需要拟合:
f ( o t − H : t , c t ) → z t f(o_{t-H:t},c_t)\rightarrow z_t f(ot−H:t,ct)→zt
覆盖整个多模态地形与命令分布。而 MoE 实际上将它变成一组局部函数:
f ( x ) ≈ ∑ k ω k ( x ) f k ( x ) . f(x)\approx\sum_k\omega_k(x)f_k(x). f(x)≈k∑ωk(x)fk(x).
其作用可以理解为:
- expert specialization:不同 expert 可以更专注某一类动力学/接触模式;
- conditional computation:同一观测在不同 command 下可获得不同的组合;
- 降低 representation interference:平地高速与上下楼梯不必完全共享相同隐空间;
- 增强多模态 latent separability:PCA 结果显示不同地形/指令的编码分布更容易分开。
5.3 Load-balancing loss:防止 expert collapse
MoE 常见问题是 gate 长期只选择一个或少数 expert,导致其余 expert 几乎不学习。论文加入 load-balancing:
L l b = ∑ k = 1 K ( ω ˉ k − 1 K ) 2 , \mathcal{L}_{lb}= \sum_{k=1}^{K} \left(\bar\omega_k-\frac{1}{K}\right)^2, Llb=k=1∑K(ωˉk−K1)2,
其中 batch 内平均 gating 权重为:
ω ˉ k = 1 B ∑ j = 1 B ω k ( j ) . \bar\omega_k= \frac{1}{B} \sum_{j=1}^{B}\omega_k^{(j)}. ωˉk=B1j=1∑Bωk(j).
当某个 expert 被过度使用时, ω ˉ k \bar\omega_k ωˉk 会明显偏离 1 / K 1/K 1/K,从而受到惩罚。
这里需要注意:load balancing 并不要求每一个时刻所有 expert 权重完全相同,而是要求从 batch / 数据分布的统计意义上避免长期退化为单 expert。因此依然允许某些地形下某个 expert 权重显著更高。
5.4 为什么不在 action space 上做 MoE
论文比较:
- MoE-NG:gate/expert 不使用 command;
- AC-MoE:在 Actor-Critic 网络侧使用 MoE;
- MCP:对 actor action 做 multiplicative composition;
- Ours:在 student latent representation 上做 MoE。
作者观察到 AC-MoE 与 MCP 更容易出现训练 loss divergence。原因可以从连续控制理解:若 gate 或 expert 参数在训练中发生更新,直接输出 action 的 expert mixture 会立刻改变关节目标;而 latent representation 仍需经过共享 actor,相当于多了一层“控制映射缓冲”,动作分布变化更平滑。
因此本文的关键结构原则是:
让 MoE 专门负责“理解当前是什么状态/地形/命令”,而不是让多个 expert 直接争夺“此刻关节应该怎么动”。
6. Reward 设计与训练增强策略
6.1 Reward 的目标并不是单纯追速度
论文 reward 同时包含:
- 线速度跟踪;
- 角速度跟踪;
- 垂向速度抑制;
- roll/pitch 角速度抑制;
- joint acceleration;
- joint power;
- joint torque;
- base height;
- action rate;
- action smoothness;
- collision;
- joint limit;
- foot regulation;
- hip regulation;
- hip symmetry。
核心速度跟踪项为:
r v = exp ( − σ ∥ v x y c m d − v x y ∥ 2 2 ) . r_v= \exp\left( -\sigma\left\| \boldsymbol v_{xy}^{cmd}-\boldsymbol v_{xy} \right\|_2^2 \right). rv=exp(−σ vxycmd−vxy 22).
角速度跟踪类似:
r ω = exp ( − σ ∣ ω z c m d − ω z ∣ 2 ) . r_{\omega}= \exp\left( -\sigma \left|\omega_z^{cmd}-\omega_z\right|^2 \right). rω=exp(−σ ωzcmd−ωz 2).
这里 σ \sigma σ 控制 reward 对 tracking error 的敏感程度。
6.2 Hip symmetry 奖励
高速度下机器人容易形成较大的 lateral body oscillation。论文加入 hip symmetry 项:
r h s = ∣ v x c m d ∣ ∥ v c m d ∥ 2 ( ∣ q F L h i p + q F R h i p ∣ + ∣ q R L h i p + q R R h i p ∣ ) . r^{hs}= \frac{|v_x^{cmd}|}{\|\boldsymbol v^{cmd}\|_2} \left( |q_{FL}^{hip}+q_{FR}^{hip}|+ |q_{RL}^{hip}+q_{RR}^{hip}| \right). rhs=∥vcmd∥2∣vxcmd∣(∣qFLhip+qFRhip∣+∣qRLhip+qRRhip∣).
该项与纵向速度指令相关,在高速前进时约束左右 hip 的非对称偏移,帮助形成更稳定的窄支撑宽度 gait。
值得注意的是,论文最终观察到 narrow-width gait 是 emergent behavior,即并没有显式指定某一种固定 gait trajectory;reward 只提供稳定性与对称性倾向,最终步态由策略优化自己形成。
6.3 Dynamic velocity tracking precision
固定 σ \sigma σ 会带来矛盾:
- 低速/复杂地形需要更宽容,否则训练初期容易陷入过强惩罚;
- 高速阶段又需要更高 tracking precision,否则模型只会“能跑快”,但 command following 不准。
因此论文根据当前速度和训练进度动态调整 tracking 精度系数。论文给出的分段形式为:
σ v e l = { σ , v ∈ [ 0 , v m i n ) , σ ( v − v m i n ) + σ m a x T i ( v m a x − v ) , v ∈ [ v m i n , v m a x ) , σ m a x T i , v ∈ [ v m a x , ∞ ) . \sigma_{vel}= \begin{cases} \sigma, & v\in[0,v_{min}),\\ \sigma(v-v_{min})+\sigma_{max}^{T_i}(v_{max}-v), & v\in[v_{min},v_{max}),\\ \sigma_{max}^{T_i}, & v\in[v_{max},\infty). \end{cases} σvel=⎩ ⎨ ⎧σ,σ(v−vmin)+σmaxTi(vmax−v),σmaxTi,v∈[0,vmin),v∈[vmin,vmax),v∈[vmax,∞).
随后按训练进度 L L L 平滑插值:
σ n o w = σ + min ( e L / 10 − 1 , 1 ) ( σ v e l − σ ) . \sigma_{now}=\sigma+ \min\left(e^{L/10}-1,1\right) (\sigma_{vel}-\sigma). σnow=σ+min(eL/10−1,1)(σvel−σ).
直观上就是:训练早期先学会走,训练深入后再逐渐把速度跟踪要求收紧。
6.4 Command curriculum
| 阶段 | 训练步范围 | v x c m d v_x^{cmd} vxcmd [m/s] | v y c m d v_y^{cmd} vycmd [m/s] | ω z c m d \omega_z^{cmd} ωzcmd [rad/s] |
|---|---|---|---|---|
| Initial | [ 0 , 2 × 10 4 ] [0,2\times10^4] [0,2×104] | ± 0.5 \pm0.5 ±0.5 | ± 0.5 \pm0.5 ±0.5 | ± 1.0 \pm1.0 ±1.0 |
| Intermediate | [ 2 × 10 4 , 5 × 10 4 ] [2\times10^4,5\times10^4] [2×104,5×104] | ± 1.0 \pm1.0 ±1.0 | ± 1.0 \pm1.0 ±1.0 | ± 1.5 \pm1.5 ±1.5 |
| Advanced | [ 5 × 10 4 , ∞ ) [5\times10^4,\infty) [5×104,∞) | ± 2.0 \pm2.0 ±2.0 | ± 1.0 \pm1.0 ±1.0 | ± 2.0 \pm2.0 ±2.0 |
课程学习先从容易速度区间开始,逐步扩张 command range,避免模型在尚未形成基本 gait 时就被大量极端命令破坏训练稳定性。
6.5 Extreme command sampling
为了避免均匀采样下极端命令概率过低,论文显式提高特殊 command 的采样概率:
- 约 10% stationary commands;
- 约 20% 最大线速度组合;
- 当线速度为 0 时,额外覆盖较高概率的最大角速度指令。
其目的不是增加平均难度,而是确保模型真正见过边界控制工况。
6.6 Dynamic command sampling
论文还限制一个 episode 内 command 的累计运动量,使 episode 中既有运动又有足够的停止/切换阶段。其核心式为:
v ∗ = clip ( 5 − ∥ ∑ i = 1 n r v i c m d ∥ 2 T r T e p − n r T r , 0 , min ( ∣ v m i n ∣ , ∣ v m a x ∣ ) ) . v^*=\operatorname{clip} \left( \frac{ 5-\left\|\sum_{i=1}^{n_r}\boldsymbol v_i^{cmd}\right\|_2T_r }{ T_{ep}-n_rT_r }, 0, \min(|v^{min}|,|v^{max}|) \right). v∗=clip(Tep−nrTr5− ∑i=1nrvicmd 2Tr,0,min(∣vmin∣,∣vmax∣)).
若下一次采样为零速命令,则 stationary duration 为:
T z e r o = clip ( T e p − n r T r − 5 − ∥ ∑ i = 1 n r v i c m d ∥ 2 T r 0.8 max ( v x m a x , v y m a x ) , 0 , T r ) . T^{zero}=\operatorname{clip} \left( T_{ep}-n_rT_r- \frac{ 5-\left\|\sum_{i=1}^{n_r}\boldsymbol v_i^{cmd}\right\|_2T_r }{ 0.8\max(v_x^{max},v_y^{max}) }, 0, T_r \right). Tzero=clip(Tep−nrTr−0.8max(vxmax,vymax)5− ∑i=1nrvicmd 2Tr,0,Tr).
作者报告 command curriculum、extreme sampling、dynamic sampling 与动态 tracking precision 组合能够明显提高训练稳定性和最终 RoboGauge 表现;附录消融中 dynamic command sampling 对峰值表现带来约 11% 的提升。
7. 训练环境与 Domain Randomization
7.1 训练规模
论文使用:
- Isaac Gym;
- 8192 个并行 agent;
- Unitree Go2,12-DOF;
- physics:200 Hz;
- policy control:50 Hz;
- observation history:5 帧。
训练覆盖七类具体 terrain configuration:
- Flat;
- Wave;
- Slope;
- Rough slope;
- Stairs up;
- Stairs down;
- Obstacle。
典型训练范围包括:
- slope:约 5.7 ∘ 5.7^\circ 5.7∘– 29.6 ∘ 29.6^\circ 29.6∘;
- rough slope:叠加约 5 cm 高度扰动;
- stairs:约 5–25.7 cm 台阶高度,tread 约 31 cm;
- obstacle:约 5–27.5 cm 高度,宽度 1–2 m。
7.2 Domain Randomization 参数
| 随机化项 | 范围 |
|---|---|
| Friction | [ 0.5 , 1.5 ] [0.5,1.5] [0.5,1.5] |
| Payload | [ − 1 , 1 ] [-1,1] [−1,1] kg |
| Link mass | [ 0.9 , 1.1 ] × [0.9,1.1]\times [0.9,1.1]× nominal |
| Base CoM offset | [ − 3 , 3 ] 3 [-3,3]^3 [−3,3]3 cm |
| Restitution | [ 0 , 0.5 ] [0,0.5] [0,0.5] |
| k p , k d k_p,k_d kp,kd | [ 0.9 , 1.1 ] × [0.9,1.1]\times [0.9,1.1]× nominal |
| Actuator strength | [ 0.8 , 1.2 ] × [0.8,1.2]\times [0.8,1.2]× nominal |
| Actuator offset | [ − 0.035 , 0.035 ] [-0.035,0.035] [−0.035,0.035] rad |
| Latency | [ 0 , 20 ] [0,20] [0,20] ms |
Domain randomization 的作用不是“模拟每一个真实参数”,而是人为扩大训练 dynamics distribution,让策略减少对某一个精确仿真模型的依赖。
8. RoboGauge:面向 Sim-to-Real 的预测评估框架
图 3 RoboGauge 分层评估架构:Base Pipeline → Multi/Level Pipeline → Stress Pipeline。来源:Wu et al., RSS 2026, Fig. 3。
RoboGauge 是全文另一项核心贡献。它使用 MuJoCo 对 Isaac Gym 训练出来的 policy 做跨引擎测试。
8.1 为什么 Sim-to-Sim 可以帮助预测 Sim-to-Real
假设训练策略为:
π I G \pi_{IG} πIG
它是在 Isaac Gym 的动力学分布 p I G p_{IG} pIG 中优化得到的。如果 policy 利用了 p I G p_{IG} pIG 的特殊数值特性,那么当它放到另一个不同的物理引擎 p M J p_{MJ} pMJ 时,性能往往会下降。
RoboGauge 的基本思想是检查:
π I G : p I G → p M J \pi_{IG}: p_{IG}\rightarrow p_{MJ} πIG:pIG→pMJ
能否仍保持 tracking、safety 与 quality。
这相当于人为制造一个“已知的 dynamics shift”。通过大量不同 terrain 与 domain randomization 的组合,测试 policy 对模型不确定性的敏感度。
因此 RoboGauge 评测到的本质不是“MuJoCo 本身是否接近真实世界”,而是:
策略是否对训练仿真器之外的动力学变化保持稳定。
8.2 三层 Pipeline
A. BasePipeline
单环境执行最基础的一组:
- terrain;
- terrain level;
- domain randomization;
- command objective;
- metric collection。
B. Multi/Level Pipeline
在多个随机种子和多个难度等级上并行测试,并执行:
- metric normalization;
- Worst-Case Mean;
- quality score;
- 最大可通过 terrain level 搜索。
C. Stress Pipeline
将全部 terrain × randomization 的结果汇总为:
- 每种 terrain robust score;
- 最终总体 RoboGauge score。
9. RoboGauge 的指标体系
9.1 论文列出的指标
| 指标 | 含义 | 主要风险 |
|---|---|---|
| Linear Velocity Error | 线速度 ℓ 2 \ell_2 ℓ2 跟踪误差 | command tracking 差 |
| Angular Velocity Error | 角速度 ℓ 2 \ell_2 ℓ2 跟踪误差 | 转向响应差 |
| DoF Power | 电机功率消耗 | 能耗/热负荷 |
| DoF Limits | 关节超 soft limit | 机械安全风险 |
| Orientation Stability | 重力投影的横向分量等姿态稳定性 | roll/pitch 摇摆 |
| Torque Smoothness | 电机力矩时间平滑性 | 高频抖振/冲击 |
| ZMP Margin | 零力矩点稳定裕度 | 动态稳定性不足 |
| Friction Margin | 库仑摩擦裕度 | 打滑风险 |
论文正文早期描述“6 metrics”,对应 tracking / safety / quality 的六项常规本体指标;最新版分层评分公式与 Fig. 3、Table II 又明确写为 K = 8 K=8 K=8,加入 ZMP margin 和 friction margin 两项物理稳定性指标。因此阅读全文时最好理解为:
6 项基础指标 + 2 项扩展物理稳定性指标,共 8 项进入最新版综合评价。
这是论文文本中一个需要注意的记号更新不完全一致之处,而不是算法概念上的矛盾。
9.2 为什么使用几何平均而不是算术平均
每个 metric 归一化到 [ 0 , 1 ] [0,1] [0,1],对于 error 型指标先通过类似:
f ( x ) = 1 − x f(x)=1-x f(x)=1−x
转换为“越大越好”。
然后 quality score 使用 weighted geometric mean:
Q i , j ( L ) = ( ∏ k = 1 K m k w k ) 1 / ∑ k = 1 K w k . Q_{i,j}(L)= \left( \prod_{k=1}^{K}m_k^{w_k} \right)^{1/\sum_{k=1}^{K}w_k}. Qi,j(L)=(k=1∏Kmkwk)1/∑k=1Kwk.
这个选择很关键。如果采用算术平均,一个 policy 可以用极高的 tracking 分数抵消很差的 safety;而几何平均中,只要某个关键 m k m_k mk 接近 0,整体 Q Q Q 就会被明显拉低。
所以它实现了一种“短板惩罚”:
机器人不能靠“跑得很快”抵消“力矩抖动、关节越界或稳定裕度很低”。
9.3 Worst-Case Mean
不同 command 中,简单命令可能占多数。直接做全局 mean 容易让简单样本掩盖困难 maneuver。
论文对每类 motion goal 取最低 50% 的 score 求均值,即 Worst-Case Mean,突出:
- 极限速度;
- 强转向;
- 障碍跨越;
- gait transition;
- 困难 command combination。
论文同时保留 global mean 与 top-25% mean 作为辅助参考,但最终评价更强调低分区域。
9.4 最大可行 terrain level 的二分搜索
每种 terrain T i T_i Ti、domain randomization d j d_j dj 下,RoboGauge 在 10 个 difficulty level 中寻找最大可通过等级:
L i , j ∗ . L_{i,j}^*. Li,j∗.
每个 level 以 5 个 stochastic seeds 评估;当 goal-reaching success rate 超过 80% 时视为该 level 可通过。
因为 difficulty level 单调递增,所以作者用 binary search 减少评估成本,而不是从 level 1 到 level 10 全部顺序测试。
9.5 Terrain quality score:能力和动作质量同时计分
只看 L ∗ L^* L∗ 会出现问题:一个 policy 勉强通过 level 8,可能比一个在 level 7 极其稳定的 policy 更差。因此作者引入 overlapping score:
S i , j = α ( L i , j ∗ − 1 ) + β Q i , j ( L i , j ∗ ) . S_{i,j}= \alpha(L_{i,j}^*-1)+ \beta Q_{i,j}(L_{i,j}^*). Si,j=α(Li,j∗−1)+βQi,j(Li,j∗).
论文设置:
α = 0.09 , β = 0.19 , \alpha=0.09,\qquad \beta=0.19, α=0.09,β=0.19,
并满足:
β > α . \beta>\alpha. β>α.
所以“低一级但高质量”的 policy 可以接近甚至超过“高一级但勉强通过”的 policy,避免 terrain level 的离散跳变把模型排序弄得过于粗糙。
9.6 Robust score 与最终 score
对于 terrain T i T_i Ti,先在 M M M 个 domain randomization 下取平均:
S ˉ i = 1 M ∑ j = 1 M S i , j . \bar S_i= \frac{1}{M} \sum_{j=1}^{M}S_{i,j}. Sˉi=M1j=1∑MSi,j.
再对 N N N 种 terrain configuration 汇总:
S ˉ = 1 N ∑ i = 1 N S ˉ i . \bar S= \frac{1}{N} \sum_{i=1}^{N}\bar S_i. Sˉ=N1i=1∑NSˉi.
最新版形式化章节给出:
N = 7 , M = 9 , K = 8. N=7,\qquad M=9,\qquad K=8. N=7,M=9,K=8.
其中 5 类 terrain 为 flat / wave / slope / stairs / obstacle,而 slope 与 stairs 分别拆分 forward / backward,所以具体 configuration 数为 7。
论文 Introduction 中仍出现“4 domain randomizations”的概括,而正式 IV-C 与 Fig. 3 明确采用 M = 9 M=9 M=9。结合附录 friction sweep(0.2–1.0,步长 0.1)可判断,实现与正式评分部分应以 M = 9 M=9 M=9 为准。
10. 两个物理稳定性指标
10.1 ZMP Margin
论文从机器人各 link 的惯性动力学量计算整体等效力:
F t o t a l = ∑ i m i ( g − p ¨ i ) . \boldsymbol F_{total} =\sum_i m_i(\boldsymbol g-\ddot{\boldsymbol p}_i). Ftotal=i∑mi(g−p¨i).
总力矩为:
M t o t a l = ∑ i [ p i × m i ( g − p ¨ i ) − ( I i ω ˙ i + ω i × ( I i ω i ) ) ] . \boldsymbol M_{total} =\sum_i \left[\boldsymbol p_i\times m_i(\boldsymbol g-\ddot{\boldsymbol p}_i) -\left( I_i\dot{\boldsymbol\omega}_i+ \boldsymbol\omega_i\times(I_i\boldsymbol\omega_i) \right) \right]. Mtotal=i∑[pi×mi(g−p¨i)−(Iiω˙i+ωi×(Iiωi))].
ZMP 坐标:
x z m p = − M y F z , y z m p = M x F z . x_{zmp}=-\frac{M_y}{F_z}, \qquad y_{zmp}=\frac{M_x}{F_z}. xzmp=−FzMy,yzmp=FzMx.
归一化 margin:
m z m p = max ( 0 , 1 − ∥ ( x z m p , y z m p ) ∥ 2 D n o r m ) . m_{zmp}= \max\left( 0, 1- \frac{\|(x_{zmp},y_{zmp})\|_2}{D_{norm}} \right). mzmp=max(0,1−Dnorm∥(xzmp,yzmp)∥2).
ZMP 越靠近参考支撑区域中心,margin 越高;越靠近边缘,动态稳定裕度越低。
10.2 Coulomb Friction Margin
对于第 i i i 个足端接触:
- normal force: f i n o r m a l f_i^{normal} finormal;
- tangential force: f i t a n g e n t \boldsymbol f_i^{tangent} fitangent;
- friction coefficient: μ \mu μ。
摩擦条件为:
∥ f i t a n g e n t ∥ ≤ μ f i n o r m a l . \|\boldsymbol f_i^{tangent}\| \le \mu f_i^{normal}. ∥fitangent∥≤μfinormal.
论文定义归一化摩擦裕度:
m f r i c t i o n = ∑ i w i max ( 0 , 1 − ∥ f i t a n g e n t ∥ μ f i n o r m a l ) , m_{friction}= \sum_i w_i \max\left( 0, 1- \frac{\|\boldsymbol f_i^{tangent}\|} {\mu f_i^{normal}} \right), mfriction=i∑wimax(0,1−μfinormal∥fitangent∥),
其中:
w i = f i n o r m a l ∑ j f j n o r m a l . w_i= \frac{f_i^{normal}} {\sum_j f_j^{normal}}. wi=∑jfjnormalfinormal.
这个指标比单纯“有没有滑倒”更有信息量:即使机器人还没真正滑倒,只要切向力已经逼近 friction cone 边界,score 就会提前下降。
11. RoboGauge 的地形与运动目标
RoboGauge 包含 5 类 terrain:
- Flat;
- Wave;
- Slope;
- Stairs;
- Obstacle。
其中除 flat 外均设置 10 个 difficulty levels;slope/stairs 又分别考虑正反方向,所以形成 7 个具体 terrain configurations。
附录给出的代表性参数包括:
| Terrain | 参数化方式 | 典型范围 |
|---|---|---|
| Wave | z ( x , y ) = A sin ( x / T ) + A cos ( y / T ) z(x,y)=A\sin(x/T)+A\cos(y/T) z(x,y)=Asin(x/T)+Acos(y/T), A = 0.4 d A=0.4d A=0.4d | A ∈ [ 0.04 , 0.4 ] A\in[0.04,0.4] A∈[0.04,0.4] m, T = 1.6 T=1.6 T=1.6 |
| Slope | k = 0.07 + 0.5 d k=0.07+0.5d k=0.07+0.5d | 约 8.4 ∘ 8.4^\circ 8.4∘– 29.7 ∘ 29.7^\circ 29.7∘ |
| Stairs | 固定 tread w = 0.31 w=0.31 w=0.31 m,高度随 difficulty 增长 | 约 0.08 0.08 0.08– 0.23 0.23 0.23 m |
| Obstacle | h = 0.05 + 0.23 d h=0.05+0.23d h=0.05+0.23d | 约 0.073 0.073 0.073– 0.28 0.28 0.28 m |
RoboGauge 还设计三类 motion objectives:
| Objective | 测试内容 | 最大 trial 数 |
|---|---|---|
| Max Velocity | 单方向最大线速度/角速度 | 6 |
| Diagonal Velocity | 线速度与转向的耦合/对角命令 | 8 |
| Target Position Velocity | 基于位置目标的速度跟踪 | 1 |
这使得评价不再是一个固定 v x = 1 v_x=1 vx=1 m/s 的单一测试,而是同时检查峰值能力、耦合 command 与目标跟踪。
12. 实验设计:论文分别验证什么
论文把实验组织成六个核心 research questions:
Q1:RoboGauge 指标是否比训练环境更接近实机?
做法:
- 使用 12-camera NOKOV Mars18H motion capture;
- 90 Hz;
- 机器人 base 放置 5 个 markers;
- 测试 flat 与 10 cm stairs;
- 同时记录真实 velocity、proprioception、motor torques;
- 对比 Isaac Gym 训练环境与 MuJoCo RoboGauge 相对于真实测量的误差。
Q2:现有 proprioception-only baseline 在 RoboGauge 中表现如何?
Baseline:
- DreamWaQ;
- HIM;
- CTS;
- Ours。
所有方法使用 8192 parallel agents、3 个独立 seeds。
Q3:MoE 是否真的形成了更好的 terrain / command representation?
做:
- MoE-NG;
- AC-MoE;
- MCP;
- latent PCA visualization。
Q4:真实复杂地形是否比 baseline 更鲁棒?
测试:
- 80–100 N lateral impulse;
- 15.5 cm 光滑瓷砖楼梯;
- 30 cm obstacle。
Q5:velocity command tracking 精度如何?
测试:
- 木制 stairs;
- 30° wooden slope;
- flat high-speed running。
Q6:能否泛化到训练中未见复杂环境?
测试:
- sand;
- snow;
- cobblestone;
- uneven ground;
- outdoor slopes;
- sudden support loss / drop recovery。
13. 关键实验结果
13.1 RoboGauge 比训练环境更能复现实机指标
| 环境 | Tracking error ↓ | Safety error ↓ | Quality error ↓ |
|---|---|---|---|
| MuJoCo / RoboGauge | 0.0558 | 0.0117 | 0.0120 |
| Isaac Gym / Training | 0.0883 | 0.0333 | 0.0380 |
这组结果支持论文最重要的评价假设:单纯读取训练仿真中的表现,会显著高估某些策略;跨引擎 Sim-to-Sim 的测量更接近真实机器人。
尤其 Safety 与 Quality 的误差差距更明显,说明仿真器差异不仅影响速度,还会改变接触、力矩与稳定性相关特征。
13.2 RoboGauge baseline 对比
| Model | Score ↑ | Tracking ↑ | Safety ↑ | Quality ↑ | Level ↑ |
|---|---|---|---|---|---|
| Ours | 0.6713 | 0.6669 | 0.7857 | 0.7392 | 7.85 |
| CTS | 0.5786 | 0.5755 | 0.7066 | 0.6624 | 6.83 |
| HIM | 0.5379 | 0.5453 | 0.6476 | 0.6050 | 6.19 |
| DreamWaQ | 0.5054 | 0.5105 | 0.6149 | 0.5730 | 5.74 |
相对最强 baseline CTS,本文方法:
- 总 Score 提升约 16.0%;
- Tracking 提升约 15.9%;
- Safety 提升约 11.2%;
- Quality 提升约 11.6%;
- 平均 Level 提升约 14.9%。
重要的是,论文强调训练时的 terrain level 曲线会明显波动,并不能稳定反映 checkpoint 的真实部署价值;RoboGauge score 对模型排序更稳定。
13.3 MoE 消融
| Model | Score | Tracking | Safety | Quality | Level |
|---|---|---|---|---|---|
| MoE (Ours) | 0.6713 | 0.6669 | 0.7857 | 0.7392 | 7.85 |
| MoE-NG | 0.6519 | 0.6447 | 0.7639 | 0.7186 | 7.56 |
| AC-MoE | 0.6509 | 0.6442 | 0.7644 | 0.7149 | 7.52 |
| MCP | 0.6399 | 0.6355 | 0.7542 | 0.7058 | 7.41 |
三个结论非常清楚:
- command 必须进入 representation mixture,否则 MoE-NG 下降;
- MoE 放在 representation encoder 比放在 actor/action 侧更稳定;
- MoE 的收益并非仅来自“参数量变大”,因为不同放置方式表现明显不同。
PCA 进一步表明:本文 MoE latent 对不同 terrain 与 command 形成更明显的聚类分离,说明它确实学到了更结构化的内部表示。
14. 实机性能:从“评分更高”到“真的更稳”
14.1 三类高难度实机任务

图 17 Unitree Go2 的三类高难度实机测试:80–100 N 横向冲击、15.5 cm 光滑瓷砖楼梯( μ = 0.38 \mu=0.38 μ=0.38)和 30 cm 障碍( μ = 0.85 \mu=0.85 μ=0.85)。这里按论文 Fig. 17 的三个原始子图顺序组合展示。来源:Wu et al., RSS 2026, Fig. 17。
| Model | 80–100 N lateral impulse | 15.5 cm tile stairs | 30 cm obstacle |
|---|---|---|---|
| Ours | 18/20 | 85/85 | 17/20 |
| Built-in RL | 5/20 | 85/85 | 0/20 |
| CTS | 11/20 | 18/85 | 0/20 |
| HIM | 8/20 | 24/85 | 0/20 |
| DreamWaQ | 7/20 | 12/85 | 0/20 |
论文的 “Survival Rate (%)” 表头实际上以成功次数/总次数形式给出。最突出的是:只有本文 MoE policy 能稳定完成 30 cm obstacle;在强横向冲击下也明显优于 baseline。
14.2 楼梯与斜坡速度跟踪
木楼梯实验中:
- 平均速度约 1.31 m/s;
- velocity tracking error 约 0.15 m/s。
30° 木斜坡中:
- 平均速度约 1.53 m/s;
- 相比机器人 built-in RL,完成时间减少 1.7 s。
这说明本文不是通过“大幅牺牲速度换稳定”,而是在复杂接触条件下仍保持较高 command tracking 能力。
14.3 4.01 m/s 高速运动与 emergent narrow-base gait
图 9(论文 Fig. 9 的右侧原始实物子图) 高速运动中的腾空阶段与 narrow-base gait。完整 Fig. 9 还包含左侧 velocity tracking 曲线。来源:Wu et al., RSS 2026, Fig. 9。
在长度受限的 8 m 室内跑道上:
- 峰值速度 4.01 m/s;
- 约 2.16 s 达到该速度;
- tracking error 约 0.20 m/s;
- 出现明显 flight phase;
- 策略自行形成 narrow-base gait。
所谓 narrow-base gait,是左右足落点横向间距减小。高速运动时它可以降低横向 CoM 摆动,使能量更多用于前向推进,并减小高速横摆不稳定。
这里应避免把 narrow-base gait 解读成论文显式规定的 gait template。作者强调的是emergent:它是 reward、command curriculum、动力学约束与 RL 优化共同形成的结果。
14.4 连续横向拉力
图 10 平地连续横向拉力扰动实验,拉力约 25–40 N。来源:Wu et al., RSS 2026, Fig. 10。
机器人在连续 25–40 N 横向拉力下通过改变身体质心与足端落点形成补偿步态,而不是仅靠 stiff PD 抵抗扰动。
此外,突然横向冲击达到约 85–100 N,论文报告本文策略仍表现出较强恢复能力。
14.5 失去支撑后的自适应恢复
图 18(论文 Fig. 18 顶部原始序列) 地面突然终止后,机器人快速调整姿态并在下一级台阶恢复支撑。完整 Fig. 18 同时给出了足端接触力与基于正运动学计算的前足相对高度曲线。来源:Wu et al., RSS 2026, Fig. 18。
论文还展示了:
- 60 cm drop recovery;
- 突然从平地落入 stairs 时快速重构 gait;
- 通过足端接触变化实现自适应落脚。
这类实验特别能说明 proprioceptive history encoder 的价值:机器人没有提前看到“前方没地面”,而是在接触/IMU/关节状态突然变化后迅速识别 dynamics shift 并恢复。
14.6 室外泛化
项目页展示的未见场景包括:
- soft mound;
- cobblestone;
- obstacle;
- spiral stairs;
- earthen slope;
- sand;
- snowfield。
论文报告 outdoor field test 中实现 100% success rate,且没有 unexpected termination。这支持其核心主张:MoE latent 不仅拟合训练 terrain label,而是形成了一定程度可迁移的 proprioceptive dynamics representation。
15. RoboGauge 为什么比 training reward 更合理
可以从四个层面理解。
15.1 与训练仿真器解耦
训练:Isaac Gym。
评估:MuJoCo。
若 policy 只是“记住”训练引擎的 contact artifacts,跨引擎就容易暴露。
15.2 不是 reward,而是多指标诊断
Training reward 是人为设计的优化目标,存在 reward hacking。RoboGauge 直接测:
- tracking;
- torque;
- power;
- joint limit;
- orientation;
- ZMP;
- friction margin。
评价空间与训练 reward 不完全相同,从而降低“用同一把尺子训练又用同一把尺子评价”的偏差。
15.3 采用 worst-case,而不是平均成功
真实部署最危险的通常不是平均状态,而是:
- 极限摩擦;
- 极端速度;
- 最大 obstacle;
- 强转向;
- gait transition。
Worst-Case Mean 强制评价这些低分样本。
15.4 Difficulty 与 Quality 同时评分
“能过更难地形”与“动作是否干净、稳定、安全”是两个维度。RoboGauge 的 overlapping score 同时保留两者。
因此它更接近工程部署中的真正模型选择问题:
不是找 reward 最大的 policy,而是找在模型误差、地形扰动和极限指令下最不容易出问题的 policy。
16. 论文的主要创新点与学术贡献
16.1 创新一:提出 RoboGauge,把 Sim-to-Real“可预测性”变成可计算对象
过去常见流程是:
Training Reward → 直接上实机 → 摔了再调 \text{Training Reward}\rightarrow\text{直接上实机}\rightarrow\text{摔了再调} Training Reward→直接上实机→摔了再调
本文变为:
Isaac Gym Train → MuJoCo Stress Evaluation → Checkpoint Selection → Real Deployment . \text{Isaac Gym Train} \rightarrow \text{MuJoCo Stress Evaluation} \rightarrow \text{Checkpoint Selection} \rightarrow \text{Real Deployment}. Isaac Gym Train→MuJoCo Stress Evaluation→Checkpoint Selection→Real Deployment.
它最大的研究价值是把“这个 checkpoint 到底值不值得上实机”从经验判断变成系统化评价。
16.2 创新二:MoE 不混动作,而是混 latent representation
相比传统 action-space MoE,本文把 specialization 发生在表示层:
history → { E k } → gated latent → shared actor → action . \text{history} \rightarrow \{E_k\} \rightarrow \text{gated latent} \rightarrow \text{shared actor} \rightarrow \text{action}. history→{Ek}→gated latent→shared actor→action.
这兼顾了多模态表达能力与连续控制稳定性。
16.3 创新三:将 terrain 与 command 同时作为 expert specialization 条件
MoE-NG 消融表明 command 信息不是可有可无的附加输入。机器人在同一地形下前进、后退、横移、转向,对接触模式和姿态控制的要求不同。
因此本文不是简单学习“terrain classifier”,而是学习:
terrain dynamics × motion command \text{terrain dynamics}\times\text{motion command} terrain dynamics×motion command
联合条件下的 latent representation。
16.4 创新四:评价指标强调“物理安全裕度”而非单纯任务成功
加入 ZMP margin 与 friction margin 后,可以在跌倒前捕获稳定性变差趋势,更适合实机 policy screening。
16.5 创新五:强实机结果支撑方法不是纯 benchmark optimization
本文结果覆盖:
- 4.01 m/s 高速;
- 30 cm obstacle;
- 15.5 cm 光滑 stairs;
- 30° slope;
- 60 cm drop;
- 80–100 N impulse;
- snow/sand 等 unseen terrains。
这些任务的共同特征是接触模式变化强、domain gap 大,能够较好验证“robust representation + predictive assessment”的组合价值。
17. 与 DreamWaQ / HIM / CTS 的本质区别
| 方法 | 核心表示机制 | 本文认为的主要不足/差异 |
|---|---|---|
| DreamWaQ | asymmetric actor-critic + variational estimator,估计 body velocity / terrain latent | 单一 latent 模型,多地形/命令耦合较强 |
| HIM | contrastive learning / hybrid internal representation | latent 仍主要由统一编码器承担 |
| CTS | asymmetric teacher–student,通过 reconstruction 学 student latent | 是本文主要基线;本文在 student encoder 进一步引入 MoE |
| Ours | CTS-style latent learning + gated MoE representation + RoboGauge model selection | 同时提升表示容量与部署前可预测评估能力 |
因此本文相对 CTS 的改进可以高度概括为:
CTS 解决“部署时看不到 privileged state,怎么从历史本体观测重构”;本文进一步解决“一个 student latent 不足以稳定覆盖多地形多命令,以及训练好后怎么知道哪个 checkpoint 真能上实机”。
18. 论文中几个容易误解的点
18.1 RoboGauge 不是 Sim-to-Real 的理论保证
它是 empirical proxy,而不是证明:
S R o b o G a u g e ↑ ⇒ S r e a l ↑ S_{RoboGauge}\uparrow \Rightarrow S_{real}\uparrow SRoboGauge↑⇒Sreal↑
在所有机器人、所有场景下一定成立。
论文通过 Go2 与若干典型场景证明其相关性较强,但跨 morphology、跨 actuator 类型、跨更大质量尺度是否仍成立,需要更多实验。
18.2 MoE expert 并没有人工绑定 terrain label
不是:
- expert 1 = flat;
- expert 2 = stairs;
- expert 3 = slope。
真正的结构是 soft gating。PCA 中 terrain separability 只是说明 latent 形成区分,并不等价于每个 expert 与 terrain 一一对应。
18.3 4 m/s 不完全来自 MoE
高速性能是整个 training recipe 的结果,包括:
- command curriculum;
- tracking precision scheduling;
- extreme command sampling;
- hip symmetry;
- reward weights;
- domain randomization;
- MoE representation。
不能将 4.01 m/s 单独归因于 MoE。
18.4 RoboGauge 不应该成为新的“可被过拟合 reward”
如果后续训练反复针对 RoboGauge 的固定 terrain、固定 friction sweep、固定 metric 权重调参,也可能出现 benchmark overfitting。因此更理想的未来版本应:
- 保留 hidden test randomizations;
- 扩大 dynamics parameter family;
- 使用更多仿真器;
- 加入真实数据校准;
- 做跨机器人 ranking consistency validation。
19. 对论文方法的深入评价
19.1 最强贡献:不是一个新 RL optimizer,而是一个部署工程范式
本文没有提出类似 PPO/TD3 那样全新的 policy gradient 算法,其创新核心更偏向系统架构与 evaluation methodology。
对于真实机器人团队,这一点反而很重要。实际工程中经常出现:
- 训练曲线很好;
- 随机选一个 final checkpoint;
- 上实机才发现抖动、过流、打滑、摔倒;
- 再回去手工改 reward。
RoboGauge 给出了一个标准化 intermediate gate,可以把这种迭代流程正规化。
19.2 MoE 的优势与代价
优势:
- 更强的多模态表示能力;
- terrain/command latent 更可分;
- specialist expert 减少任务干扰;
- 不需要 exteroception。
代价:
- 参数量和推理计算增加;
- gating behavior 增加可解释难度;
- expert collapse 需要额外 loss;
- 如果场景分布极端不均衡,batch-level load balance 可能与最优 specialization 冲突。
19.3 只用 proprioception 的优点与上限
优点:
- 不依赖光照;
- 不怕视觉遮挡;
- 不需要 LiDAR/相机标定;
- 推理链更短;
- 对冲击/振动环境更简单可靠。
但它本质上是reactive / history-based perception:只有踩到、撞到或姿态变化后才能知道前方地形。对:
- 深坑;
- 高台阶;
- 离散 stepping stone;
- 需要提前规划足端落点的结构化障碍;
仅 proprioception 会受到明显限制。作者也在 future work 中明确提出向 exteroceptive perception 扩展。
19.4 RoboGauge 的统计可信度仍可进一步加强
论文展示了 MuJoCo 指标相较 Isaac Gym 更接近真实测量,但如果要把“predictability”进一步做成通用 benchmark,最好继续报告:
- 多个 policy checkpoint 的 RoboGauge score 与 real score 的 Spearman rank correlation;
- Pearson correlation;
- calibration curve;
- failure probability vs score;
- 多个机器人 morphology 上的 cross-platform correlation。
目前结果足以说明其有效,但距离“通用 Sim-to-Real predictor”还有进一步研究空间。
20. 复现路线建议
官方已经把训练、评估、部署分为三个仓库,复现时建议严格按论文的逻辑顺序:
20.1 第一步:先跑通训练 baseline
仓库:wty-yy/go2_rl_gym
重点确认:
- Go2 URDF / asset;
- PD gains;
- observation ordering;
- action scaling;
- reward weights;
- terrain curriculum;
- domain randomization;
- PPO / teacher–student 配置。
官方最终任务/配置可重点关注 go2_moe_cts 相关内容。
20.2 第二步:理解 MoE 插入位置
源码核验时最值得看的是:
- 原 CTS student encoder 在哪里;
- expert module 如何并行;
- gate 输入是否拼接 observation history / command;
- softmax 权重维度;
- mixture latent 如何进入 actor;
- load balance loss 如何加到总 loss;
- teacher latent 与 student latent 的 supervision/reconstruction 如何实现。
最容易写错的一点是把它说成“多个 actor 的动作加权”。本文不是这个结构。
20.3 第三步:独立运行 RoboGauge
仓库:wty-yy/RoboGauge
核对:
- Isaac Gym policy 到 MuJoCo model 的 joint order;
- observation normalization;
- action scale;
- control timestep;
- terrain generator;
- friction/randomization;
- metrics normalization;
- 5-seed success 判定;
- binary-search level;
- weighted geometric score;
- multiprocessing。
20.4 第四步:用多个 checkpoint 验证“排序能力”
不要只拿 final checkpoint。应取:
- early;
- middle;
- late;
- high training reward;
- high terrain level;
- high RoboGauge score;
分别做实机小规模验证,检查 RoboGauge ranking 是否比 training reward ranking 更接近真实表现。
20.5 第五步:再做 C++ 实机部署
仓库:wty-yy/unitree_cpp_deploy
重点检查:
- Unitree SDK 状态接口;
- IMU 坐标系;
- joint order;
- default joint pose;
- action clipping;
- PD gain;
- policy inference frequency;
- emergency stop;
- fall protection;
- command input。
只有训练侧与部署侧 observation/action convention 完全一致,Sim-to-Real 才有意义。
21. 从机器人强化学习角度看,这篇论文最值得学习的五个思想
1. 训练 reward 与部署评价必须解耦
同一套指标既做优化目标又做最终评估,很容易 reward hacking。RoboGauge 用不同物理引擎和多维 metric 做外部验证,是很成熟的工程思路。
2. MoE 应放在对控制更安全的层级
对于连续机器人控制,与其直接混 action,不如先混 latent representation,再由共享 actor 输出连续动作。
3. 多地形学习不仅是 terrain adaptation,也是 command-conditioned adaptation
同一地形在不同速度和转向指令下对应不同 contact regime,因此 terrain 与 command 应联合进入表示学习。
4. 平均值会掩盖机器人最危险的失败模式
Worst-Case Mean 与几何平均都在主动放大短板,这与实机部署“任何一个严重失败都不可接受”的目标更加一致。
5. Sim-to-Sim 的价值不是替代 Sim-to-Real,而是把坏策略提前筛掉
真正合理的目标不是宣称“MuJoCo 能代表现实”,而是:
用便宜的跨引擎 stress test 把明显依赖训练仿真器、稳定裕度低的策略在上机前淘汰。
22. 论文局限性与可继续研究的方向
22.1 RoboGauge 目前主要在 Unitree Go2 上验证
不同机器人具有不同:
- morphology;
- actuator bandwidth;
- gearbox friction;
- inertia;
- foot shape;
- contact material。
因此 α , β \alpha,\beta α,β、metric normalization 和 domain randomization 范围能否直接跨平台复用尚未完全证明。
22.2 评价体系存在人为超参数
例如:
- metric weights;
- lowest 50% Worst-Case Mean;
- 80% pass threshold;
- α = 0.09 \alpha=0.09 α=0.09;
- β = 0.19 \beta=0.19 β=0.19;
- friction sweep 范围。
这些值目前主要由经验和工程需求设定。未来可以通过真实部署数据进行自动校准。
22.3 仍缺少显式提前感知
proprioception-only 对已经发生的接触变化很强,但对必须提前规划的障碍存在天然限制。未来可将:
- depth camera;
- LiDAR;
- height map;
- VLM/vision encoder;
作为额外 expert 或 gate 条件,让 MoE 同时处理 proprioceptive dynamics 与 exteroceptive geometry。
22.4 需要更系统的“RoboGauge score → real success probability”标定
真正理想的 deployment predictor 应能回答:
P ( real success ∣ S R o b o G a u g e ) . P(\text{real success}\mid S_{RoboGauge}). P(real success∣SRoboGauge).
这需要更大的真实实验数据集,而不仅是几个代表策略/场景。
22.5 文本版本中存在少量记号不一致
核验 arXiv v4 时可以看到:
- Introduction 提到 6 metrics、4 domain randomizations;
- Table II / Fig. 3 / 正式 IV-C 又给出 K = 8 K=8 K=8、 M = 9 M=9 M=9;
- 项目主页仍以“6 metrics”描述 RoboGauge。
本文解读采用正式评分公式与 Fig. 3 的最新版定义: N = 7 , M = 9 , K = 8 N=7,M=9,K=8 N=7,M=9,K=8,并将其理解为“6 项核心 proprioceptive metrics + 2 项扩展稳定性 metrics”。复现时应以当前开源 RoboGauge 配置为最终准绳。
23. 最终总结
这篇论文可以浓缩成一句话:
它一方面用 MoE 把 proprioceptive history 中的“地形 × 运动命令”建模能力做得更强,另一方面用 RoboGauge 把“这个策略是否值得上实机”从训练 reward 的经验判断,升级为跨物理引擎、多地形、多随机化、多物理指标的系统化压力测试。
从算法上,最关键的是:
History Proprioception → MoE Latent Representation → Shared Actor → Joint Position Targets \boxed{ \text{History Proprioception} \rightarrow \text{MoE Latent Representation} \rightarrow \text{Shared Actor} \rightarrow \text{Joint Position Targets} } History Proprioception→MoE Latent Representation→Shared Actor→Joint Position Targets
从部署方法论上,最关键的是:
Train in Isaac Gym → Evaluate in MuJoCo / RoboGauge → Select Checkpoint → Deploy on Go2 \boxed{ \text{Train in Isaac Gym} \rightarrow \text{Evaluate in MuJoCo / RoboGauge} \rightarrow \text{Select Checkpoint} \rightarrow \text{Deploy on Go2} } Train in Isaac Gym→Evaluate in MuJoCo / RoboGauge→Select Checkpoint→Deploy on Go2
它的学术价值并不只体现在 4.01 m/s、30 cm obstacle 或 100 N disturbance 这些性能数字上,更重要的是提出了一种非常实用的思路:机器人 RL 的目标不应该只是把训练 reward 做高,而应该建立一个独立、保守、可量化的部署前评价层,主动筛掉“看起来训练得很好、实际上并不可靠”的策略。
对于后续四足/双足运动控制研究,RoboGauge 这种 evaluation-first 思路可以进一步扩展到 humanoid、视觉运动、WBC+RL、MPC+RL 以及不同硬件平台的策略筛选中。
参考链接
- Wu et al., Toward Reliable Sim-to-Real Predictability for MoE-based Robust Quadrupedal Locomotion, RSS 2026 / arXiv:2602.00678v4.
https://arxiv.org/abs/2602.00678 - Project Page.
https://robogauge.github.io/complete/ - Training Code —
go2_rl_gym.
https://github.com/wty-yy/go2_rl_gym - Evaluation Code —
RoboGauge.
https://github.com/wty-yy/RoboGauge - Deployment Code —
unitree_cpp_deploy.
https://github.com/wty-yy/unitree_cpp_deploy
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)