文献:Learning Humanoid Standing-up Control across Diverse Postures(HoST)
会议:Robotics: Science and Systems(RSS 2025),Best Systems Paper Finalist
作者:Tao Huang, Junli Ren, Huayi Wang, Zirui Wang, Qingwei Ben, Muning Wen, Xiao Chen, Jianan Li, Jiangmiao Pang
DOI:10.15607/RSS.2025.XXI.064
RSS 正式版:https://www.roboticsproceedings.org/rss21/p064.html
项目主页:https://taohuang13.github.io/humanoid-standingup.github.io/
开源代码:https://github.com/InternRobotics/HoST

1. 论文概览

HoST 研究的是人形机器人最基础、也最容易被现有系统忽略的一项能力:从倒地、倚靠、半坐卧等多样初始姿态自主站起,并将仿真中训练出的控制策略直接部署到真实机器人。与常规双足行走相比,站起过程具有更剧烈的全身动力学耦合、更频繁的接触切换和更大的关节运动范围;与动作模仿不同,它又不能假设存在一条适用于所有支撑物和初始姿态的参考轨迹。

论文以 Unitree G1 为主要平台,采用从零开始的强化学习训练,不依赖动作捕捉、人工关键帧序列或离线轨迹优化。核心方法由四部分组成:

  1. 将复杂奖励划分为任务、动作风格、正则化和站起后保持四组,并为每组配置独立价值网络;
  2. 通过逐步撤除的竖直拉力解决“倒地到跪起”阶段难以探索的问题;
  3. 通过逐步收紧的动作缩放系数与 L2C2 平滑正则约束动作速度、冲击和振荡;
  4. 通过多类支撑地形、动力学随机化和观测噪声提高 sim-to-real 鲁棒性。

最终策略在地面、平台、墙面支撑和斜坡四类场景中完成了真实机器人站起,并表现出负载适应、抗冲击、跌落恢复和斜坡动态平衡等未被直接指定的能力。

图 1 HoST 总览。(a)机器人从实验室及户外环境中的多种初始姿态站起;(b)策略对外力、地面阻挡物、12 kg 负载及困难初始姿态保持鲁棒性。

2. 关键科学问题与技术挑战

2.1 科学问题

论文试图回答的问题可以概括为:

在没有参考动作和真实机器人示范数据的条件下,能否训练出一种可直接迁移到真实人形机器人的站起控制策略,使其适应不同支撑关系、初始姿态和外界扰动,同时避免强化学习常见的暴力、振荡和高冲击动作?

该问题并不是简单的“让基座高度升高”。一个可部署的站起控制器至少需要同时满足:

  • 从倒地状态发现可行的接触序列;
  • 协调手、膝、脚、躯干等多个接触部位;
  • 在不同支撑物高度和倾角下调整动作模式;
  • 在站起过程中控制角动量和质心位置;
  • 到达直立姿态后迅速稳定,避免脚部滑移或二次跌倒;
  • 输出动作必须符合真实电机的带宽、力矩和冲击承受范围。

2.2 四项主要技术挑战

(1)多阶段技能难以用单一奖励统一优化

站起至少包含“翻正身体—形成跪姿或坐姿—抬升身体—稳定直立”等阶段。不同阶段的目标会发生变化:早期需要鼓励探索和接触,中期需要建立支撑,后期则需要降低速度并稳定质心。大量奖励直接加权求和时,单一 critic 需要同时拟合统计尺度和稀疏性差异很大的回报,容易出现价值估计失衡。

(2)从完全倒地状态进行随机探索效率极低

23 自由度 G1 的关节空间很大,单纯依靠 PPO 的动作噪声,很难偶然产生“躯干翻正并形成稳定跪姿”的完整动作链。若早期探索始终失败,后续站立奖励几乎不会被访问,训练会停留在局部最优。

(3)仿真中“成功”的动作可能无法在真机执行

站起任务允许大幅度关节运动,而人形机器人髋、膝等关节力矩较高。若只优化成功率,策略容易利用仿真器中的刚性接触和理想执行器,学习快速砸地、弹跳、关节打满或高频振荡等动作。此类动作即使仿真成功率高,也会在真机上造成跌倒、过流、结构冲击或控制失稳。

(4)初始接触关系和真实动力学均存在明显分布差异

真实机器人可能躺在地板、靠在沙发、倚墙、位于斜坡或平台边缘。不同场景的接触几何、摩擦、质心偏差、电机力矩和控制延迟并不一致,仅在单一平地和固定动力学参数下训练难以直接迁移。

3. 与既有工作的区别

论文将已有站起方法概括为两类:一类依赖模型、轨迹优化和人工动作序列;另一类使用强化学习,但多数仍依赖参考轨迹,或仅在仿真和平地场景中验证。HoST 的目标是在高自由度真实人形机器人上同时满足“无先验轨迹、非平地姿态、单阶段训练和直接 sim-to-real”。

表 1 论文对既有站起控制方法的定位

方法 真实机器人 无先验轨迹 超出平地场景 高自由度 单阶段训练
Peng et al.
Yang et al.
Tao et al.
Haarnoja et al.
Gaspard et al.
HoST

这里的“单阶段训练”是指不先生成或学习一套参考动作,再训练跟踪控制器;HoST 在同一个强化学习过程中直接形成站起技能。不过,开源实现仍按 ground、platform、wall、slope 分别训练策略,仓库的待办事项中保留了“joint training over all terrains”。因此,“跨多样姿态”更准确地理解为同一套方法能够在多类姿态上分别训练和部署,并非当前已经得到一个覆盖全部地形的统一策略。

4. 问题建模

4.1 有限时域 MDP

站起任务被建模为有限时域马尔可夫决策过程:

M=⟨S,A,T,R,γ⟩. \mathcal{M}=\langle\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{R},\gamma\rangle. M=S,A,T,R,γ.

在时刻 ttt,策略 πθ(at∣st)\pi_\theta(a_t\mid s_t)πθ(atst) 根据状态 sts_tst 输出动作 ata_tat,环境按照转移函数 T\mathcal{T}T 产生下一状态,并返回奖励 rtr_trt。优化目标为最大化折扣累计回报:

J(θ)=Eπθ[∑t=0T−1γtrt]. J(\theta)=\mathbb{E}_{\pi_\theta}\left[\sum_{t=0}^{T-1}\gamma^t r_t\right]. J(θ)=Eπθ[t=0T1γtrt].

基础强化学习算法采用 PPO。PPO 的裁剪代理目标为:

LPPO(θ)=E[min⁡(hot(θ)At,clip⁡(ρt(θ),1−ϵ,1+ϵ)At)], \mathcal{L}_{\mathrm{PPO}}(\theta)= \mathbb{E}\left[ \min\left( ho_t(\theta)A_t, \operatorname{clip}(\rho_t(\theta),1-\epsilon,1+\epsilon)A_t\right) \right], LPPO(θ)=E[min(hot(θ)At,clip(ρt(θ),1ϵ,1+ϵ)At)],

其中 ρt\rho_tρt 是新旧策略概率比,AtA_tAt 是优势估计。

4.2 观测空间

策略只使用本体感知信息,不使用相机、激光雷达或外部动作捕捉:

st=[ωt,rt,qt,pt,p˙t,at−1,β]. s_t=[\omega_t,r_t,q_t,p_t,\dot p_t,a_{t-1},\beta]. st=[ωt,rt,qt,pt,p˙t,at1,β].

其中:

  • ωt\omega_tωt:机器人基座角速度;
  • rt,qtr_t,q_trt,qt:基座滚转角和俯仰角;
  • pt,p˙tp_t,\dot p_tpt,p˙t:关节位置和关节速度;
  • at−1a_{t-1}at1:上一控制周期动作;
  • β\betaβ:动作缩放系数。

默认策略还输入前 5 个历史状态。站起是典型的接触丰富任务,但机器人并没有显式的触觉或接触状态观测;历史序列使策略可以从姿态和速度变化中隐式判断身体是否被地面、墙面或平台支撑。

4.3 动作空间与低层 PD 控制

策略动作表示下一时刻关节目标相对当前位置的增量,单维动作被限制在 [−1,1][-1,1][1,1]

ptd=pt+βat. p_t^d=p_t+\beta a_t. ptd=pt+βat.

低层 PD 控制器输出:

τt=Kp(ptd−pt)−Kdp˙t=Kpβat−Kdp˙t. \tau_t=K_p(p_t^d-p_t)-K_d\dot p_t =K_p\beta a_t-K_d\dot p_t. τt=Kp(ptdpt)Kdp˙t=KpβatKdp˙t.

这一定义非常关键。β\betaβ 不只是一个普通的动作缩放参数,它直接缩放比例项产生的目标力矩。随着 β\betaβ 从 1 降至 0.25,单周期允许的关节目标变化、比例控制力矩和等效运动速度都会同步降低,从而形成一种不需要显式速度规划的隐式运动速度上界

表 2 HoST 的状态、动作和控制频率

模块 主要内容 频率/约束
策略观测 IMU、关节编码器、上一动作、动作缩放系数及历史状态 策略 50 Hz
策略动作 23 个关节位置增量 每维 [−1,1][-1,1][1,1]
仿真 PD 目标位置跟踪 200 Hz
真机 PD 目标位置跟踪 500 Hz
动作缩放 ptd=pt+βatp_t^d=p_t+\beta a_tptd=pt+βat β:1→0.25\beta:1\rightarrow0.25β:10.25

5. HoST 总体框架与技术路线

图 2 HoST 框架。(a)仿真训练由多 critic、控制策略、动作缩放器、奖励和运动约束构成;(b)训练后的策略在真机上只依赖 IMU 和关节编码器,可直接输出 PD 目标。

完整技术路线可归纳为以下闭环:

  1. 在 Isaac Gym 中构建 4096 个并行环境,并针对地面、平台、墙面和斜坡生成不同初始姿态;
  2. 机器人从倒地或倚靠状态开始,策略根据本体感知历史输出关节增量;
  3. PD 控制器将关节增量转化为力矩,仿真器推进接触动力学;
  4. 根据基座高度划分动作阶段,并计算四组奖励;
  5. 每组奖励由独立 critic 估计优势,归一化后加权合成 PPO 的总优势;
  6. 训练初期施加竖直拉力并允许较大动作范围;策略达到目标高度后,逐步撤除拉力并收紧动作范围;
  7. 在 actor 和所有 critic 上加入 L2C2 局部平滑约束;
  8. 训练过程中随机化质量、质心、摩擦、恢复系数、PD 增益、电机强度、控制延迟和初始姿态;
  9. 收敛后移除训练辅助力,将策略直接部署到 G1 的板载计算平台。

6. 核心算法原理

6.1 基于高度的三阶段任务分解

论文没有使用显式有限状态机切换多个控制器,而是根据基座高度在同一策略内部激活不同奖励:

{hbase<Hstage1,翻正身体阶段,Hstage1<hbase<Hstage2,抬升身体阶段,hbase>Hstage2,稳定站立阶段. \begin{cases} h_{\mathrm{base}}<H_{\mathrm{stage1}}, & \text{翻正身体阶段},\\ H_{\mathrm{stage1}}<h_{\mathrm{base}}<H_{\mathrm{stage2}}, & \text{抬升身体阶段},\\ h_{\mathrm{base}}>H_{\mathrm{stage2}}, & \text{稳定站立阶段}. \end{cases} hbase<Hstage1,Hstage1<hbase<Hstage2,hbase>Hstage2,翻正身体阶段,抬升身体阶段,稳定站立阶段.

附录给出的阈值为:

Hstage1=0.45 m,Hstage2=0.65 m. H_{\mathrm{stage1}}=0.45\ \mathrm{m},\qquad H_{\mathrm{stage2}}=0.65\ \mathrm{m}. Hstage1=0.45 m,Hstage2=0.65 m.

这种设计保留了单策略的连续性,又使奖励能够随任务进度变化。例如,小腿竖直和低基座角速度奖励在进入抬升阶段后生效,站起后的基座高度、速度、姿态和上身姿态奖励只在第三阶段生效。

6.2 四组奖励与多 critic 优化

总奖励写为:

rt=wtaskrttask+wstylertstyle+wregurtregu+wpostrtpost. r_t=w^{\mathrm{task}}r_t^{\mathrm{task}} +w^{\mathrm{style}}r_t^{\mathrm{style}} +w^{\mathrm{regu}}r_t^{\mathrm{regu}} +w^{\mathrm{post}}r_t^{\mathrm{post}}. rt=wtaskrttask+wstylertstyle+wregurtregu+wpostrtpost.

表 3 奖励分组及作用

奖励组 组权重 代表项 主要作用
任务奖励 rtaskr^{\mathrm{task}}rtask 2.5 头部高度、基座朝向 定义“站起来”的高层目标
风格奖励 rstyler^{\mathrm{style}}rstyle 1.0 腰髋膝关节范围、脚间距、脚踝平行、绊脚、小腿方向 约束接触方式和动作形态,避免关节极限与不合理姿态
正则奖励 rregur^{\mathrm{regu}}rregu 0.1 加速度、动作变化率、二阶动作差分、力矩、功率、速度、跟踪误差 抑制高频、高冲击和高能耗动作
站起后奖励 rpostr^{\mathrm{post}}rpost 1.0 基座角/线速度、朝向、高度、上身姿态、双脚平行 使机器人站起后保持稳定,而不是仅短暂越过高度阈值

单 critic 需要拟合四类分布差异显著的回报。HoST 为每一组奖励配置独立价值函数 VϕiV_{\phi_i}Vϕi,每个 critic 通过相应组的回报独立训练,并使用 GAE 计算优势 AϕiA_{\phi_i}Aϕi。各组优势先在批内标准化,再加权求和:

At=∑iwiAϕi,t−μAϕiσAϕi. A_t=\sum_i w^i \frac{A_{\phi_i,t}-\mu_{A_{\phi_i}}} {\sigma_{A_{\phi_i}}}. At=iwiσAϕiAϕi,tμAϕi.

归一化是该结构的关键。若直接累加不同奖励组的优势,数值尺度较大的组仍会主导更新;独立标准化后,组权重 wiw^iwi 才更接近“任务优先级”而不是补偿数值尺度。最终所有 critic 与共享 actor 同步更新。

从控制角度看,多 critic 并未把站起拆成多个策略,而是把价值估计问题分解。同一 actor 仍学习连续的全身动作,各 critic 则分别回答“当前状态对任务进度、动作风格、平滑性和站起后稳定性是否有利”。

6.3 竖直拉力课程:把不可达奖励变成可学习信号

训练初期在机器人基座施加向上的拉力 F\mathcal{F}F。该力只在躯干接近竖直、已经形成近似坐姿或跪姿时生效,因此不会直接把完全倒地的机器人吊起,而是帮助其完成最难探索的“从稳定跪姿继续抬升”阶段。

课程更新条件为:一个 episode 结束时头部高度 hheadh_{\mathrm{head}}hhead 达到目标高度 HheadH_{\mathrm{head}}Hhead。初始设置与更新规则为:

F0=200 N,β0=1, \mathcal{F}_0=200\ \mathrm{N},\qquad \beta_0=1, F0=200 N,β0=1,

每次达到课程条件后:

F←max⁡(0,F−20 N), \mathcal{F}\leftarrow\max(0,\mathcal{F}-20\ \mathrm{N}), Fmax(0,F20 N),

β←max⁡(0.25,β−0.02). \beta\leftarrow\max(0.25,\beta-0.02). βmax(0.25,β0.02).

这相当于一种“支架逐步撤除”的训练:早期先让策略频繁看到成功后的状态和奖励,建立基本动作链;随着能力增强,外部帮助逐步减弱,最终策略在 F=0\mathcal{F}=0F=0 时独立完成站起。

与 RND 等通用内在奖励相比,拉力课程直接利用了站起任务的物理结构。实验中,RND 能改善平台场景,但在墙面和斜坡仍无法获得有效探索,说明通用新颖性奖励并不等价于提供恰当的动力学“脚手架”。

6.4 动作边界课程:先允许探索,再限制真机风险

固定使用很小的动作边界会让策略无法发现需要大关节运动的站起动作;始终使用大边界又会产生暴力动作。HoST 将动作范围也纳入课程:训练初期 β=1\beta=1β=1,允许广泛探索;达到站起目标后逐步降至 0.25。

这一设计与拉力课程互补:

  • 拉力逐步减小,任务动力学变难;
  • 动作边界同步减小,控制输出变得更保守;
  • 策略必须在外部帮助减少的同时,把早期发现的粗糙动作压缩为更平滑、更节能的动作。

固定 β=0.25\beta=0.25β=0.25 虽能减少冲击,但会限制早期探索,在墙面场景的成功率低于课程版本;完全取消动作边界则会显著增加脚部移动、动作不平滑度和能量消耗。

6.5 L2C2 局部平滑正则

仅依靠动作变化率和加速度惩罚,仍可能在相邻状态附近产生不连续的策略输出。论文进一步引入 L2C2,对 actor 和所有 critic 施加局部 Lipschitz 型约束:

LL2C2=λπD(πθ(st),πθ(sˉt))+λV∑iD(Vϕi(st),Vϕi(sˉt)), \mathcal{L}_{\mathrm{L2C2}}= \lambda_\pi D\bigl(\pi_\theta(s_t),\pi_\theta(\bar s_t)\bigr) +\lambda_V\sum_i D\bigl(V_{\phi_i}(s_t),V_{\phi_i}(\bar s_t)\bigr), LL2C2=λπD(πθ(st),πθ(sˉt))+λViD(Vϕi(st),Vϕi(sˉt)),

其中

sˉt=st+(st+1−st)u,u∼U(0,1). \bar s_t=s_t+(s_{t+1}-s_t)u,\qquad u\sim\mathcal{U}(0,1). sˉt=st+(st+1st)u,uU(0,1).

sˉt\bar s_tsˉt 位于连续两个真实访问状态之间。L2C2 要求策略和价值函数在这段局部状态流形上平滑变化,从网络函数层面抑制控制输出跳变。论文设置:

λπ=1,λV=0.1. \lambda_\pi=1, \qquad \lambda_V=0.1. λπ=1,λV=0.1.

真机实验表明,取消 L2C2 后会在平台、墙面和斜坡等接触复杂场景出现明显振荡,并直接导致站起失败。

6.6 多场景地形建模

图 3 仿真地形与对应真实场景。四类训练地形分别为平地、平台、墙面和斜坡,用于产生地面平躺、躯干被平台支撑、倚墙和整体倾斜等初始接触关系。

论文并非随机生成任意三维场景,而是选取四类具有代表性的支撑几何:

  • Ground:平地,机器人完全倒地;
  • Platform:平台托住躯干,近似沙发、椅子、矮台等场景;
  • Wall:近竖直表面支撑躯干,近似倚墙或倚靠家具;
  • Slope:整体倾斜支撑面,形成不同重力投影和滑移趋势。

附录给出的随机范围为:平台高度 20—92 cm,斜坡倾角约 1°—14°,墙面相对地面的倾角约 14°—84°。这些参数并不追求完整重建真实场景,而是让策略覆盖决定站起动作的主要几何因素:支撑高度、支撑方向和重力相对姿态。

6.7 域随机化与观测噪声

表 4 主要动力学随机化范围

随机项 取值范围
躯干质量偏差 U(−2,5)\mathcal{U}(-2,5)U(2,5) kg
基座质心偏移 x,y:±0.12x,y:\pm0.12x,y:±0.12 m,z:±0.08z:\pm0.08z:±0.08 m
连杆质量缩放 U(−0.8,1.2)×\mathcal{U}(-0.8,1.2)\timesU(0.8,1.2)× 默认值
摩擦系数 U(0.1,1)\mathcal{U}(0.1,1)U(0.1,1)
恢复系数 U(0,1)\mathcal{U}(0,1)U(0,1)
Kp,KdK_p,K_dKp,Kd 缩放 U(0.85,1.15)\mathcal{U}(0.85,1.15)U(0.85,1.15)
随机力矩扰动 ±5%\pm5\%±5% 关节力矩上限
电机强度 U(0.9,1.1)\mathcal{U}(0.9,1.1)U(0.9,1.1)
控制延迟 U(0,100)\mathcal{U}(0,100)U(0,100) ms
初始关节角偏移 U(−0.1,0.1)\mathcal{U}(-0.1,0.1)U(0.1,0.1) rad
初始关节角缩放 U(0.9,1.1)×\mathcal{U}(0.9,1.1)\timesU(0.9,1.1)× 默认角度

质心偏移被论文认为是影响真实部署最明显的随机项。站起动作对髋、膝力矩和躯干质心非常敏感,真实机器人中的线缆、外壳、装配误差和负载都会改变等效质心;若训练时质心固定,策略容易过拟合一条狭窄的力矩—姿态关系。

观测端还加入独立噪声:角速度 U(−0.2,0.2)\mathcal{U}(-0.2,0.2)U(0.2,0.2)、滚转/俯仰 U(−0.05,0.05)\mathcal{U}(-0.05,0.05)U(0.05,0.05)、关节位置 U(−0.01,0.01)\mathcal{U}(-0.01,0.01)U(0.01,0.01)、关节速度 U(−1.5,1.5)\mathcal{U}(-1.5,1.5)U(1.5,1.5),动作缩放系数噪声 U(−0.025,0.025)\mathcal{U}(-0.025,0.025)U(0.025,0.025)

7. 奖励设计细节

论文附录列出了完整奖励。其设计思路不是单纯堆叠平滑项,而是围绕“可站起、动作合理、执行安全、站后稳定”形成层次化结构。

7.1 任务奖励

  • 头部高度容差奖励:鼓励头部进入目标高度区间;
  • 基座朝向奖励:利用投影重力方向判断躯干是否接近竖直。

容差函数 ftol(i,b,m,v)f_{\mathrm{tol}}(i,b,m,v)ftol(i,b,m,v) 在输入 iii 位于目标区间 bbb 时取 1,离开区间后按高斯形式下降,并在由 margin mmm 定义的距离处下降到 vvv。相比硬阈值,它在远离目标时仍能提供连续梯度。

7.2 风格奖励

风格奖励主要约束腰部、髋部、膝部和肩部关节不要进入危险范围,同时约束:

  • 质心投影靠近足部支撑区域;
  • 左右脚踝与地面近似平行;
  • 双脚距离不过大;
  • 避免脚部出现异常水平碰撞力;
  • 抬升阶段小腿接近竖直;
  • 抬升阶段基座角速度较低。

其中脚踝平行奖励使用 URDF 中人为添加的踝部关键点,通过关键点高度方差近似判断脚底是否平行,不依赖精确碰撞网格。这一做法便于工程实现,但也说明方法仍包含机器人结构相关的手工设计。

7.3 正则化奖励

主要项包括:

∥p¨∥2,∥at−at−1∥2,∥at−2at−1+at−2∥2, \|\ddot p\|^2, \quad \|a_t-a_{t-1}\|^2, \quad \|a_t-2a_{t-1}+a_{t-2}\|^2, p¨2,atat12,at2at1+at22,

∥τ∥2,∣τ∣T∣p˙∣,∥p˙∥2,∥pt−pttarget∥2, \|\tau\|^2, \quad |\tau|^T|\dot p|, \quad \|\dot p\|^2, \quad \|p_t-p_t^{\mathrm{target}}\|^2, τ2,τTp˙,p˙2,ptpttarget2,

并对关节位置、速度越界施加强惩罚。二阶动作差分项抑制动作加速度,关节功率项抑制高力矩与高速度同时出现,PD 跟踪误差项则避免策略反复给出真实执行器无法跟踪的目标。

7.4 站起后保持奖励

hbase>Hstage2h_{\mathrm{base}}>H_{\mathrm{stage2}}hbase>Hstage2 后,策略继续优化:

  • 基座角速度和水平线速度趋近于零;
  • 基座保持竖直并达到目标高度;
  • 上身回到目标姿态;
  • 左右脚保持平行。

因此,成功定义不是“某一瞬间高度超过阈值”,而是必须在 episode 剩余时间保持高度和稳定性。

8. 训练实现与硬件设置

表 5 主要训练配置

项目 配置
仿真器 NVIDIA Isaac Gym
并行环境 4096
机器人 Unitree G1,35 kg,1.32 m,23 个驱动自由度
板载计算 Jetson Orin NX
Actor 3 层 MLP,隐藏层 [512,256,128][512,256,128][512,256,128]
每个 Critic 2 层 MLP,隐藏层 [512,256][512,256][512,256]
每次迭代采样 每环境 50 步
Episode 长度 500 个策略步,约 10 s
PPO 更新 5 epochs,4 mini-batches
折扣因子 γ=0.99\gamma=0.99γ=0.99
PPO clip ϵ=0.2\epsilon=0.2ϵ=0.2
熵系数 0.01
策略频率 50 Hz
仿真/真机 PD 频率 200 Hz / 500 Hz

G1 仿真 PD 增益为:髋关节 Kp/Kd=150/4K_p/K_d=150/4Kp/Kd=150/4,膝关节 200/6200/6200/6,踝关节 40/240/240/2,肩、肘和腰部均为 100/4100/4100/4。论文发现真机存在明显的关节力矩差距,部署时将髋、膝刚度提高到约 200 和 275。该现象也与图 9 中真机关节速度偏差相互印证。

9. 仿真实验设计与结果

9.1 评价指标

论文专门提出四项站起控制指标:

  1. 成功率 EsuccE_{\mathrm{succ}}Esucc:基座高度超过目标高度,并在剩余 episode 中持续保持;
  2. 脚部移动 EfeetE_{\mathrm{feet}}Efeet:达到目标高度后双脚移动距离,反映站立稳定性;
  3. 平滑度 EsmthE_{\mathrm{smth}}Esmth:关节位置二阶差分累计量:

Esmth=∑t=0T−2∥pt+2−2pt+1+pt∥2; E_{\mathrm{smth}}=\sum_{t=0}^{T-2}\|p_{t+2}-2p_{t+1}+p_t\|_2; Esmth=t=0T2pt+22pt+1+pt2;

  1. 能量 EengyE_{\mathrm{engy}}Eengy:站起前的机械功率积分近似:

Eengy≈∑hbase<Hstage2∣τt∣T∣p˙t∣ Δt,Δt=0.02 s. E_{\mathrm{engy}}\approx \sum_{h_{\mathrm{base}}<H_{\mathrm{stage2}}} |\tau_t|^T|\dot p_t|\,\Delta t, \qquad \Delta t=0.02\ \mathrm{s}. Eengyhbase<Hstage2τtTp˙tΔt,Δt=0.02 s.

每个策略在每种地形上进行 5 轮评估,每轮 250 个 episode,共 1250 次。评估目标高度为:斜坡 0.6 m,其余地形 0.7 m。

9.2 主结果

表 6 HoST 在四类仿真地形上的成功率

地形 Ground Platform Wall Slope
EsuccE_{\mathrm{succ}}Esucc(%) 99.5±0.499.5\pm0.499.5±0.4 99.8±0.299.8\pm0.299.8±0.2 94.2±1.294.2\pm1.294.2±1.2 98.5±0.498.5\pm0.498.5±0.4

墙面场景成功率最低,原因在于机器人需要利用竖直支撑面调整上身和足部接触,接触序列与其他三类地形差异最大。尽管如此,94.2% 的成功率仍说明策略能够形成稳定、可重复的动作模式。

在这里插入图片描述

图 4 仿真动作分析。左侧为关节空间轨迹的 UMAP 降维结果;右侧为头部、基座、手和脚关键点的三维轨迹。不同地形形成相似但可区分的动作簇,墙面动作模式最特殊。

UMAP 结果说明策略不是简单复现完全相同的关节序列。每类地形内部轨迹总体一致,但会根据初始姿态产生局部变化;手足三维轨迹则显示机器人会调整支撑点和身体姿态完成全身协调。

9.3 消融实验

表 7 关键消融结果与结论

消融项 代表性结果 说明
单 critic 四类地形成功率均为 0 多类奖励由同一价值网络估计时无法形成有效技能
去除拉力课程 Ground/Wall/Slope 均为 0,Platform 为 6.8% 完全倒地到稳定跪姿的探索难度过高
用 RND 替代拉力 Ground 19.8%,Platform 99.5%,Wall/Slope 0 通用内在奖励不足以解决接触动力学探索
去除动作边界 Slope 成功率降至 82.4%,平滑度和能耗明显恶化 大动作范围产生暴力和高冲击运动
固定 β=0.25\beta=0.25β=0.25 Wall 成功率 84.6% 过早限制动作会妨碍探索,课程优于固定小边界
去除 L2C2 仿真仍能站起,但各场景振荡和能耗增大 网络局部平滑性对真机更关键
去除风格奖励 Wall 为 0,Slope 为 21.4% 复杂接触场景需要明确的关节和接触风格约束
无历史状态 Wall 为 64.5% 历史信息承担隐式接触识别作用
5 帧历史 Wall 为 94.2% 中等历史长度在鲁棒性和控制平滑之间较均衡
10 帧历史 Wall 为 88.2% 更长历史并非持续增益,还会增加能耗或降低平滑性

图 5 仿真鲁棒性分析。测试质心偏移、持续矢状面外力、初始关节角偏差和随机力矩丢失。历史状态不足时鲁棒性明显下降;固定小动作边界虽保持较高成功率,但扰动下能耗较高。

图 6 速度、平滑度与能耗权衡。站起时间越长通常越平滑,但速度降低;不同地形的能耗趋势不同,墙面场景在慢速动作下仍可能需要较高能量。

图 6 表明,站起控制不存在“越快越好”的单一目标。缩短站起时间通常会增加关节二阶变化和冲击,而过慢动作又可能在墙面等场景持续输出较大支撑力。动作边界课程本质上是在成功率、速度和平滑性之间寻找可部署的折中。

10. 真实机器人实验

10.1 四类场景的直接迁移

图 7 真实机器人站起序列。策略从仿真直接迁移到地面、平台、墙面和斜坡对应场景。下排为 HoST,上排为去除 L2C2 的策略;缺少平滑正则时可观察到明显振荡和失败。

表 8 真实机器人主要结果

方法 Ground Platform Wall Slope 总成功率 平均平滑度 EsmthE_{\mathrm{smth}}Esmth
HoST-w/o-L2C2 5/5 2/5 4/5 0/5 11/20 6.54
HoST 5/5 5/5 5/5 5/5 20/20 4.01

在 10.5° 斜坡场景中,取消 L2C2 的策略 5 次全部失败,而完整 HoST 5 次全部成功。该结果说明仿真成功率并不能充分代表硬件可部署性;局部平滑正则在真实接触、延迟和电机带宽条件下具有决定性作用。

10.2 户外泛化

图 8 户外实验。机器人在草地、木平台、石板路、石台和倚树等训练中未直接出现的表面与支撑物上完成站起。

户外场景验证的重点不是新的动作类别,而是表面材质、摩擦、局部不平整和支撑物形状变化。机器人在草地、木平台和石板路上的成功表明动力学随机化具有一定效果;倚树和石台则说明“墙面/平台”抽象可以迁移到外观和几何不同的真实物体。

10.3 sim-to-real 误差来源

在这里插入图片描述

图 9 sim-to-real 分析。(a)逐项移除随机化后,质心随机化对迁移性能影响最大;(b)髋、膝关键关节的相图显示仿真与真机位置轨迹相近,但速度差异明显,反映执行器力矩模型仍不准确。

w/ Domain Randomization (✓):使用域随机化,真机能够成功站起。
w/o Domain Randomization (×):不使用域随机化,策略在真机上失败。
w/o CoM Offset (×):训练时没有加入质心偏移随机化,真机迁移失败。
w/o Torque Noise (✓):没有加入关节力矩噪声,但仍能成功站起。
w/o Control Delay (✓):没有进行控制延迟随机化,但仍能成功站起。

论文没有把 sim-to-real 成功简单归因于域随机化,而是进一步比较关键关节相图。真实与仿真关节位置路径大体一致,但速度存在明显偏差,说明策略学到的几何动作序列可以迁移,而执行器输出和阻尼仍存在差距。这也是部署时提高髋膝刚度的原因。

10.4 涌现鲁棒性

图 10 真实机器人中的涌现能力。(a)抵抗 3 kg 球冲击、地面阻挡物和最高 12 kg 负载;(b)受到较大外力后在未完全倒地前恢复;(c)在 15° 湿滑斜坡上保持动态平衡。

表 9 负载与随机力矩丢失鲁棒性

测试项 4 kg 6 kg 8 kg 10 kg 12 kg 5% 丢失 10% 丢失 15% 丢失 20% 丢失
成功率 3/3 3/3 3/3 3/3 2/3 3/3 3/3 3/3 0/3
平滑度 1.75 1.92 1.86 1.82 1.85 2.00 2.16 2.61

这些能力没有通过单独的扰动恢复策略训练,而是由站起任务、动力学随机化、历史观测和站起后稳定奖励共同产生。尤其是站起后保持奖励,使策略在直立状态仍持续调节质心和角动量,因此能够自然扩展到推搡恢复和斜坡平衡。

图 11 站立稳定性。完成站起后,策略仍能抵抗平台晃动、人工推力等外界扰动,为后续与行走控制器衔接提供基础。

10.5 俯卧、侧卧及大型机器人扩展

图 12 更多初始姿态。HoST 可从俯卧姿态训练,并对左侧卧、右侧卧表现出一定零调参泛化能力。

俯卧和仰卧的动作模式差异较大。俯卧训练需要更严格的髋关节偏差约束,并用大腿方向奖励替代部分小腿方向奖励。论文尝试联合训练俯卧与仰卧时出现 rollout 相互干扰,尚未得到稳定的统一策略。

在这里插入图片描述

图 13 向大型人形机器人的扩展。通过少量超参数调整,方法被迁移到 Unitree H1 和 H1-2;图中包含 H1、H1-2 仿真动作及 H1-2 真机动作。

大型机器人质量更高、执行器余量更小,站起时更加依赖上身与地面接触以及髋部大力矩。H1/H1-2 的实验说明框架具有一定跨本体可迁移性,但仍需重新调整拉力比例、阶段高度、目标姿态、奖励权重、PD 参数、观测动作空间和关键点,因此尚不能视为零样本跨机器人泛化。

11. 主要创新点与学术贡献

11.1 无参考轨迹的真实人形机器人多姿态站起

论文最直接的贡献,是证明高自由度人形机器人可以不依赖预定义动作轨迹,从倒地和多种支撑姿态中学习站起,并直接部署到真实 G1。相比参考动作跟踪,该路线允许策略根据实际接触条件形成不同动作,而不需要为沙发、墙面、平台、斜坡分别人工设计完整轨迹。

11.2 面向多目标站起任务的多 critic 奖励分解

HoST 没有通过复杂层级策略拆分动作阶段,而是将奖励按语义分组,为每组配置独立 critic,并在优势层进行归一化融合。消融实验中单 critic 在四类地形均无法学习,说明价值分解不是附加优化技巧,而是该任务收敛的核心条件。

11.3 物理启发的探索课程

竖直拉力课程把人类学习站立时借助外界支撑的过程转化为训练机制。它不是提供动作示范,而是暂时改变环境动力学,使策略能够访问原本几乎不可达的高回报区域,再逐步恢复真实任务。这为其他高自由度、稀疏成功的接触技能提供了可复用思路。

11.4 将“可学习性”和“可部署性”统一到同一课程中

动作边界课程解决了一个常见矛盾:大动作范围有利于探索,小动作范围有利于硬件安全。HoST 先宽后窄,再结合 L2C2 网络平滑约束,使策略从可探索动作逐步过渡到可部署动作。论文通过仿真指标和真实失败率共同验证了这一设计。

11.5 较完整的站起控制评价体系

论文没有只报告成功率,还引入脚部移动、动作平滑度和机械能量,并系统测试质心偏移、持续外力、初始姿态偏差和力矩丢失。真实机器人实验进一步包含户外表面、负载、推搡、障碍、动态平衡和跨机器人扩展,为后续工作提供了较清晰的比较维度。

12. 方法局限与值得注意的边界

12.1 当前并非单一全场景通用策略

开源仓库分别提供 g1_groundg1_platformg1_wallg1_slope 训练任务,“joint training over all terrains”仍列为待办事项。实际系统若面对未知场景,还需要场景识别、策略选择或统一策略训练机制。

12.2 缺少环境感知

策略只使用本体感知,无法提前判断头部、手臂或躯干周围是否存在障碍。论文明确报告户外坐姿站起时可能与周围物体碰撞。面向真实家庭环境,需要引入视觉、深度或触觉感知,并在奖励或安全层中考虑可用空间。

12.3 奖励与关键点仍依赖人工设计

髋膝关节范围、脚踝关键点、支撑距离和各组权重均带有明显的机器人结构先验。迁移到 H1/H1-2 仍需要调整力、阶段高度、PD 参数、关节奖励和目标姿态,说明方法具有框架可迁移性,但尚未实现自动化的跨形态适配。

12.4 俯卧与仰卧联合训练存在技能干扰

不同初始姿态可能要求方向相反的接触序列和关节约束,混合 rollout 会造成优化冲突。未来可考虑条件策略、技能专家、混合价值函数、姿态编码或分阶段蒸馏,以获得统一恢复策略。

12.5 执行器模型差距仍然明显

图 9 显示真实关节速度与仿真差异较大,真机还需要提高髋膝刚度。域随机化能够让策略“扛住”模型误差,但没有消除误差。更准确的电机、减速器、摩擦和结构柔性模型仍可能进一步减少调参和硬件冲击。

12.6 真实实验规模仍有限

四类主要场景每类进行 5 次测试,完整方法总计 20 次。结果足以说明可行性和 L2C2 的显著作用,但对不同地面摩擦、长期硬件磨损、不同电量、更多机器人个体和大规模随机初始姿态的统计覆盖仍不足。

12.7 尚未完成与行走和任务系统的闭环集成

论文验证了站起后保持稳定,但没有展示从跌倒检测、策略切换、站起、恢复定位到继续行走或操作的完整流程。工程系统还需要状态机或行为树处理跌倒判定、场景安全性、控制器切换和失败重试。

13. 对后续研究与工程实现的启示

  1. 探索辅助可以是临时环境动力学,而不必是动作示范。 对翻越、攀爬、起跳等难探索任务,可设计可撤除的拉力、支撑面或外部阻尼课程。
  2. 奖励数量增多时,应优先考虑价值分解,而不是继续手工调权重。 多 critic 通过独立标准化降低了不同奖励尺度之间的竞争。
  3. 硬件可部署性必须进入训练目标。 仅在训练结束后限幅,往往会改变策略实际闭环动力学;HoST 将限幅课程和平滑正则直接置于训练中。
  4. 历史本体感知可以承担低成本接触推断。 在没有足底力传感器时,短历史窗口能从速度变化中编码接触信息,但复杂环境最终仍需要显式感知。
  5. 站起策略应与系统级决策结合。 实际应用中,可由行为树根据倒地朝向、周围空间和支撑物类型选择站起策略,并在失败或碰撞风险升高时进入保护与重规划分支。

14. 开源实现要点

官方仓库基于 legged_gymrsl_rl,提供 G1 四类地形的训练、回放、评估和轨迹可视化脚本。典型命令为:

# 训练四类场景之一:ground / platform / slope / wall
python legged_gym/scripts/train.py \
  --task g1_${terrain} \
  --run_name test_g1

# 回放策略
python legged_gym/scripts/play.py \
  --task g1_${terrain} \
  --checkpoint_path /path/to/ckpt.pt

# 评估成功率、脚部移动、平滑度和能耗
python legged_gym/scripts/eval/eval_${terrain}.py \
  --task g1_${terrain} \
  --checkpoint_path /path/to/ckpt.pt

# 俯卧姿态训练
python legged_gym/scripts/train.py \
  --task g1_ground_prone \
  --run_name test_g1_ground_prone

仓库还给出了迁移到其他机器人时的经验:拉力可从机器人重力的约 60% 起步,课程目标高度约为机器人身高的 70%,阶段阈值约为身高的 35% 和 70%;轻量机器人通常需要更严格的关节范围约束,真机髋膝刚度可比仿真提高约 1.33—1.5 倍。这些比例属于工程经验,不应替代针对具体硬件的力矩和安全分析。

15. 总结

HoST 的价值不只在于“让 G1 从地上站起来”,而在于给出了一套面向真实人形机器人接触技能的完整训练逻辑:用多 critic 处理多目标价值估计,用可撤除的物理辅助打开探索空间,用动作边界课程和 L2C2 把策略压缩到硬件可接受的运动范围,再通过几何场景建模和域随机化完成直接迁移。

其最有说服力的证据来自三组相互对应的实验:单 critic 和无拉力版本几乎无法学习,说明多 critic 与物理课程解决了“能否学会”;无动作边界和无 L2C2 版本动作质量显著下降,说明运动约束解决了“能否安全执行”;真实机器人在四类场景 20/20 成功并表现出负载和扰动鲁棒性,说明这些组件共同缩小了从仿真成功到真机可用之间的差距。

与此同时,当前系统仍依赖分场景策略、人工奖励和本体感知,尚未覆盖未知环境感知、统一多姿态策略和跌倒恢复到继续任务的系统集成。后续工作的关键方向,是把 HoST 的低层站起能力嵌入感知与决策闭环,并减少跨机器人、跨姿态迁移所需的人工调参。

16. 图号核对表

表 10 本文图片与原论文对应关系

图号 文件 原论文主题 文中顺序
图 1 fig01.png Overview 1
图 2 fig02.png Framework overview 2
图 3 fig03.png Simulation terrains and real-world scenes 3
图 4 fig04.png Motion analysis in simulation 4
图 5 fig05.png Robustness analysis in simulation 5
图 6 fig06.png Trade-off analysis in simulation 6
图 7 fig07.png Snapshot of real robot motion 7
图 8 fig08.png Snapshot of outdoor experiments 8
图 9 fig09.png Sim-to-real analysis 9
图 10 fig10.png Emergent properties in real robot experiments 10
图 11 fig11.png Standing stability 11
图 12 fig12.png More diverse postures 12
图 13 fig13.png Extension to large-size robots 13

参考资料

  1. Huang, T. et al. Learning Humanoid Standing-up Control across Diverse Postures. Robotics: Science and Systems, 2025. DOI: 10.15607/RSS.2025.XXI.064.
  2. Huang, T. et al. arXiv:2502.08378v2, 2025.
  3. Schulman, J. et al. Proximal Policy Optimization Algorithms, 2017.
  4. Schulman, J. et al. High-Dimensional Continuous Control Using Generalized Advantage Estimation, 2015.
  5. Mysore, S. et al. Multi-Critic Actor Learning: Teaching RL Policies to Act with Style. ICLR, 2022.
  6. Kobayashi, T. L2C2: Locally Lipschitz Continuous Constraint towards Stable and Smooth Reinforcement Learning. IROS, 2022.
  7. Burda, Y. et al. Exploration by Random Network Distillation. ICLR, 2019.
  8. 官方项目主页与代码仓库:
    • https://taohuang13.github.io/humanoid-standingup.github.io/
    • https://github.com/InternRobotics/HoST
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐