HOMIE 论文与源码详解:人形机器人 Loco-Manipulation、Lower-body RL 与上下肢解耦控制

本文结合 HOMIE 论文与 OpenHomie 开源代码,拆解其 Observation、Action Space、Upper-body Pose Curriculum、Height Reward、Symmetry Utilization 和 Sim2Real 部署参数。

人形机器人真正进入现实环境之后,仅仅"会走路"或者"会抓东西"都不够。

真正有实用价值的人形机器人,需要完成走到货架前拿取物体、蹲下捡起地面的瓶子、双手搬着箱子移动、后退的同时拉开柜门,以及在手臂持续运动甚至受到外界作用力时保持平衡等任务。

这类同时包含移动与操作的任务,被称为 Loco-Manipulation

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

图 1:HOMIE 的真实世界任务展示,截自论文 Fig. 1。

  • Locomotion:站立、行走、转向、侧移、蹲起和平衡。
  • Manipulation:伸手、抓取、搬运、推、拉以及灵巧手操作。

真正困难的地方在于:

当机器人的上肢开始操作物体时,下半身如何继续保持稳定?

HOMIE 给出了一个非常工程化的答案:

不要让一个控制器包办所有事情,而是把不同身体部位交给最适合它们的控制方式。

1. HOMIE 是什么?

HOMIE 系统总览

图 2:HOMIE 遥操作、下肢策略与数据闭环,截自论文 Fig. 2。

HOMIE 全称 Humanoid Loco-Manipulation with Isomorphic Exoskeleton
Cockpit

它是一套面向人形机器人 Loco-Manipulation
的半自主遥操作系统,将机器人控制拆成三部分:

  1. 脚踏板负责输入身体移动意图;
  2. RL Policy 负责下半身运动和平衡;
  3. 同构外骨骼和动作感知手套分别控制机械臂和灵巧手。
Human Operator
├── Pedal
│   ↓
│   Locomotion Command
│   ↓
│   RL Body Policy
│   ↓
│   Lower Body
├── Isomorphic Exoskeleton
│   ↓
│   Arm Joint Targets
│   ↓
│   Robot Arms
└── Motion-Sensing Gloves
    ↓
    Hand Targets
    ↓
    Dexterous Hands

这里最重要的设计不是外骨骼本身,而是:机器人上下肢的控制权被明确拆开。

2. 为什么需要"半自主"架构?

让操作者直接控制一台二三十自由度的人形机器人并不现实。尤其是腿部控制,本质上是高速动态平衡问题。

因此 HOMIE 把问题重新分工:

  • 操作者负责:“我要往哪里走、手要怎么操作。”
  • RL 负责:“为了实现这个运动意图,两条腿具体应该怎么运动并保持平衡。”
Pedal Forward
↓
vx = 0.5 m/s
↓
RL Locomotion Policy
↓
Lower-body Joint Targets
↓
PD Controller
↓
机器人稳定向前行走

所以 Semi-Autonomous Teleoperation
可以理解为:人决定运动意图,机器人自主解决身体运动和平衡。

3. Lower-Body RL

普通 Locomotion Policy 通常解决 vx / vy / yaw rate → Walking

但 HOMIE 面对一个额外问题:上半身并不受 Lower-body RL 控制。

操作者可能随时举起手臂、前伸、快速收回或形成严重不对称姿态。这会改变机器人的
CoM、转动惯量、Angular Momentum 和 Torso Reaction Torque。

因此 HOMIE 的 Lower-body Policy 实际需要同时解决:

Locomotion
+
Balance
+
Height Tracking
+
Upper-body Disturbance Rejection

4. Observation 与控制权解耦

HOMIE 的关键设计可以概括为:

Arm State ∈ Observation
Arm Action ∉ Lower-body Action Space

Lower-body Policy 能观察 Whole-body Joint Position / Velocity
等状态,因此能够感知上肢变化,但没有权力修改上肢动作。

论文将单步观测写为
O_t = [C_t, ω_t, g_t, q_t, q̇_t, a_{t-1}],并拼接最近 6 帧
O_{t-5:t} 作为策略输入。其中 q_tq̇_t 覆盖全身关节,而策略动作只与下半身关节一一对应。当前开源 G1 配置对应每帧 76 维、6 帧共 456 维观测,以及 12 维下半身动作。

这使其天然适合未来 VLA:只需要把外骨骼产生的 Arm Target 替换成 VLA
产生的 Arm Target,下半身控制权无需根本改变。

5. Action Space 与关键实现参数

HOMIE 的 RL Policy 输出下半身关节目标,而不是直接控制全部机器人关节:

Observation
↓
RL Policy
↓
Lower-body Joint Position Target
↓
PD Controller
↓
Joint Torque
↓
Robot

这种 RL Joint Target + Low-Level PD 是人形机器人强化学习 Locomotion
中非常常见的架构。

项目 论文/开源 G1 实现
强化学习算法 PPO
仿真环境 Isaac Gym,4096 个并行环境
单步观测 Command、机身角速度、投影重力、全身关节位置/速度、上一时刻下半身动作
历史窗口 6 帧
Actor 观测维度 456(开源 G1 配置)
Action 维度 12 个下半身关节
策略频率 50 Hz
上肢目标重采样间隔 1 秒
运动命令重采样间隔 4 秒

需要注意一个版本差异:正文方法部分把脚踏命令写为
C_t = [v_x, ω_yaw, h],附录训练表和当前开源配置还包含横向速度 v_y
因此,训练策略支持横向速度命令,并不意味着论文所示脚踏交互默认同时输出 v_y

6. Upper-Body Pose Curriculum

HOMIE RL 训练框架

图 3:HOMIE RL 训练框架,来自 OpenHomie 官方仓库。

如果训练 Lower-body Policy
时上肢永远保持默认姿态,真机部署后让操作者自由控制手臂,会产生严重
Distribution Shift。

因此 HOMIE 设计了 Upper-Body Pose Curriculum。它不是四个离散阶段,而是由上肢动作比例 ρ_a 控制的连续、自适应课程:

ρ_a = 0
↓
从默认上肢姿态开始

速度跟踪奖励达到阈值
↓
ρ_a 每次增加 0.05

上肢采样分布逐渐展宽
↓
最终覆盖完整关节范围

论文采用一个在整个 [0, 1] 区间始终保留非零概率、但会随 ρ_a 平滑改变难度分布的采样方案,避免训练难度突然跃迁。

7. 连续上肢运动

HOMIE 不只是随机一个静态 Arm Pose。训练中 Upper-body Target
会持续变化并进行连续插值,从而产生 q_arm(t)qdot_arm(t)

这使 Lower-body Policy 面对的不只是静态姿态变化,还包括 Upper-body
Velocity、Dynamic Inertia、Angular Momentum 和 Reaction Torque。

8. Height Tracking

Loco-Manipulation 要求机器人能够主动改变身体高度,因此 HOMIE 在
Locomotion Command 中加入 Target Body Height。

机器人可以从站立降低身体、Squat、执行 Manipulation,再重新站起,从而扩大
Manipulation Workspace。

9. Height Reward 与 Knee Reward

简单使用 -|Current Height - Target Height| 可能导致 RL
为追求高度而产生异常姿态。

因此 HOMIE 加入 Knee-related Reward Shaping:

Target Height ↓ → Encourage Knee Flexion
Target Height ↑ → Encourage Knee Extension

这是一种带有身体结构先验的 Reward Shaping。

10. Symmetry Utilization

HOMIE 利用 Humanoid 左右对称结构进行:

Symmetric Data Augmentation

例如 Left/Right Joint 对换,vy → -vy,Yaw Rate 取反。

Symmetry Loss

π(Mirror(Observation))
≈
Mirror(π(Observation))

这样可以提高 Sample Efficiency,并减少左右步态不一致。

11. 同构外骨骼

传统遥操作通常经历:

Human Pose
↓
End-Effector Pose
↓
Retargeting
↓
Inverse Kinematics
↓
Robot Joint Target

HOMIE 使用 Isomorphic
Exoskeleton
,让外骨骼机械结构尽可能与机器人机械臂一致:

Exoskeleton Joint Angle
↓
Robot Joint Target

从而减少 IK、Retargeting、Singularity 和 Latency 问题。

12. Hall Sensor Gloves

HOMIE 使用 Hall Sensor Motion-Sensing Gloves 感知手指运动,再通过
Mapping / Retargeting
转换为灵巧手目标。这样可以在紧凑、低成本设备中获得较多
DoF,并适配不同型号的灵巧手。

13. 低成本与规模化数据采集

HOMIE 强调 Cockpit 成本约 500
美元。其意义不只是"设备便宜",而是降低大规模 Teleoperation Station
建设成本,为真实机器人数据采集服务。

14. Data Flywheel

HOMIE 不只是一套 Teleoperation 系统,也是一套 Humanoid Data Engine:

Human
↓
HOMIE Teleoperation
↓
High-quality Robot Trajectory
↓
Dataset
↓
Imitation Learning / VLA
↓
Autonomous Policy
↓
Robot Deployment
↓
More Real-world Data
↺

15. 实验能力

论文展示了蹲下抓取胶带、机器人间苹果交接、双手搬箱子、推动椅子、打开烤箱门、拿取番茄、从地面捡瓶子、放置花朵,以及在剧烈
Upper-body Motion 下保持平衡等任务。

这些任务覆盖 Walking、Squatting、Dual-arm Manipulation、Dexterous Hands
和 Contact Interaction。

16. 与 Whole-Body RL 的区别

传统 Whole-Body RL:

One Policy
↓
Legs + Waist + Arms

HOMIE:

External Controller → Arms
RL Policy → Lower Body

因此 HOMIE 的核心是 Control Ownership Decoupling

17. 与相关路线比较

作者分析: 本节用于帮助理解不同控制权划分方式,不是 HOMIE 论文给出的统一实验对比;各方法的精确定义仍需以其原论文和对应版本为准。

方法 核心思路


ExBody2 一个 Whole-body Policy,上下肢优化目标不同
HOMIE External Upper Body + Lower-body RL
ALMI Upper RL + Lower RL,通过训练互相适应
FALCON Upper Agent + Lower Agent + External Force
HOVER Unified Whole-body Policy
WholeBodyVLA VLA + Manipulation-oriented Lower-body RL

18. 为什么适合未来 VLA?

作者分析: 以下内容是基于 HOMIE 控制接口的架构推演,不是论文已经完成的 VLA 实验。

HOMIE 当前:

Exoskeleton
↓
Arm Targets

未来可以替换为:

VLA
↓
Arm Targets

形成:

Vision + Language
       ↓
      VLA
       │
 ┌─────┴──────────┐
 ↓                ↓
Arm Action     Body Command
 ↓                ↓
Arms          Lower-body RL
                   ↓
                  Legs

VLA 可以专注目标理解、Manipulation、Arm Trajectory 和 Body Motion
Intention,而 Lower-body RL 专门负责 Locomotion、Balance 和 Disturbance
Rejection。

19. HOMIE 的局限

作者分析: 以下局限综合论文公开内容和当前开源实现得出;其中关于未来任务分布的判断不是论文作者的实验结论。

19.1 Upper-body Distribution 不等于 VLA Distribution

真实 VLA Manipulation 具有 Reach、Grasp、Lift、Pull、Rotate、Place
等强任务结构,而 HOMIE 的随机姿态与连续过渡不一定完全覆盖。

19.2 Hand Payload 建模仍然简化

HOMIE 已对左右手附加质量进行随机化;论文和当前 G1 源码给出的范围均为每只手
[-0.1, 0.3] kg。但这仍是附加在手部 link 上的标量质量扰动,不能完整表达不同物体的惯量张量、抓取位置、双手耦合以及随操作过程变化的负载。

19.3 缺少系统性的 End-Effector Wrench Curriculum

拉门、推箱子、搬运等真实接触操作会产生 External Wrench。HOMIE 展示了一定
Contact Robustness,但并不等于训练阶段系统覆盖了 Force Distribution。

19.4 Locomotion Command 仍偏传统

未来 Manipulation-oriented Locomotion 可能需要更精确的 Step
Displacement、Body Position、Turn Angle、Pelvis Target Pose 和 Stance
Adjustment。

20. 从 HOMIE 到 VLA-ready Lower-body Controller

作者建议: 以下方向是在 HOMIE 基础上的扩展设想,尚未由本文所述 HOMIE 实验验证。

可以在 HOMIE 基础上进一步加入:

HOMIE Baseline
├── VLA-like Arm Trajectory Curriculum
├── Richer Payload / Object Inertia Randomization
├── End-Effector Wrench Randomization
└── Precise Locomotion / Body-position Command

同时可以考虑将 Arm Target、甚至 Future Arm Action Chunk 加入 Lower-body
Observation,使控制器从 Reactive Disturbance Rejection 向 Predictive
Compensation 演进。

21. 总结

HOMIE 表面上是一套低成本 Humanoid Teleoperation
Cockpit,但背后真正值得关注的是一种清晰的人形机器人控制哲学:

不同身体部位应该交给最适合它们的控制方式。

HOMIE 最值得记住的三个设计理念是:

  1. 上肢和下肢控制权解耦;
  2. 下肢策略主动适应持续变化的上肢;
  3. Teleoperation 不只是为了遥控,更是为了建立 Data Flywheel。

这使 HOMIE 不仅是一套遥操作系统,也成为未来"VLA 上肢 + RL
下肢"分层具身智能架构的重要参考。

论文与项目资源

图片来自 OpenHomie 官方仓库,版权归项目与论文作者所有,仅用于技术解读;CSDN 稿通过 jsDelivr CDN 加载官方图片。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐