HOMIE_CSDN_排版输入
HOMIE 论文与源码详解:人形机器人 Loco-Manipulation、Lower-body RL 与上下肢解耦控制
本文结合 HOMIE 论文与 OpenHomie 开源代码,拆解其 Observation、Action Space、Upper-body Pose Curriculum、Height Reward、Symmetry Utilization 和 Sim2Real 部署参数。
人形机器人真正进入现实环境之后,仅仅"会走路"或者"会抓东西"都不够。
真正有实用价值的人形机器人,需要完成走到货架前拿取物体、蹲下捡起地面的瓶子、双手搬着箱子移动、后退的同时拉开柜门,以及在手臂持续运动甚至受到外界作用力时保持平衡等任务。
这类同时包含移动与操作的任务,被称为 Loco-Manipulation。

图 1:HOMIE 的真实世界任务展示,截自论文 Fig. 1。
- Locomotion:站立、行走、转向、侧移、蹲起和平衡。
- Manipulation:伸手、抓取、搬运、推、拉以及灵巧手操作。
真正困难的地方在于:
当机器人的上肢开始操作物体时,下半身如何继续保持稳定?
HOMIE 给出了一个非常工程化的答案:
不要让一个控制器包办所有事情,而是把不同身体部位交给最适合它们的控制方式。
1. HOMIE 是什么?

图 2:HOMIE 遥操作、下肢策略与数据闭环,截自论文 Fig. 2。
HOMIE 全称 Humanoid Loco-Manipulation with Isomorphic Exoskeleton
Cockpit。
它是一套面向人形机器人 Loco-Manipulation
的半自主遥操作系统,将机器人控制拆成三部分:
- 脚踏板负责输入身体移动意图;
- RL Policy 负责下半身运动和平衡;
- 同构外骨骼和动作感知手套分别控制机械臂和灵巧手。
Human Operator
├── Pedal
│ ↓
│ Locomotion Command
│ ↓
│ RL Body Policy
│ ↓
│ Lower Body
├── Isomorphic Exoskeleton
│ ↓
│ Arm Joint Targets
│ ↓
│ Robot Arms
└── Motion-Sensing Gloves
↓
Hand Targets
↓
Dexterous Hands
这里最重要的设计不是外骨骼本身,而是:机器人上下肢的控制权被明确拆开。
2. 为什么需要"半自主"架构?
让操作者直接控制一台二三十自由度的人形机器人并不现实。尤其是腿部控制,本质上是高速动态平衡问题。
因此 HOMIE 把问题重新分工:
- 操作者负责:“我要往哪里走、手要怎么操作。”
- RL 负责:“为了实现这个运动意图,两条腿具体应该怎么运动并保持平衡。”
Pedal Forward
↓
vx = 0.5 m/s
↓
RL Locomotion Policy
↓
Lower-body Joint Targets
↓
PD Controller
↓
机器人稳定向前行走
所以 Semi-Autonomous Teleoperation
可以理解为:人决定运动意图,机器人自主解决身体运动和平衡。
3. Lower-Body RL
普通 Locomotion Policy 通常解决 vx / vy / yaw rate → Walking。
但 HOMIE 面对一个额外问题:上半身并不受 Lower-body RL 控制。
操作者可能随时举起手臂、前伸、快速收回或形成严重不对称姿态。这会改变机器人的
CoM、转动惯量、Angular Momentum 和 Torso Reaction Torque。
因此 HOMIE 的 Lower-body Policy 实际需要同时解决:
Locomotion
+
Balance
+
Height Tracking
+
Upper-body Disturbance Rejection
4. Observation 与控制权解耦
HOMIE 的关键设计可以概括为:
Arm State ∈ Observation
Arm Action ∉ Lower-body Action Space
Lower-body Policy 能观察 Whole-body Joint Position / Velocity
等状态,因此能够感知上肢变化,但没有权力修改上肢动作。
论文将单步观测写为O_t = [C_t, ω_t, g_t, q_t, q̇_t, a_{t-1}],并拼接最近 6 帧O_{t-5:t} 作为策略输入。其中 q_t 与 q̇_t 覆盖全身关节,而策略动作只与下半身关节一一对应。当前开源 G1 配置对应每帧 76 维、6 帧共 456 维观测,以及 12 维下半身动作。
这使其天然适合未来 VLA:只需要把外骨骼产生的 Arm Target 替换成 VLA
产生的 Arm Target,下半身控制权无需根本改变。
5. Action Space 与关键实现参数
HOMIE 的 RL Policy 输出下半身关节目标,而不是直接控制全部机器人关节:
Observation
↓
RL Policy
↓
Lower-body Joint Position Target
↓
PD Controller
↓
Joint Torque
↓
Robot
这种 RL Joint Target + Low-Level PD 是人形机器人强化学习 Locomotion
中非常常见的架构。
| 项目 | 论文/开源 G1 实现 |
|---|---|
| 强化学习算法 | PPO |
| 仿真环境 | Isaac Gym,4096 个并行环境 |
| 单步观测 | Command、机身角速度、投影重力、全身关节位置/速度、上一时刻下半身动作 |
| 历史窗口 | 6 帧 |
| Actor 观测维度 | 456(开源 G1 配置) |
| Action 维度 | 12 个下半身关节 |
| 策略频率 | 50 Hz |
| 上肢目标重采样间隔 | 1 秒 |
| 运动命令重采样间隔 | 4 秒 |
需要注意一个版本差异:正文方法部分把脚踏命令写为C_t = [v_x, ω_yaw, h],附录训练表和当前开源配置还包含横向速度 v_y。
因此,训练策略支持横向速度命令,并不意味着论文所示脚踏交互默认同时输出 v_y。
6. Upper-Body Pose Curriculum

图 3:HOMIE RL 训练框架,来自 OpenHomie 官方仓库。
如果训练 Lower-body Policy
时上肢永远保持默认姿态,真机部署后让操作者自由控制手臂,会产生严重
Distribution Shift。
因此 HOMIE 设计了 Upper-Body Pose Curriculum。它不是四个离散阶段,而是由上肢动作比例 ρ_a 控制的连续、自适应课程:
ρ_a = 0
↓
从默认上肢姿态开始
速度跟踪奖励达到阈值
↓
ρ_a 每次增加 0.05
上肢采样分布逐渐展宽
↓
最终覆盖完整关节范围
论文采用一个在整个 [0, 1] 区间始终保留非零概率、但会随 ρ_a 平滑改变难度分布的采样方案,避免训练难度突然跃迁。
7. 连续上肢运动
HOMIE 不只是随机一个静态 Arm Pose。训练中 Upper-body Target
会持续变化并进行连续插值,从而产生 q_arm(t) 与 qdot_arm(t)。
这使 Lower-body Policy 面对的不只是静态姿态变化,还包括 Upper-body
Velocity、Dynamic Inertia、Angular Momentum 和 Reaction Torque。
8. Height Tracking
Loco-Manipulation 要求机器人能够主动改变身体高度,因此 HOMIE 在
Locomotion Command 中加入 Target Body Height。
机器人可以从站立降低身体、Squat、执行 Manipulation,再重新站起,从而扩大
Manipulation Workspace。
9. Height Reward 与 Knee Reward
简单使用 -|Current Height - Target Height| 可能导致 RL
为追求高度而产生异常姿态。
因此 HOMIE 加入 Knee-related Reward Shaping:
Target Height ↓ → Encourage Knee Flexion
Target Height ↑ → Encourage Knee Extension
这是一种带有身体结构先验的 Reward Shaping。
10. Symmetry Utilization
HOMIE 利用 Humanoid 左右对称结构进行:
Symmetric Data Augmentation
例如 Left/Right Joint 对换,vy → -vy,Yaw Rate 取反。
Symmetry Loss
π(Mirror(Observation))
≈
Mirror(π(Observation))
这样可以提高 Sample Efficiency,并减少左右步态不一致。
11. 同构外骨骼
传统遥操作通常经历:
Human Pose
↓
End-Effector Pose
↓
Retargeting
↓
Inverse Kinematics
↓
Robot Joint Target
HOMIE 使用 Isomorphic
Exoskeleton,让外骨骼机械结构尽可能与机器人机械臂一致:
Exoskeleton Joint Angle
↓
Robot Joint Target
从而减少 IK、Retargeting、Singularity 和 Latency 问题。
12. Hall Sensor Gloves
HOMIE 使用 Hall Sensor Motion-Sensing Gloves 感知手指运动,再通过
Mapping / Retargeting
转换为灵巧手目标。这样可以在紧凑、低成本设备中获得较多
DoF,并适配不同型号的灵巧手。
13. 低成本与规模化数据采集
HOMIE 强调 Cockpit 成本约 500
美元。其意义不只是"设备便宜",而是降低大规模 Teleoperation Station
建设成本,为真实机器人数据采集服务。
14. Data Flywheel
HOMIE 不只是一套 Teleoperation 系统,也是一套 Humanoid Data Engine:
Human
↓
HOMIE Teleoperation
↓
High-quality Robot Trajectory
↓
Dataset
↓
Imitation Learning / VLA
↓
Autonomous Policy
↓
Robot Deployment
↓
More Real-world Data
↺
15. 实验能力
论文展示了蹲下抓取胶带、机器人间苹果交接、双手搬箱子、推动椅子、打开烤箱门、拿取番茄、从地面捡瓶子、放置花朵,以及在剧烈
Upper-body Motion 下保持平衡等任务。
这些任务覆盖 Walking、Squatting、Dual-arm Manipulation、Dexterous Hands
和 Contact Interaction。
16. 与 Whole-Body RL 的区别
传统 Whole-Body RL:
One Policy
↓
Legs + Waist + Arms
HOMIE:
External Controller → Arms
RL Policy → Lower Body
因此 HOMIE 的核心是 Control Ownership Decoupling。
17. 与相关路线比较
作者分析: 本节用于帮助理解不同控制权划分方式,不是 HOMIE 论文给出的统一实验对比;各方法的精确定义仍需以其原论文和对应版本为准。
方法 核心思路
ExBody2 一个 Whole-body Policy,上下肢优化目标不同
HOMIE External Upper Body + Lower-body RL
ALMI Upper RL + Lower RL,通过训练互相适应
FALCON Upper Agent + Lower Agent + External Force
HOVER Unified Whole-body Policy
WholeBodyVLA VLA + Manipulation-oriented Lower-body RL
18. 为什么适合未来 VLA?
作者分析: 以下内容是基于 HOMIE 控制接口的架构推演,不是论文已经完成的 VLA 实验。
HOMIE 当前:
Exoskeleton
↓
Arm Targets
未来可以替换为:
VLA
↓
Arm Targets
形成:
Vision + Language
↓
VLA
│
┌─────┴──────────┐
↓ ↓
Arm Action Body Command
↓ ↓
Arms Lower-body RL
↓
Legs
VLA 可以专注目标理解、Manipulation、Arm Trajectory 和 Body Motion
Intention,而 Lower-body RL 专门负责 Locomotion、Balance 和 Disturbance
Rejection。
19. HOMIE 的局限
作者分析: 以下局限综合论文公开内容和当前开源实现得出;其中关于未来任务分布的判断不是论文作者的实验结论。
19.1 Upper-body Distribution 不等于 VLA Distribution
真实 VLA Manipulation 具有 Reach、Grasp、Lift、Pull、Rotate、Place
等强任务结构,而 HOMIE 的随机姿态与连续过渡不一定完全覆盖。
19.2 Hand Payload 建模仍然简化
HOMIE 已对左右手附加质量进行随机化;论文和当前 G1 源码给出的范围均为每只手[-0.1, 0.3] kg。但这仍是附加在手部 link 上的标量质量扰动,不能完整表达不同物体的惯量张量、抓取位置、双手耦合以及随操作过程变化的负载。
19.3 缺少系统性的 End-Effector Wrench Curriculum
拉门、推箱子、搬运等真实接触操作会产生 External Wrench。HOMIE 展示了一定
Contact Robustness,但并不等于训练阶段系统覆盖了 Force Distribution。
19.4 Locomotion Command 仍偏传统
未来 Manipulation-oriented Locomotion 可能需要更精确的 Step
Displacement、Body Position、Turn Angle、Pelvis Target Pose 和 Stance
Adjustment。
20. 从 HOMIE 到 VLA-ready Lower-body Controller
作者建议: 以下方向是在 HOMIE 基础上的扩展设想,尚未由本文所述 HOMIE 实验验证。
可以在 HOMIE 基础上进一步加入:
HOMIE Baseline
├── VLA-like Arm Trajectory Curriculum
├── Richer Payload / Object Inertia Randomization
├── End-Effector Wrench Randomization
└── Precise Locomotion / Body-position Command
同时可以考虑将 Arm Target、甚至 Future Arm Action Chunk 加入 Lower-body
Observation,使控制器从 Reactive Disturbance Rejection 向 Predictive
Compensation 演进。
21. 总结
HOMIE 表面上是一套低成本 Humanoid Teleoperation
Cockpit,但背后真正值得关注的是一种清晰的人形机器人控制哲学:
不同身体部位应该交给最适合它们的控制方式。
HOMIE 最值得记住的三个设计理念是:
- 上肢和下肢控制权解耦;
- 下肢策略主动适应持续变化的上肢;
- Teleoperation 不只是为了遥控,更是为了建立 Data Flywheel。
这使 HOMIE 不仅是一套遥操作系统,也成为未来"VLA 上肢 + RL
下肢"分层具身智能架构的重要参考。
论文与项目资源
- 论文:HOMIE: Humanoid Loco-Manipulation with Isomorphic Exoskeleton Cockpit
- 开源代码:InternRobotics/OpenHomie
图片来自 OpenHomie 官方仓库,版权归项目与论文作者所有,仅用于技术解读;CSDN 稿通过 jsDelivr CDN 加载官方图片。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐




所有评论(0)