经过数年的技术创新积累和几个月的简单筹备,我们的具身智能创业公司-引力科技启动了。

Locomotion是公司的一大技术方向,这里会出一系列简易上手教程供大家参考。

引言

当下人形、四足等足式机器人作为具身智能最核心的载体,广泛应用于巡检、救灾、家用服务等场景。很多入门学习者在自学时容易陷入知识点碎片化的困境:刚弄懂运动学,又被浮动基动力学、平衡理论、强化学习等内容割裂,找不到清晰的递进逻辑,越学越混乱。本文整合完整学习路径、核心概念层级、配套学习视频与系统化知识树,从零基础理论铺垫到前沿虚实迁移技术逐层拆解,搭建一套由浅入深、理论结合工程实践的标准化学习体系,不管是学生自学、项目攻关还是入门科研,都能顺着框架稳步推进,理清足式机器人运动控制整套技术脉络。

1、学习思路

先不要研究公式和理论的细节,先泛读,对于每一项内容,先读开端和总结,从“性质”上理解。

最简最优学习顺序:

(1)单刚体 → 质心 COM → 浮动基;

(2)正逆运动学 + 雅可比;

(3)动力学方程;

(4)MPC + WBC;

(5)LIPM 线性倒立摆 → ZMP 平衡;

(6)步态;

(7)RL 状态 / 动作 / 奖励函数设计;

(8)Sim2Real;

详解(以下AI链接最后一个对话):

  1. https://www.doubao.com/thread/w2c053ab1a2611e4d
  2. DeepSeek

2、概念要点

技术大全可以先泛读,同时重点概念需要反复学习理解。可以先学习以下概念,争取从性质上先理解,理解不深的就先保留、有“这个是关键”的意识;然后看第3部分深入学习;最后再反过来结合实例深入理解这部分。

优先级1:单刚体动力学(Single Rigid Body, SRB)

包含:质心 COM、惯性张量/转动惯量

将机器人整体视为一个仅受地面反力/力矩的刚体,即单刚体,忽略腿部摆动细节。

  1. 为何根基: 它抓住了“质心平动 + 躯干转动”这一决定运动行为的主要矛盾。所有平衡理论都从单刚体延伸,是 MPC 规划(如 MIT Cheetah)和强化学习状态/奖励设计(如最小化躯干角速度)的默认简化模型。
  2. 关键物理量: 质心 COM 是判定行走、平衡、倒地的终极依据;惯性张量决定躯干与四肢的转动难易。

优先级2:浮动基动力学与欠驱动系统(Floating-Base Dynamics & Underactuation)

包含:多刚体串联系统、被动自由度

足式机器人没有固定基座,躯干是 6 自由度自由漂浮的,无法直接驱动。

  1. 为何根基: 这是所有足式机器人仿真的数学根基。它揭示了一个本质:你只能通过关节力与环境的接触力,间接控制基座。驱动自由度(关节电机)远少于总运动自由度,这正是“欠驱动”的本质——足式机器人无法像工业机械臂那样完全精准控制,只能靠动态平衡维持移动。

优先级3:空间运动学与雅可比矩阵(Spatial Kinematics & Jacobian)

包含:齐次坐标变换、刚体六维运动、空间速度/力、正/逆运动学、运动奇异性、DH 参数

  1. 齐次变换是描述坐标系平移与旋转的通用语言,所有运动学计算的第一关。
  2. 雅可比矩阵是关节空间(速度/力矩)与笛卡尔任务空间(末端位姿/力)之间的映射器:

v_task = J · q̇         τ_task = Jᵀ · F_task

它是轨迹微调、力控和后续任务优先级分配的数学基础。

  1. 运动奇异性提醒你机器人姿态的极限,此时会丧失某些运动自由度,必须规避。

优先级4:零力矩点与支撑多边形(Zero Moment Point, ZMP & Support Polygon)

支撑多边形是所有着地足围成的凸包区域。ZMP是足底支撑域内,由重力与惯性力引起的总力矩水平分量为零的那个点。

  1. 黄金判据: 只要 ZMP 始终落在支撑多边形内,足底就不会发生翻覆。这是“静态/准静态稳定”的最经典判据。RL 中许多“保持质心投影在支撑域内”的奖励函数,本质上都是 ZMP 准则的简化。

优先级5:线性倒立摆模型(Linear Inverted Pendulum Model, LIPM)

将机器人质心高度约束为常数

  1. 为何核心: 它让“ZMP → 质心轨迹”的映射变为线性,极大简化了步态规划。其指数发散特性(不稳定零点)从物理上直观解释了 “为什么走路必须不断迈步才能保持平衡”

优先级6:弹簧负载倒立摆(Spring-Loaded Inverted Pendulum, SLIP)

  1. 仿生核心: 在 LIPM 基础上引入腿部弹簧,质心轨迹不再被锁死高度。它是理解奔跑、跳跃、高速动态奔跑的仿生核心模型,捕捉了运动中能量回收与弹跳的本质。

优先级7:捕获点(Capture Point, CP)

机器人受扰动后,若此时立刻用单腿支撑并落于该点,就能让质心速度恰好衰减为零,实现稳定站立。

  1. 抗倾倒边界: 它定义了“还能停住”的落足边界。RL 中常被用于设计落脚目标奖励,或判断策略是否已进入不可恢复的倒地状态。

优先级8:质心动量与角动量(Centroidal Angular Momentum)

围绕质心的总角动量,及在“角动量不变”条件下解算出的足底力投影。

  1. 高级平衡关键: 抵抗外部推力、单腿站立等高级平衡动作,本质上是在调控角动量。全身控制常将“角动量变化为零”作为高优先级任务,迫使机器人用合理的地面反力分配来维持姿态。这部分对应你常说的姿态三轴稳定(俯仰、横滚、偏航)。

优先级9:接触约束与摩擦锥(Contact Constraints & Friction Cone)

足底力必须满足物理硬边界:单向性(只能受压不能受拉)和摩擦锥(避免滑动)

  1. 物理底线: 所有接触力优化(无论是传统 WBC 还是 RL 策略)都必须遵守。RL 中常用“足底力超出摩擦锥”作为惩罚,逼迫策略不使用虚拖力。

优先级10:任务空间与零空间投影(Task Space & Null-Space Projection)

利用雅可比矩阵的伪逆,将关节控制解耦:优先严格完成高优先级任务(如支撑腿保持接触),然后在“不影响此任务”的零空间内,尽可能完成低优先级任务(如摆动腿跟随轨迹、优化躯干姿态)。

  1. 控制骨架: 这是全身控制的数学内核,实现了多约束下的层级化协调。哪怕在 RL 策略中,这种“优先保证接触,再谈摆动”的思想也隐形存在于约束设计中。

优先级11:足端轨迹与步态相位(Swing Trajectory & Gait Phase)

包含:支撑相/摆动相、静态/动态步态、落地冲击控制、触地探测

  1. 根据步态周期,生成足端从离地到落地的空间曲线(多项式、摆线),并结合力/高度传感探测切换相位。
  2. 步态状态机: 它将连续运动离散化为“摆动-支撑”事件,是避免磕绊、调节步频、减小落地冲击的基础。静态步态(重心恒在支撑区内)与动态步态(重心短暂脱离支撑区,靠惯性平衡)的划分,决定了运动方式的根本差异。

优先级12:全身控制(Whole-Body Control, WBC)

将浮动基、任务零空间、接触约束、摩擦锥、逆动力学(RNEA)等整合,在每一个控制周期构建并求解一个二次规划(QP)问题,实时输出满足所有约束的关节力矩。

  1. 传统最高集成: 它是经典控制思路在 Locomotion 上的最高成就。在具身智能中,WBC 常作为“安全底座”——RL 只输出高层的目标姿态或足力,由 WBC 保证物理可行地执行跟踪,完美结合了学习泛化性与模型精确性。

优先级13:强化学习核心要素(RL Essentials for Locomotion)

包含:状态观测空间、动作空间、奖励函数、课程学习

  1. 状态空间通常包含基座姿态、关节角速度、地形信息等;动作空间多为关节目标角度或目标力矩。
  2. 奖励函数是命脉: 它必须精确编码“跑得快、站得稳、用得省、摔得少”的期望行为。典型项包括:前进速度跟踪奖励、姿态平稳惩罚、能耗惩罚、倒地终止惩罚、足端接触力约束惩罚(与 ZMP/摩擦锥思想一致)。
  3. 课程学习让策略从简单平地开始,逐步应对复杂地形,是训练收敛的关键。

优先级14:Sim2Real 虚实迁移与域随机化(Sim-to-Real & Domain Randomization)

包含:域偏移、在线系统辨识;可以看看之前发的文档,也是先了解个大概即可,不用深入。

仿真训练的策略直接部署到实物,会因物理参数差异(质量、摩擦、电机滞后等)而失效。

  1. 域随机化在训练中刻意大范围扰动物理参数(惯性、摩擦力、关节阻尼),迫使策略学会鲁棒的特征,而不是过拟合仿真细节。
  2. 在线系统辨识则在实物运行时实时估计环境/自身参数,帮助策略动态自适应,是弥合“域偏移”的另一条路径。

优先级15:建模仿真基础(Simulation Foundations)

包含:URDF 模型、浮动关节、碰撞体、惯性参数、摩擦系数

  1. URDF 是机器人模型的统一描述文件。设置正确的碰撞体、精确的惯性参数和合理的摩擦系数,直接决定了仿真是否“像真的一样”,是所有动力学计算和 Sim2Real 的物理源头。浮动关节则是在仿真中实现基座 6 自由度自由运动的关键。

出处:两个AI链接的最后一个问题“具身智能Locomotion基础知识中,最重要的概念有哪些?比如单刚体”

https://www.doubao.com/thread/wce254b67c213e0fb

DeepSeek

3、技术大全

  1. 1、【【人形机器人运动控制】30分钟看懂人形机器人背后的工程逻辑】https://www.bilibili.com/video/BV1PFArzLEv5?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  2. 2、【人形机器人运控算法概览】https://www.bilibili.com/video/BV17ooSB2E93?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  3. 3、【人形机器人自由度分析与设计】https://www.bilibili.com/video/BV1Tjbtz7Esk?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  4. 4、【从零手搓人形机器人之运动学板块(一)】https://www.bilibili.com/video/BV1dp1wB5Ex5?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  5. 5、【从零手搓人形机器人之逆运动学解算】https://www.bilibili.com/video/BV1pJCDB9E3D?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  6. 6、【机器人动力学 理论基础+MATLAB机器人工具箱使用介绍】https://www.bilibili.com/video/BV1KwqDByEnU?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  7. 7、https://zhuanlan.zhihu.com/p/638773309
  8. 8、https://zhuanlan.zhihu.com/p/639128926
  9. 9、https://zhuanlan.zhihu.com/p/638997599
  10. 10、https://zhuanlan.zhihu.com/p/640057159
  11. 11、https://zhuanlan.zhihu.com/p/640296839
  12. 12、https://zhuanlan.zhihu.com/p/641297823
  13. 13、https://zhuanlan.zhihu.com/p/644393000
  14. 14、RL系列:【【2025最新版】这绝对是B站讲最明白的人形机器人:通过模仿人类行为来指导机器人的设计和控制!通俗搞懂强化学习PPO及DQN算法+月球登陆器训练实例】https://www.bilibili.com/video/BV1tCk6BeErt?p=3&vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
  15. 15、IL:【【2025最新版】这绝对是B站讲最明白的人形机器人:通过模仿人类行为来指导机器人的设计和控制!通俗搞懂强化学习PPO及DQN算法+月球登陆器训练实例】https://www.bilibili.com/video/BV1tCk6BeErt?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9

精简知识树

一、机器人学基础

  1. 1.1 机器人运动学
    • 正/逆运动学、雅可比矩阵
    • 微分运动学、工作空间与奇异性分析
  2. 1.2 机器人动力学
    • 刚体动力学建模、拉格朗日-欧拉法、牛顿-欧拉法
    • 递推牛顿-欧拉算法 (RNEA) 与 Featherstone 算法
    • 浮动基动力学、惯性参数辨识
    • 欠驱动系统与被动自由度
  3. 1.3 机器人建模
    • 连杆坐标系(DH 参数法)、URDF 描述
    • 多体系统动力学
    • 执行器模型、传感器模型

二、机器人运动控制专项技术

  1. 2.1 足式机器人运动控制
    • 步态规划(静态/动态步态)
    • 零力矩点 (ZMP) 理论、捕获点 (Capture Point)
    • 倒立摆模型(线性倒立摆 LIPM、弹簧负载倒立摆 SLIP)
    • 足端轨迹规划、落地冲击控制
    • 混合零动力学 (HZD) 与虚拟约束
    • 多接触优化与全身控制 (WBC)
    • 基于优化的接触序列 + 全身运动规划
    • 平衡控制与地形适应

三、机器学习与强化学习基础

  1. 3.1 机器学习基础
    • 监督学习/无监督学习、深度学习基础
    • 神经网络架构(CNN, RNN/LSTM, Transformer, 图神经网络)
    • 生成模型(VAE, GAN, 扩散模型)
    • 反向传播与优化器
  2. 3.2 强化学习基础
    • 马尔可夫决策过程 (MDP)、值函数方法(Q-learning, SARSA)
    • 策略梯度方法、演员-评论家 (Actor-Critic)
    • 深度 Q 网络 (DQN)、PPO、SAC、DDPG
    • 基于模型的 RL (MBRL)、分层强化学习(Options 框架)
  3. 3.3 机器人学习基础
    • 模仿学习(行为克隆、DAgger、逆强化学习)
    • 从演示中学习 (LfD)、迁移学习
    • 元学习 (Meta-Learning)、领域自适应、多任务学习

四、具身智能特有的运动学习方法

  1. 4.1 基于强化学习的运动控制
    • 端到端运动控制、奖励函数设计
    • 课程学习、安全强化学习
    • 从仿真到现实 (Sim2Real):域随机化、系统辨识与自适应
    • 在线系统辨识(EKF/Bayes 估计环境参数)

完整知识树

一、数学基础(核心前置)

  1. 1.1 线性代数
    • 向量与矩阵运算
    • 特征值与特征向量、奇异值分解 (SVD)
    • 矩阵求导
    • 李群与李代数(SO(3), SE(3))
    • 四元数与旋转表示
  2. 1.2 微积分与微分方程
    • 多元微积分
    • 常微分方程 (ODE) / 偏微分方程 (PDE) 基础
    • 变分法
    • 数值积分与数值微分
  3. 1.3 概率与统计
    • 概率分布、期望、贝叶斯推断
    • 马尔可夫链、高斯过程、蒙特卡洛方法
    • 状态估计理论(基础)
  4. 1.4 优化理论
    • 凸优化、线性规划与二次规划
    • 非线性优化、约束优化
    • 梯度下降及其变种、拉格朗日乘数法

二、物理基础

  1. 2.1 经典力学【AAA]
    • 牛顿力学、拉格朗日力学、哈密顿力学
    • 刚体动力学
    • 碰撞与接触力学
    • 摩擦模型(库仑、粘滞)
    • 混杂系统基础(连续动力学 + 离散接触/事件切换)
  2. 2.2 材料力学基础
    • 应力与应变、刚度与强度
    • 振动与模态分析
    • 疲劳与断裂力学
  3. 2.3 流体力学(适用于水下/飞行机器人)
    • 流体静/动力学、升力与阻力
    • 伯努利方程、湍流基础

三、机器人学基础 MVP

  1. 3.1 机器人运动学【AAA]
    • 正/逆运动学、雅可比矩阵
    • 微分运动学、工作空间与奇异性分析
  2. 3.2 机器人动力学【AAA]
    • 刚体动力学建模、拉格朗日-欧拉法、牛顿-欧拉法
    • 递推牛顿-欧拉算法 (RNEA) 与 Featherstone 算法
    • 浮动基动力学、惯性参数辨识
    • 欠驱动系统与被动自由度
  3. 3.3 机器人建模【AAA]
    • 连杆坐标系(DH 参数法)、URDF 描述
    • 多体系统动力学
    • 执行器模型、传感器模型
  4. 3.4 状态估计
    • 卡尔曼滤波 (KF)、扩展卡尔曼滤波 (EKF)、无迹卡尔曼滤波 (UKF)
    • 粒子滤波
    • SLAM 基础、里程计与 IMU 融合
    • 本体感受/视觉/触觉融合(因子图优化)

四、经典与现代控制理论

  1. 4.1 经典控制理论
    • PID 控制、根轨迹、频率响应法【AAA]
    • 稳定性判据(劳斯、奈奎斯特)、超前-滞后校正
  2. 4.2 现代控制理论
    • 状态空间表示、能控/能观性、极点配置
    • 线性二次调节器 (LQR)、线性二次高斯 (LQG)
    • 模型预测控制 (MPC)【AAA]
  3. 4.3 高级控制理论
    • 鲁棒控制(H∞)、自适应控制
    • 滑模控制、反步控制 (Backstepping)
    • 阻抗/导纳控制、力位混合控制
    • 轨迹优化方法:直接配点法、多重打靶法
    • 微分动态规划 (DDP) 与迭代 LQR (iLQR)

五、机器人运动控制专项技术

  1. 5.1 足式机器人运动控制【AAA] MVP
    • 步态规划(静态/动态步态)
    • 零力矩点 (ZMP) 理论、捕获点 (Capture Point)
    • 倒立摆模型(线性倒立摆 LIPM、弹簧负载倒立摆 SLIP)
    • 足端轨迹规划、落地冲击控制
    • 混合零动力学 (HZD) 与虚拟约束
    • 多接触优化与全身控制 (WBC)
    • 基于优化的接触序列 + 全身运动规划
    • 平衡控制与地形适应
  2. 5.2 轮式机器人运动控制
    • 差速驱动、阿克曼转向、全向移动控制
    • 路径跟踪、避障控制、编队控制
  3. 5.3 飞行机器人运动控制
    • 姿态/位置控制、轨迹跟踪、悬停、抗风干扰
  4. 5.4 水下机器人运动控制
    • 六自由度运动控制、水动力补偿、深度与姿态保持

六、机器学习与强化学习基础 MVP

  1. 6.1 机器学习基础【AAA]
    • 监督学习/无监督学习、深度学习基础
    • 神经网络架构(CNN, RNN/LSTM, Transformer, 图神经网络)
    • 生成模型(VAE, GAN, 扩散模型)
    • 反向传播与优化器
  2. 6.2 强化学习基础【AAA]
    • 马尔可夫决策过程 (MDP)、值函数方法(Q-learning, SARSA)
    • 策略梯度方法、演员-评论家 (Actor-Critic)
    • 深度 Q 网络 (DQN)、PPO、SAC、DDPG
    • 基于模型的 RL (MBRL)、分层强化学习(Options 框架)
  3. 6.3 机器人学习基础【AAA]
    • 模仿学习(行为克隆、DAgger、逆强化学习)
    • 从演示中学习 (LfD)、迁移学习
    • 元学习 (Meta-Learning)、领域自适应、多任务学习

七、具身智能特有的运动学习方法

  1. 7.1 基于强化学习的运动控制【AAA] MVP
    • 端到端运动控制、奖励函数设计
    • 课程学习、安全强化学习
    • 从仿真到现实 (Sim2Real):域随机化、系统辨识与自适应
    • 在线系统辨识(EKF/Bayes 估计环境参数)
  2. 7.2 基于模型的强化学习
    • 动力学模型学习、MPC 与 RL 结合
    • 规划与学习结合、基于模型的策略优化 (MBPO)
  3. 7.3 层次化运动控制
    • 运动基元、动态运动基元 (DMP)、概率运动基元 (ProMP)
    • 选项框架 (Options Framework)、高层规划与低层控制结合
    • 运动表征学习(从动捕数据学习潜空间,VAE 嵌入)
    • 离线 RL(从固定数据集学习策略)
  4. 7.4 多模态感知与运动融合
    • 视觉-运动控制(高度图/深度图地形感知,端到端 RGB-D→关节扭矩)
    • 触觉-运动控制、听觉-运动控制
    • 多传感器融合、主动感知
    • 教师-学生蒸馏(特权信息策略 → 本体感知策略)

八、硬件与系统实现

  1. 8.1 机器人硬件
    • 执行器(伺服/液压/气动)、减速器(谐波/行星)
    • 传感器(IMU、编码器、力/力矩、相机、激光雷达)
    • 电源系统、机械结构设计
  2. 8.2 嵌入式系统与实时控制
    • 实时操作系统 (RTOS)、微控制器与 FPGA
    • 通信协议(CAN、EtherCAT)
    • 控制周期与延迟分析、硬件在环仿真 (HIL)
  3. 8.3 仿真环境
    • 物理引擎(MuJoCo, Isaac Gym, PyBullet, Bullet, PhysX, RaiSim)
    • 机器人仿真平台(Gazebo, Webots, Isaac Sim, Drake)
    • 仿真噪声建模与域随机化、sim2real 差距分析
  4. 8.4 软件框架
    • ROS / ROS2、运动控制库(MoveIt!, Orocos KDL, Pinocchio)
    • 强化学习框架(PyTorch, TensorFlow, Stable Baselines)
    • 动力学库(RBDL, DART)

九、前沿研究方向

  1. 9.1 通用与敏捷运动控制
    • 通用人形机器人运动控制、跨地形能力
    • 全身运动控制(动态操作 + 运动结合)
    • 敏捷动作生成(后空翻、跑酷)与抗扰恢复策略
    • 腿臂协作(Mobile Manipulation) 与全身 MPC
  2. 9.2 具身大模型与世界模型
    • 大语言模型与运动指令生成、常识推理
    • 世界模型(学习环境动力学)
    • 以自然语言驱动的长期运动规划
  3. 9.3 进化与发育机器人学
    • 进化算法用于运动控制
    • 形态与控制协同进化
    • 发育式学习、终身学习
  4. 9.4 多机器人协同运动
    • 编队控制、协作搬运、群体智能、分布式运动控制
  5. 9.5 安全与验证
    • 安全后退策略 (Fallback Policy)
    • 可达域分析与形式化安全验证
    • 学习控制器的对抗攻击与加固

issc-rl-gym MVP foot

十、实践与项目(学习检查点)

  1. 倒立摆与简单轮式机器人 PID 控制
  2. 机械臂运动学/动力学仿真 + 欠驱动系统建模
  3. 双足机器人基于 ZMP / Capture Point 的平衡与步行仿真
  4. 四足机器人利用 PPO/SAC 训练行走(Isaac Gym)
  5. 完整的 Sim2Real 迁移实验(域随机化 → 实体机器人)
  6. 视觉/高度图引导的足式机器人野外地形适应
  7. 多接触全身控制仿真(如爬梯、跨越障碍)


总结

足式机器人与具身智能运动控制是一套「物理理论 - 数学建模 - 控制算法 - 智能学习 - 工程仿真落地」完整闭环体系,学习不能跳跃顺序。从 DH、URDF 基础建模起步,吃透运动学与刚体动力学两大底层工具,再掌握 ZMP、倒立摆、全身控制等平衡方案,最后拓展强化学习与虚实迁移前沿技术。

遵循「先宏观框架,后数学细节;先传统模型控制,后数据驱动强化学习」的思路,搭配文中配套视频、专栏资源与实操项目逐步练习,既能夯实理论功底,又能贴合工业与科研实际需求,彻底解决知识点零散、学完不会落地的痛点,形成完整的足式机器人知识体系。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐