具身智能 Locomotion教程-学习方法和大纲
经过数年的技术创新积累和几个月的简单筹备,我们的具身智能创业公司-引力科技启动了。
Locomotion是公司的一大技术方向,这里会出一系列简易上手教程供大家参考。


引言
当下人形、四足等足式机器人作为具身智能最核心的载体,广泛应用于巡检、救灾、家用服务等场景。很多入门学习者在自学时容易陷入知识点碎片化的困境:刚弄懂运动学,又被浮动基动力学、平衡理论、强化学习等内容割裂,找不到清晰的递进逻辑,越学越混乱。本文整合完整学习路径、核心概念层级、配套学习视频与系统化知识树,从零基础理论铺垫到前沿虚实迁移技术逐层拆解,搭建一套由浅入深、理论结合工程实践的标准化学习体系,不管是学生自学、项目攻关还是入门科研,都能顺着框架稳步推进,理清足式机器人运动控制整套技术脉络。
1、学习思路
先不要研究公式和理论的细节,先泛读,对于每一项内容,先读开端和总结,从“性质”上理解。
最简最优学习顺序:
(1)单刚体 → 质心 COM → 浮动基;
(2)正逆运动学 + 雅可比;
(3)动力学方程;
(4)MPC + WBC;
(5)LIPM 线性倒立摆 → ZMP 平衡;
(6)步态;
(7)RL 状态 / 动作 / 奖励函数设计;
(8)Sim2Real;
详解(以下AI链接最后一个对话):
2、概念要点
技术大全可以先泛读,同时重点概念需要反复学习理解。可以先学习以下概念,争取从性质上先理解,理解不深的就先保留、有“这个是关键”的意识;然后看第3部分深入学习;最后再反过来结合实例深入理解这部分。
优先级1:单刚体动力学(Single Rigid Body, SRB)
包含:质心 COM、惯性张量/转动惯量
将机器人整体视为一个仅受地面反力/力矩的刚体,即单刚体,忽略腿部摆动细节。
- 为何根基: 它抓住了“质心平动 + 躯干转动”这一决定运动行为的主要矛盾。所有平衡理论都从单刚体延伸,是 MPC 规划(如 MIT Cheetah)和强化学习状态/奖励设计(如最小化躯干角速度)的默认简化模型。
- 关键物理量: 质心 COM 是判定行走、平衡、倒地的终极依据;惯性张量决定躯干与四肢的转动难易。
优先级2:浮动基动力学与欠驱动系统(Floating-Base Dynamics & Underactuation)
包含:多刚体串联系统、被动自由度
足式机器人没有固定基座,躯干是 6 自由度自由漂浮的,无法直接驱动。
- 为何根基: 这是所有足式机器人仿真的数学根基。它揭示了一个本质:你只能通过关节力与环境的接触力,间接控制基座。驱动自由度(关节电机)远少于总运动自由度,这正是“欠驱动”的本质——足式机器人无法像工业机械臂那样完全精准控制,只能靠动态平衡维持移动。
优先级3:空间运动学与雅可比矩阵(Spatial Kinematics & Jacobian)
包含:齐次坐标变换、刚体六维运动、空间速度/力、正/逆运动学、运动奇异性、DH 参数
- 齐次变换是描述坐标系平移与旋转的通用语言,所有运动学计算的第一关。
- 雅可比矩阵是关节空间(速度/力矩)与笛卡尔任务空间(末端位姿/力)之间的映射器:
v_task = J · q̇ τ_task = Jᵀ · F_task
它是轨迹微调、力控和后续任务优先级分配的数学基础。
- 运动奇异性提醒你机器人姿态的极限,此时会丧失某些运动自由度,必须规避。
优先级4:零力矩点与支撑多边形(Zero Moment Point, ZMP & Support Polygon)
支撑多边形是所有着地足围成的凸包区域。ZMP是足底支撑域内,由重力与惯性力引起的总力矩水平分量为零的那个点。
- 黄金判据: 只要 ZMP 始终落在支撑多边形内,足底就不会发生翻覆。这是“静态/准静态稳定”的最经典判据。RL 中许多“保持质心投影在支撑域内”的奖励函数,本质上都是 ZMP 准则的简化。
优先级5:线性倒立摆模型(Linear Inverted Pendulum Model, LIPM)
将机器人质心高度约束为常数
- 为何核心: 它让“ZMP → 质心轨迹”的映射变为线性,极大简化了步态规划。其指数发散特性(不稳定零点)从物理上直观解释了 “为什么走路必须不断迈步才能保持平衡”。
优先级6:弹簧负载倒立摆(Spring-Loaded Inverted Pendulum, SLIP)
- 仿生核心: 在 LIPM 基础上引入腿部弹簧,质心轨迹不再被锁死高度。它是理解奔跑、跳跃、高速动态奔跑的仿生核心模型,捕捉了运动中能量回收与弹跳的本质。
优先级7:捕获点(Capture Point, CP)
机器人受扰动后,若此时立刻用单腿支撑并落于该点,就能让质心速度恰好衰减为零,实现稳定站立。
- 抗倾倒边界: 它定义了“还能停住”的落足边界。RL 中常被用于设计落脚目标奖励,或判断策略是否已进入不可恢复的倒地状态。
优先级8:质心动量与角动量(Centroidal Angular Momentum)
围绕质心的总角动量,及在“角动量不变”条件下解算出的足底力投影。
- 高级平衡关键: 抵抗外部推力、单腿站立等高级平衡动作,本质上是在调控角动量。全身控制常将“角动量变化为零”作为高优先级任务,迫使机器人用合理的地面反力分配来维持姿态。这部分对应你常说的姿态三轴稳定(俯仰、横滚、偏航)。
优先级9:接触约束与摩擦锥(Contact Constraints & Friction Cone)
足底力必须满足物理硬边界:单向性(只能受压不能受拉)和摩擦锥(避免滑动)
- 物理底线: 所有接触力优化(无论是传统 WBC 还是 RL 策略)都必须遵守。RL 中常用“足底力超出摩擦锥”作为惩罚,逼迫策略不使用虚拖力。
优先级10:任务空间与零空间投影(Task Space & Null-Space Projection)
利用雅可比矩阵的伪逆,将关节控制解耦:优先严格完成高优先级任务(如支撑腿保持接触),然后在“不影响此任务”的零空间内,尽可能完成低优先级任务(如摆动腿跟随轨迹、优化躯干姿态)。
- 控制骨架: 这是全身控制的数学内核,实现了多约束下的层级化协调。哪怕在 RL 策略中,这种“优先保证接触,再谈摆动”的思想也隐形存在于约束设计中。
优先级11:足端轨迹与步态相位(Swing Trajectory & Gait Phase)
包含:支撑相/摆动相、静态/动态步态、落地冲击控制、触地探测
- 根据步态周期,生成足端从离地到落地的空间曲线(多项式、摆线),并结合力/高度传感探测切换相位。
- 步态状态机: 它将连续运动离散化为“摆动-支撑”事件,是避免磕绊、调节步频、减小落地冲击的基础。静态步态(重心恒在支撑区内)与动态步态(重心短暂脱离支撑区,靠惯性平衡)的划分,决定了运动方式的根本差异。
优先级12:全身控制(Whole-Body Control, WBC)
将浮动基、任务零空间、接触约束、摩擦锥、逆动力学(RNEA)等整合,在每一个控制周期构建并求解一个二次规划(QP)问题,实时输出满足所有约束的关节力矩。
- 传统最高集成: 它是经典控制思路在 Locomotion 上的最高成就。在具身智能中,WBC 常作为“安全底座”——RL 只输出高层的目标姿态或足力,由 WBC 保证物理可行地执行跟踪,完美结合了学习泛化性与模型精确性。
优先级13:强化学习核心要素(RL Essentials for Locomotion)
包含:状态观测空间、动作空间、奖励函数、课程学习
- 状态空间通常包含基座姿态、关节角速度、地形信息等;动作空间多为关节目标角度或目标力矩。
- 奖励函数是命脉: 它必须精确编码“跑得快、站得稳、用得省、摔得少”的期望行为。典型项包括:前进速度跟踪奖励、姿态平稳惩罚、能耗惩罚、倒地终止惩罚、足端接触力约束惩罚(与 ZMP/摩擦锥思想一致)。
- 课程学习让策略从简单平地开始,逐步应对复杂地形,是训练收敛的关键。
优先级14:Sim2Real 虚实迁移与域随机化(Sim-to-Real & Domain Randomization)
包含:域偏移、在线系统辨识;可以看看之前发的文档,也是先了解个大概即可,不用深入。
仿真训练的策略直接部署到实物,会因物理参数差异(质量、摩擦、电机滞后等)而失效。
- 域随机化在训练中刻意大范围扰动物理参数(惯性、摩擦力、关节阻尼),迫使策略学会鲁棒的特征,而不是过拟合仿真细节。
- 在线系统辨识则在实物运行时实时估计环境/自身参数,帮助策略动态自适应,是弥合“域偏移”的另一条路径。
优先级15:建模仿真基础(Simulation Foundations)
包含:URDF 模型、浮动关节、碰撞体、惯性参数、摩擦系数
- URDF 是机器人模型的统一描述文件。设置正确的碰撞体、精确的惯性参数和合理的摩擦系数,直接决定了仿真是否“像真的一样”,是所有动力学计算和 Sim2Real 的物理源头。浮动关节则是在仿真中实现基座 6 自由度自由运动的关键。
出处:两个AI链接的最后一个问题“具身智能Locomotion基础知识中,最重要的概念有哪些?比如单刚体”
https://www.doubao.com/thread/wce254b67c213e0fb
3、技术大全
- 1、【【人形机器人运动控制】30分钟看懂人形机器人背后的工程逻辑】https://www.bilibili.com/video/BV1PFArzLEv5?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 2、【人形机器人运控算法概览】https://www.bilibili.com/video/BV17ooSB2E93?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 3、【人形机器人自由度分析与设计】https://www.bilibili.com/video/BV1Tjbtz7Esk?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 4、【从零手搓人形机器人之运动学板块(一)】https://www.bilibili.com/video/BV1dp1wB5Ex5?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 5、【从零手搓人形机器人之逆运动学解算】https://www.bilibili.com/video/BV1pJCDB9E3D?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 6、【机器人动力学 理论基础+MATLAB机器人工具箱使用介绍】https://www.bilibili.com/video/BV1KwqDByEnU?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 7、https://zhuanlan.zhihu.com/p/638773309
- 8、https://zhuanlan.zhihu.com/p/639128926
- 9、https://zhuanlan.zhihu.com/p/638997599
- 10、https://zhuanlan.zhihu.com/p/640057159
- 11、https://zhuanlan.zhihu.com/p/640296839
- 12、https://zhuanlan.zhihu.com/p/641297823
- 13、https://zhuanlan.zhihu.com/p/644393000
- 14、RL系列:【【2025最新版】这绝对是B站讲最明白的人形机器人:通过模仿人类行为来指导机器人的设计和控制!通俗搞懂强化学习PPO及DQN算法+月球登陆器训练实例】https://www.bilibili.com/video/BV1tCk6BeErt?p=3&vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
- 15、IL:【【2025最新版】这绝对是B站讲最明白的人形机器人:通过模仿人类行为来指导机器人的设计和控制!通俗搞懂强化学习PPO及DQN算法+月球登陆器训练实例】https://www.bilibili.com/video/BV1tCk6BeErt?vd_source=a92f8ea7b6d4026544064fc6d3ac1cd9
精简知识树
一、机器人学基础
- 1.1 机器人运动学
- 正/逆运动学、雅可比矩阵
- 微分运动学、工作空间与奇异性分析
- 1.2 机器人动力学
- 刚体动力学建模、拉格朗日-欧拉法、牛顿-欧拉法
- 递推牛顿-欧拉算法 (RNEA) 与 Featherstone 算法
- 浮动基动力学、惯性参数辨识
- 欠驱动系统与被动自由度
- 1.3 机器人建模
- 连杆坐标系(DH 参数法)、URDF 描述
- 多体系统动力学
- 执行器模型、传感器模型
二、机器人运动控制专项技术
- 2.1 足式机器人运动控制
- 步态规划(静态/动态步态)
- 零力矩点 (ZMP) 理论、捕获点 (Capture Point)
- 倒立摆模型(线性倒立摆 LIPM、弹簧负载倒立摆 SLIP)
- 足端轨迹规划、落地冲击控制
- 混合零动力学 (HZD) 与虚拟约束
- 多接触优化与全身控制 (WBC)
- 基于优化的接触序列 + 全身运动规划
- 平衡控制与地形适应
三、机器学习与强化学习基础
- 3.1 机器学习基础
- 监督学习/无监督学习、深度学习基础
- 神经网络架构(CNN, RNN/LSTM, Transformer, 图神经网络)
- 生成模型(VAE, GAN, 扩散模型)
- 反向传播与优化器
- 3.2 强化学习基础
- 马尔可夫决策过程 (MDP)、值函数方法(Q-learning, SARSA)
- 策略梯度方法、演员-评论家 (Actor-Critic)
- 深度 Q 网络 (DQN)、PPO、SAC、DDPG
- 基于模型的 RL (MBRL)、分层强化学习(Options 框架)
- 3.3 机器人学习基础
- 模仿学习(行为克隆、DAgger、逆强化学习)
- 从演示中学习 (LfD)、迁移学习
- 元学习 (Meta-Learning)、领域自适应、多任务学习
四、具身智能特有的运动学习方法
- 4.1 基于强化学习的运动控制
- 端到端运动控制、奖励函数设计
- 课程学习、安全强化学习
- 从仿真到现实 (Sim2Real):域随机化、系统辨识与自适应
- 在线系统辨识(EKF/Bayes 估计环境参数)
完整知识树
一、数学基础(核心前置)
- 1.1 线性代数
- 向量与矩阵运算
- 特征值与特征向量、奇异值分解 (SVD)
- 矩阵求导
- 李群与李代数(SO(3), SE(3))
- 四元数与旋转表示
- 1.2 微积分与微分方程
- 多元微积分
- 常微分方程 (ODE) / 偏微分方程 (PDE) 基础
- 变分法
- 数值积分与数值微分
- 1.3 概率与统计
- 概率分布、期望、贝叶斯推断
- 马尔可夫链、高斯过程、蒙特卡洛方法
- 状态估计理论(基础)
- 1.4 优化理论
- 凸优化、线性规划与二次规划
- 非线性优化、约束优化
- 梯度下降及其变种、拉格朗日乘数法
二、物理基础
- 2.1 经典力学【AAA]
- 牛顿力学、拉格朗日力学、哈密顿力学
- 刚体动力学
- 碰撞与接触力学
- 摩擦模型(库仑、粘滞)
混杂系统基础(连续动力学 + 离散接触/事件切换)
- 2.2 材料力学基础
- 应力与应变、刚度与强度
- 振动与模态分析
- 疲劳与断裂力学
- 2.3 流体力学(适用于水下/飞行机器人)
- 流体静/动力学、升力与阻力
- 伯努利方程、湍流基础
三、机器人学基础 MVP
- 3.1 机器人运动学【AAA]
- 正/逆运动学、雅可比矩阵
- 微分运动学、工作空间与奇异性分析
- 3.2 机器人动力学【AAA]
- 刚体动力学建模、拉格朗日-欧拉法、牛顿-欧拉法
- 递推牛顿-欧拉算法 (RNEA) 与 Featherstone 算法
- 浮动基动力学、惯性参数辨识
- 欠驱动系统与被动自由度
- 3.3 机器人建模【AAA]
- 连杆坐标系(DH 参数法)、URDF 描述
- 多体系统动力学
- 执行器模型、传感器模型
- 3.4 状态估计
- 卡尔曼滤波 (KF)、扩展卡尔曼滤波 (EKF)、无迹卡尔曼滤波 (UKF)
- 粒子滤波
- SLAM 基础、里程计与 IMU 融合
- 本体感受/视觉/触觉融合(因子图优化)
四、经典与现代控制理论
- 4.1 经典控制理论
- PID 控制、根轨迹、频率响应法【AAA]
稳定性判据(劳斯、奈奎斯特)、超前-滞后校正
- 4.2 现代控制理论
- 状态空间表示、能控/能观性、极点配置
- 线性二次调节器 (LQR)、线性二次高斯 (LQG)
- 模型预测控制 (MPC)【AAA]
- 4.3 高级控制理论
鲁棒控制(H∞)、自适应控制滑模控制、反步控制 (Backstepping)- 阻抗/导纳控制、力位混合控制
- 轨迹优化方法:直接配点法、多重打靶法
- 微分动态规划 (DDP) 与迭代 LQR (iLQR)
五、机器人运动控制专项技术
- 5.1 足式机器人运动控制【AAA] MVP
- 步态规划(静态/动态步态)
- 零力矩点 (ZMP) 理论、捕获点 (Capture Point)
- 倒立摆模型(线性倒立摆 LIPM、弹簧负载倒立摆 SLIP)
- 足端轨迹规划、落地冲击控制
- 混合零动力学 (HZD) 与虚拟约束
- 多接触优化与全身控制 (WBC)
- 基于优化的接触序列 + 全身运动规划
- 平衡控制与地形适应
5.2 轮式机器人运动控制差速驱动、阿克曼转向、全向移动控制路径跟踪、避障控制、编队控制
5.3 飞行机器人运动控制姿态/位置控制、轨迹跟踪、悬停、抗风干扰
5.4 水下机器人运动控制- 六自由度运动控制、水动力补偿、深度与姿态保持
六、机器学习与强化学习基础 MVP
- 6.1 机器学习基础【AAA]
- 监督学习/无监督学习、深度学习基础
- 神经网络架构(CNN, RNN/LSTM, Transformer, 图神经网络)
- 生成模型(VAE, GAN, 扩散模型)
- 反向传播与优化器
- 6.2 强化学习基础【AAA]
- 马尔可夫决策过程 (MDP)、值函数方法(Q-learning, SARSA)
- 策略梯度方法、演员-评论家 (Actor-Critic)
- 深度 Q 网络 (DQN)、PPO、SAC、DDPG
- 基于模型的 RL (MBRL)、分层强化学习(Options 框架)
- 6.3 机器人学习基础【AAA]
- 模仿学习(行为克隆、DAgger、逆强化学习)
- 从演示中学习 (LfD)、迁移学习
- 元学习 (Meta-Learning)、领域自适应、多任务学习
七、具身智能特有的运动学习方法
- 7.1 基于强化学习的运动控制【AAA] MVP
- 端到端运动控制、奖励函数设计
- 课程学习、安全强化学习
- 从仿真到现实 (Sim2Real):域随机化、系统辨识与自适应
- 在线系统辨识(EKF/Bayes 估计环境参数)
- 7.2 基于模型的强化学习
- 动力学模型学习、MPC 与 RL 结合
- 规划与学习结合、基于模型的策略优化 (MBPO)
- 7.3 层次化运动控制
- 运动基元、动态运动基元 (DMP)、概率运动基元 (ProMP)
- 选项框架 (Options Framework)、高层规划与低层控制结合
- 运动表征学习(从动捕数据学习潜空间,VAE 嵌入)
- 离线 RL(从固定数据集学习策略)
- 7.4 多模态感知与运动融合
- 视觉-运动控制(高度图/深度图地形感知,端到端 RGB-D→关节扭矩)
- 触觉-运动控制、听觉-运动控制
- 多传感器融合、主动感知
- 教师-学生蒸馏(特权信息策略 → 本体感知策略)
八、硬件与系统实现
- 8.1 机器人硬件
- 执行器(伺服/液压/气动)、减速器(谐波/行星)
- 传感器(IMU、编码器、力/力矩、相机、激光雷达)
- 电源系统、机械结构设计
- 8.2 嵌入式系统与实时控制
- 实时操作系统 (RTOS)、微控制器与 FPGA
- 通信协议(CAN、EtherCAT)
- 控制周期与延迟分析、硬件在环仿真 (HIL)
- 8.3 仿真环境
- 物理引擎(MuJoCo, Isaac Gym, PyBullet, Bullet, PhysX, RaiSim)
- 机器人仿真平台(Gazebo, Webots, Isaac Sim, Drake)
- 仿真噪声建模与域随机化、sim2real 差距分析
- 8.4 软件框架
- ROS / ROS2、运动控制库(MoveIt!, Orocos KDL, Pinocchio)
- 强化学习框架(PyTorch, TensorFlow, Stable Baselines)
- 动力学库(RBDL, DART)
九、前沿研究方向
- 9.1 通用与敏捷运动控制
- 通用人形机器人运动控制、跨地形能力
- 全身运动控制(动态操作 + 运动结合)
- 敏捷动作生成(后空翻、跑酷)与抗扰恢复策略
- 腿臂协作(Mobile Manipulation) 与全身 MPC
- 9.2 具身大模型与世界模型
- 大语言模型与运动指令生成、常识推理
- 世界模型(学习环境动力学)
- 以自然语言驱动的长期运动规划
- 9.3 进化与发育机器人学
- 进化算法用于运动控制
- 形态与控制协同进化
- 发育式学习、终身学习
- 9.4 多机器人协同运动
- 编队控制、协作搬运、群体智能、分布式运动控制
- 9.5 安全与验证
- 安全后退策略 (Fallback Policy)
- 可达域分析与形式化安全验证
- 学习控制器的对抗攻击与加固
issc-rl-gym MVP foot
十、实践与项目(学习检查点)
倒立摆与简单轮式机器人 PID 控制机械臂运动学/动力学仿真 + 欠驱动系统建模双足机器人基于 ZMP / Capture Point 的平衡与步行仿真四足机器人利用 PPO/SAC 训练行走(Isaac Gym)完整的 Sim2Real 迁移实验(域随机化 → 实体机器人)视觉/高度图引导的足式机器人野外地形适应多接触全身控制仿真(如爬梯、跨越障碍)
总结
足式机器人与具身智能运动控制是一套「物理理论 - 数学建模 - 控制算法 - 智能学习 - 工程仿真落地」完整闭环体系,学习不能跳跃顺序。从 DH、URDF 基础建模起步,吃透运动学与刚体动力学两大底层工具,再掌握 ZMP、倒立摆、全身控制等平衡方案,最后拓展强化学习与虚实迁移前沿技术。
遵循「先宏观框架,后数学细节;先传统模型控制,后数据驱动强化学习」的思路,搭配文中配套视频、专栏资源与实操项目逐步练习,既能夯实理论功底,又能贴合工业与科研实际需求,彻底解决知识点零散、学完不会落地的痛点,形成完整的足式机器人知识体系。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)