如果没有运动控制,那么和一台静止的服务器没有区别。

——从动作到能力

目录

01    动作≠能力:人形机器人运动控制的两个技术层级

02    技术迭代:支撑运动能力升级的核心技术栈

数据基础:从人到机器人的动作重定向(Retarget)

感知响应:运动跟踪(Motion Tracking)

风格泛化:对抗运动先验(AMP)

行为基础模型(Behavior Foundation Model,BFM)

任务智能:视觉语言动作模型与世界模型(VLA+World Model)

03    传统控制与智能能力控制对比

传统人形机器人运动控制

智能能力控制

04    从“机器”到“机器人”


人形机器人技术的核心突破,归根结底在于运动控制的迭代升级。

早期人形机器人仅能执行预设的固定肢体动作,功能单一、场景适配性极差;而当下行业技术迭代的核心方向,便是实现机器人从机械执行「动作」到自主适配「能力」的跨越式转变。

本文将在清晰界定二者核心差异的基础上,系统拆解从固定动作复刻到通用运动能力生成的全套核心技术体系。

01    动作≠能力:人形机器人运动控制的两个技术层级

在人形机器人运动控制体系中,“动作”与“能力”是两个完全不同的技术层级,二者的差异决定了机器人的智能化水平与场景适配能力。

  • 动作

提前通过人工编程、轨迹录制预设的固定肢体运动序列,是标准化、固化的运动轨迹。

工程师会提前标定机器人行走、挥手、抓取、弯腰等各类动作的关节角度、运动时序、位移轨迹,机器人运行时仅需精准复刻预设参数即可完成动作。

这种运动模式的核心逻辑是“给定轨迹、被动跟踪”:

优势是执行稳定、可控性高;
但存在致命短板:完全丧失环境自适应能力。

一旦地面平整度、目标位置、外部环境发生细微变化,固定动作极易失效,甚至出现失衡摔倒、作业失败的问题。

本质只是机械的肢体复刻,机器人并不理解动作对应的任务目标与运动逻辑。

  • 能力

是机器人具备的自主运动与任务适配能力,是智能化的核心体现。

拥有运动能力的机器人,无需人工预设全套运动轨迹,仅需接收最终任务目标,便可结合自身状态感知、环境视觉感知,实时规划、动态调整肢体运动方案。

在复杂非结构化场景中,机器人可自主调整步态、落脚点、躯干姿态与手臂运动轨迹,主动规避障碍、缓冲外部扰动、修正运动偏差,独立完成既定任务。

如果说动作是“录制好的固定表演”,那么能力就是“根据现场情况即兴完成任务”,核心逻辑从“被动执行轨迹”升级为“主动解决问题”。

整体而言,人形机器人运动控制的演进,本质是从固化动作复刻泛化能力生成的升级,核心解决的问题从“如何把预设动作走稳”,升级为“如何自主适配场景、高效完成任务”。

02    技术迭代:支撑运动能力升级的核心技术栈

从固化的“动作”到泛化的“能力”,现在有一整套技术来支撑,这套技术体系从数据迁移、动态响应、运动风格、行为底座到任务决策,层层递进。

数据基础:从人到机器人的动作重定向(Retarget)

动作重定向是机器人自主运动能力的数据基础。

人类的运动姿态自然、协调,是机器人最优的运动参考样本,但人体与机器人的骨骼结构、关节自由度、运动限位、体型参数差异极大,原始人体动作捕捉数据无法直接用于机器人执行。

▲图| 机器人的Retarget比电影特效里面的复杂多了,后者只有像素变化

  • 核心原理

该算法的核心原理是空间映射与约束优化,通过坐标转换、运动姿态特征提取、关节极限约束校正,剔除人体与机器人结构不匹配的冗余参数,保留自然流畅的核心运动特征,将人类动作数据适配为机器人可执行的关节运动轨迹。

▲图| CG里面的retarget,不涉及真机

通过这一技术,可批量生成海量、自然的机器人基础动作素材,摆脱人工编程动作效率低、姿态僵硬的弊端。

  • 关键过程

动作重定向本质是带约束的高维往低维的空间映射。也就是从人的运动维度向机器人运动维度的映射。

设人体动捕关节姿态向量为$\boldsymbol{q}_h \in \mathbb{R}^{n_h}$,机器人关节姿态向量为$\boldsymbol{q}_r \in \mathbb{R}^{n_r}$(分别为人体、机器人自由度,维度不相等)。

算法通过构建映射函数$\boldsymbol{q}_r = \mathcal{F}(\boldsymbol{q}_h)$,求解最优机器人姿态,目标优化函数为:

\min \left\|\mathcal{F}(\boldsymbol{q}_h) - \boldsymbol{q}_r\right\|^2

同时强制满足机器人机械约束:$\boldsymbol{q}_{r,\min} \leq \boldsymbol{q}_r \leq \boldsymbol{q}_{r,\max}$、关节速度约束$\dot{\boldsymbol{q}}_r \leq \dot{\boldsymbol{q}}_{r,\mathrm{limit}}$

通过最小化姿态误差、约束机械极限,实现人体动作风格保留与机器人硬件可行性的平衡。

感知响应:运动跟踪(Motion Tracking)

运动跟踪实现了机器人从“回放固定动作”到“响应动态变化”的升级,是人机协同、动态作业的核心技术。

  • 核心原理

其核心原理是依托视觉传感器、惯性传感器实时采集目标物体或人体的位姿、速度、运动轨迹信息,通过滤波算法优化数据精度,再结合运动控制闭环逻辑,实时生成动态更新的机器人参考运动轨迹,驱动肢体持续跟随目标运动。

相较于固定动作执行模式,运动跟踪无需提前预设运动路径,可实时适配目标的移动、转向、变速等动态变化,广泛应用于机器人跟随、动态抓取、遥操作控制等场景,让机器人具备基础的环境动态响应能力。

▲图| Motion Tracking相关研究《Track Any Motions under Any Disturbances》

  • 关键过程

运动跟踪基于状态估计+轨迹跟踪闭环控制。设目标实时位姿状态为(位置+姿态角)

\boldsymbol{x}_t = \left[x, y, z, \alpha, \beta, \gamma\right]^T

机器人当前末端位姿为$\hat{\boldsymbol{x}}_t$,定义跟踪误差$\boldsymbol{e}_t = \boldsymbol{x}_t - \hat{\boldsymbol{x}}_t$

通过卡尔曼滤波优化观测噪声:

\hat{\boldsymbol{x}}_{t|t} = \hat{\boldsymbol{x}}_{t|t-1} + K_t\left(\boldsymbol{z}_t - \boldsymbol{H}\hat{\boldsymbol{x}}_{t|t-1}\right)

再通过控制律持续最小化误差$\dot{\boldsymbol{e}} = -\boldsymbol{K}\boldsymbol{e}$,让机器人末端位姿渐近收敛到动态目标位姿,实现连续平稳跟踪。

风格泛化:对抗运动先验(AMP)

对抗运动先验算法(Adversarial Motion Priors)是当前人形机器人实现运动泛化的核心之一,打破了固定动作库的场景限制,让机器人真正“学会运动”而非“复制动作”。

该算法属于模仿学习的进阶框架,核心是通过对抗训练让机器人掌握人类运动的底层规律与风格特征。

▲图| AMP概览,policy策略的载体其实是个神经网络

  • 核心原理

其训练原理分为两大核心模块:

一是生成器,即机器人运动策略网络,负责输出自主生成的肢体运动轨迹;

二是判别器,负责精准区分当前运动是人类真实参考动作还是机器人自主生成的动作。

在持续的对抗训练过程中,生成器不断优化运动策略,缩小与人类自然运动的差距,最终让机器人掌握步态平衡、肢体协同、姿态调节等底层运动逻辑。训练完成后,机器人无需预设轨迹,在全新场景中也能自主生成流畅、稳定、符合物理规律的全新动作,具备极强的运动泛化能力。

  • 关键过程

AMP 基于极小极大对抗优化,核心是最小化机器人运动与人类先验运动的分布差异。定义生成器策略为$\pi_\theta$(机器人运动策略),判别器为$D_\phi$。整体损失函数为:

\min_{\theta}\max_{\phi}\mathcal{L}(\theta, \phi) = \mathbb{E}_{(\tau\sim\pi_\theta)}\big[\log(1-D_\phi(\tau))\big] + \mathbb{E}_{(\tau\sim\text{data})}\big[\log D_\phi(\tau)\big]

其中$\tau$为运动轨迹序列,$\text{data}$为人类真实运动数据集。

判别器最大化真假轨迹的区分度,生成器最小化自身轨迹与人类轨迹的分布差距,最终让机器人学习到符合人类运动先验的状态分布,摆脱单条轨迹拟合,实现运动规律泛化。

行为基础模型(Behavior Foundation Model,BFM)

AMP 让机器人学习运动风格,而行为基础模型(Behavior Foundation Model)更进一步,打造一套统一的全身行为底座。

传统方案需要为行走、遥操作、动作跟踪分别训练独立控制器;BFM 通过大规模行为预训练,仅依靠单个模型,同时响应动作参考、速度指令、VR 遥操作、目标点位等多种控制信号,实现零样本切换不同运动任务。

相比 AMP 擅长学习 “怎么动得自然”,BFM 的重点 “如何用一套模型承载海量、可组合、可泛化的全身行为”,打通从参考动作到多样化自主行为的关键一环。

▲图| 《Behavior Foundation Model for Humanoid Robots》

  • 关建过程

BFM 将各类控制任务统一抽象为行为条件生成问题,依托条件变分自编码器(CVAE)+ 掩码在线蒸馏框架建模行为分布。

设机器人状态序列 $\boldsymbol{s}_{1:T}$、控制条件$\boldsymbol{c}$(参考轨迹 / 目标指令 / 速度指令),隐空间行为表征为$\boldsymbol{z}$

模型学习条件分布:

p(\boldsymbol{s}_{1:T}|\boldsymbol{c}) = \int p(\boldsymbol{s}_{1:T}|\boldsymbol{z},\boldsymbol{c})p(\boldsymbol{z}|\boldsymbol{c})d\boldsymbol{z}

训练目标最大化给定条件下机器人行为轨迹的对数似然。掩码蒸馏机制支持部分条件缺失下的行为补全,实现跨控制模式泛化。

后续衍生工作 BFM-Zero 进一步构建共享行为隐空间,将目标、奖励、运动轨迹嵌入同一表征空间,支持提示词驱动的行为生成:

a^* = \arg\min_{a} \mathbb{E}\left[ \sum_{k} \mathcal{J}(s_k, a_k; \text{Prompt}) \right]

仅通过高层提示,无需重新微调网络,即可生成全新全身行为。

技术定位 Retarget、AMP 更多聚焦「模仿人类运动、优化运动风格」,仍然偏向单一模式;

BFM 构建通用行为知识库,天然兼容动作跟踪、全身遥操作、目标到达等多类任务。它可以作为上层模块,接收动作重定向输出的参考轨迹,同时输出稳定、具备平衡自修正能力的全身运动,是衔接模仿学习与通用自主行为的核心基座。

任务智能:视觉语言动作模型与世界模型(VLA+World Model)

VLA与WM的融合,是人形机器人从“运动智能”升级为“任务智能”的核心标志,也是行业当前最前沿的技术方向。

该技术彻底摆脱了“先规划轨迹、再执行动作”的传统模式,实现任务理解、环境预判、运动规划的全自主闭环。

其中,视觉语言动作模型(VLA)负责人机交互与场景理解,可解析人类自然语言指令,结合视觉图像识别环境结构、物体位置、障碍物分布,将抽象的任务指令转化为具体的运动目标;

世界模型则具备时序预判能力,可基于当前环境与机器人状态,预测未来一段时间的环境变化、自身运动状态及潜在风险。

依托二者的协同,机器人可主动预判场景变化、提前规避风险、自主规划长时序运动方案,无需人工干预即可完成复杂综合任务。

▲图| VLA里面一般都会有一个显式的或者隐藏的VLM(视觉语言模型)

  • 核心原理

从原理角度,VLA+世界模型是高维时序状态预测+任务最优决策体系。

世界模型可建模环境与机器人的状态转移函数$\boldsymbol{s}_{t+1} = \mathcal{W}(\boldsymbol{s}_t, \boldsymbol{a}_t)$,$\boldsymbol{s}_t$当前环境与机器人联合状态,$\boldsymbol{a}_t$为当前动作。

VLA 将自然语言指令映射为代价函数$\mathcal{J}(\boldsymbol{a}_{t:T})$,通过滚动预测未来$T$步状态,求解最优动作序列:

\min \mathbb{E}\left[\sum_{k=t}^{T} \mathcal{J}(\boldsymbol{s}_k, \boldsymbol{a}_k)\right]

通过时序预测与全局代价优化,实现长周期、自主化的智能运动决策。

VLA在世界模型中进行虚拟训练,Vision通过Language进行推理,决策最佳Action,世界模型会预测这个Action在世界模型中造成的结果。

VLA模型根据实际模型预测的结果判定自己Action选择的好不好,然后训练改变自己的内部状态(也就是参数取值),下一次输出更好的Action。

打个比方,有点像七龙珠里面,孙悟空在界王那里练习二十倍界王拳,真实的世界可经不起他折腾,但世界模型可以。

另外,Language语言扮演的角色是高度抽象,语言本身是高度抽象的,一句话可以囊括数不清的类似场景,而不用一个个枚举。

03    传统控制与智能能力控制对比

传统人形机器人运动控制

以模型化控制为核心,依托零力矩点、线性倒立摆模型、模型预测控制、全身控制等算法,通过人工建模、参数调试、轨迹优化,实现机器人稳定运动。

该路线技术成熟、稳定性高、安全约束性强,适合结构化、固定场景的标准化作业,但存在明显短板,复杂场景需要大量人工调参,泛化能力极差,无法适配多变的非结构化环境。

即使现在,很多从业者还戏称自己为调参工程师,因为参数永远调不完,所以永远不会失业。

图片

  • 常见的几种传统控制:

(1)零力矩点(ZeroMoment Point,ZMP)是机器人动力学中用于描述稳定行走的关键概念,特指地面反作用力的合力作用点。

当机器人在运动时,若所有惯性力和重力产生的水平力矩在该点被完全抵消(即合力矩为零),则称该点为ZMP。

其物理意义在于:只要ZMP始终位于机器人足部与地面的接触多边形(支撑多边形)内,就能保证机器人不会倾倒。

▲图| ZeroMoment Point示意图。左:静止时重心投影及ZMP;右:动态步行时重心投影及ZMP

这一原理被广泛应用于双足机器人步态规划中,是判断动态平衡的核心指标。

在具身智能产品开发中,ZMP理论为服务机器人、外骨骼等移动设备提供了稳定性保障的数学基础。

例如扫地机器人在复杂地形行进时,通过实时计算ZMP位置调整重心,可避免侧翻风险。

▲图| 只要ZMP落在支撑多边形内,人和机器人都不会摔倒

ZMP(零力矩点)稳定判据核心公式:

x_{\text{zmp}} = \frac{\sum m_i \left(x_i \ddot{z}_i - z_i \ddot{x}_i\right)}{\sum m_i \left(\ddot{z}_i + g\right)}

稳定条件为$x_{\text{zmp}} \in$ 支撑多边形区域;

2)线性倒立摆模型(LIPM)通过固定质心高度线性化动力学,得到解析步态轨迹;

▲图| 直立机器人的走动可以建模为倒立摆

(3)MPC 则通过有限时域滚动优化,实现轨迹跟踪与稳定约束:

\min \sum_{k=0}^{N-1} \left\| x_{\mathrm{ref}} - x_{t+k} \right\|^2 + \lambda \left\| u_{t+k} \right\|^2

整体为确定性动力学建模+数值优化,依赖精确的人工建模。

智能能力控制

而从动作到能力的智能控制路线,以模仿学习、强化学习、虚实迁移、世界模型为核心:

不再依赖人工预设轨迹与精准动力学建模,通过数据训练让机器人自主学习运动规律、适配场景变化。

该路线的核心优势是环境自适应能力强、运动姿态自然、可适配复杂非结构化场景,能够实现传统控制算法难以完成的柔性交互、动态适配、自主作业;

短板是算法可解释性较弱,极端场景下的安全稳定性仍需持续优化。

当前行业主流方案是 传统模型控制+智能学习控制的混合架构
·底层依靠力矩控制、阻抗控制保障机器人基础平衡与运动安全;
·上层依托智能算法实现运动泛化与自主任务规划,兼顾稳定性与智能化。
智能算法不是绝对可靠的,所以说机器人的关节是要加限位器的,防止算法失效。

04    从“机器”到“机器人”

从动作到能力的演进,远非单一技术指标的渐进提升。

传统模式下,机器人的每一分运动智能都源自工程师的逐场景编程与调参——获取成本高昂且无法跨场景复用;

而以模仿学习、强化学习、世界模型为核心的智能控制路线,让机器人通过数据驱动自主习得运动规律,运动智能的边际成本趋近于零。

从“逐场景定制的自动化设备”进化为“一套模型适配海量场景的通用智能平台”。

同时,虚实迁移技术的不断成熟,将大幅降低真机调试成本,加速机器人运动能力的快速迭代,让各类新型人形机器人快速适配复杂真实场景。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐