在机器人运动操控 (Loco-Manipulation) 领域,尤其是在需要与环境发生丰富接触的任务中,对接触力与机器人位置的协同建模至关重要。然而,现有方法往往将力控制与位置控制分离,或完全依赖于位置控制,这限制了机器人在接触丰富场景下的应用能力。

针对此挑战,来自北京通用人工智能研究院 (BIGAI) 与宇树科技 (Unitree) 的研究者们在论文 Learning a Unified Policy for Position and Force Control in Legged Loco-Manipulation 中,提出了一种无需依赖外部力传感器的力-位统一控制策略。该策略通过强化学习,使机器人能够从历史状态中隐式估计外力,并动态调整其位姿与速度以实现力与位置的协同控制。

项目主页: https://unified-force.github.io/
论文链接: https://arxiv.org/abs/2505.20829


核心理念与主要贡献

传统的足式机器人控制策略在处理需要移动和操作的任务时,通常将运动(Locomotion)和操控(Manipulation)或力控制与位置控制分开处理。该研究的核心理念在于打破这种分离,通过在模拟环境中进行大规模并行训练,让单一的强化学习策略自主学会如何在力指令、位置指令以及外部扰动之间找到平衡。

该论文的主要贡献可归纳为以下几点:

  1. 首个力-位统一控制模型: 提出了首个在足式运动操控中学习统一力-位控制的模型,通过单一策略实现了包括位置跟踪、力施加、顺从交互在内的多样化控制行为。
  2. 无传感器的力估计: 策略内置了一个力估计模块,能够仅根据机器人的历史状态(如关节信息、基座姿态等)预测末端执行器受到的外力,从而在没有安装力传感器的硬件上实现力感知。
  3. 力感知模仿学习 (Force-aware Imitation Learning): 提出了一种新的模仿学习数据采集流程。利用该统一策略进行遥操作,采集到的演示数据不仅包含传统的位姿轨迹,还包含了“伪标签”式的力信息。实验证明,这些含力数据能将接触类任务的成功率平均提升 39.5%
  4. 跨形态泛化验证: 该控制框架成功部署于宇树的 B2-Z1 四足机械臂G1 人形机器人上,验证了其在不同机器人形态间的泛化能力,为通用机器人控制奠定了基础。
  5. 真实的物理世界验证: 通过在真实机器人上进行的7组实验,全面展示了该策略在多样化及充满挑战的任务场景中的有效性与鲁棒性。

展示了该统一策略支持的多样化运动操控行为,以及在四足与人形机器人上的应用


方法论与算法实现

1. 力-位控制的统一数学框架

研究者首先将力与位置的关系建立在阻抗控制 (Impedance Control) 的框架下。对于末端执行器,其受到的合力 F 与期望位置 xdes 和实际位置 x 的关系可简化为胡克定律形式:

其中 K 是刚度矩阵。合力 F 由多个部分构成:机器人主动施加的指令力 Fcmd、环境施加于机器人的反作用力 Freact 以及外部扰动力 Fext

由此,为了在受到各种力的情况下达到期望的平衡状态,策略需要计算出一个补偿后的目标位置 xtarget。其推导过程如下:

这个公式是整个统一框架的核心,它清晰地描述了机器人的最终目标位置应如何根据位置指令(xcmd)、力指令(Fcmd)以及环境的各种力(Fext, Freact)进行动态调整。同理,对于机器人基座的控制,也可以推导出类似的速度补偿公式:

其中 D 为阻尼系数。

2. 策略网络架构

该策略网络是一个三段式结构,在高频(50Hz)闭环下运行:

展示了在模拟器中进行强化学习的策略网络架构

  1. 观测编码器 (Observation Encoder):

    • 输入: 机器人本体状态(基座姿态、角速度、关节角度、关节速度、上一时刻的动作)、指令(目标速度、位置、力)以及步态时钟信号。
    • 结构: 通过多层感知机(MLP)和长短期记忆网络(LSTM),从包含32个时间步的历史观测中提取时序特征,编码成一个潜在向量。
  2. 状态估计器 (State Estimator):

    • 功能: 该模块是实现“无传感器力感知”的关键。它接收编码后的特征,并从中预测出当前机器人受到的外部合力 F、末端执行器的世界坐标系位置以及基座速度。
    • 监督: 在训练中,此模块的输出会与模拟环境中的真值进行比较,通过均方误差损失(MSE Loss)进行监督学习。
  3. 执行器 (Actor):

    • 功能: 接收编码器和估计器的输出特征,生成最终的动作指令。
    • 输出: 网络的输出是关节目标位置的残差 (residual)。该残差会与一个默认的站立姿态相加,形成最终的PD控制器目标 q_target

3. 两阶段课程学习 (Two-stage Curriculum Learning)

为了保证训练的稳定性和效率,研究者采用了课程学习的训练范式:

  • 阶段一:位控预训练。 在没有外力和力指令的环境中训练机器人,使其首先掌握精准的全身运动和稳定行走能力。
  • 阶段二:注入力学交互。 在预训练的基础上,引入随机的力指令和外部扰动(推力),训练策略学会在碰撞、推挤等场景下进行力补偿并保持平衡。

这种从易到难的训练方式,使得策略能够平稳地从“纯位置控制”进化到“力位协同控制”。


实验结果与分析

研究团队在仿真和真实世界中进行了一系列详尽的实验,以验证该统一策略的性能。

1. 力与位置的跟踪精度

在仿真环境中,策略的位置跟踪平均误差小于0.1米,力估计误差在5-10N范围内。在真实机器人上进行的力控制测试中,当指令力在0-60N范围内变化时,实际测量力与指令力的平均误差在10N以内,证明了策略具备有效的力控制与估计能力。

展示了仿真中的位置与力跟踪误差,以及真实世界中的力控制精度

2. 力感知模仿学习的效果

这是该研究最具亮点的应用之一。团队使用训练好的统一策略作为底层控制器,通过遥操作来收集“力感知”的演示数据,并用这些数据训练了一个Diffusion Policy模型。

任务设置:

  • 擦黑板 (wipe-blackboard)
  • 开柜门 (open-cabinet)
  • 关柜门 (close-cabinet)
  • 被遮挡时开抽屉 (open-drawer-occlusion)

结果对比 (成功率):

任务 纯位置控制策略 (无力估计) 力感知策略 (有力估计) 成功率提升
擦黑板 0.22 0.58 +36%
开柜门 0.36 0.70 +34%
关柜门 0.30 0.72 +42%
遮挡开抽屉 0.30 0.76 +46%

分析:

  • 擦黑板: 力感知策略能持续施加稳定的接触压力,避免了纯位置控制策略“时而悬空,时而压力过大”的问题。
  • 开关柜门: 面对具有回弹机制的柜门(仅3mm的触发行程),力感知能力至关重要,纯视觉和位置信息难以完成任务。
  • 遮挡任务: 当视觉信息被遮挡时,力感知成为机器人完成任务的唯一线索,凸显了其在不确定环境下的关键作用。

这些结果强有力地证明了,力信息是机器人从“能动”到“会干活”的决定性因素
展示了力感知模仿学习的任务表现对比

3. 跨机器人形态的泛化能力

该框架不仅适用于四足机械臂,同样成功迁移到了Unitree G1人形机器人上。实验表明,G1机器人在受到外部推力时,能够通过调整身体姿态来维持平衡,表现出良好的顺从性和抗扰动能力。这证明了该策略学习到的是通用的物理交互规律,而非针对特定机器人形态的过拟合解决方案。

展示了策略实现的多种高级技能,如力控制(负重)、力跟踪和阻抗控制(拔河)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐