Franka&TAM:面向机器人迁移的力矩自适应模块
在机器人学习中,仿真到现实(sim-to-real)的迁移是一个长期存在的挑战。策略通常在基于理想机器人模型(如厂商提供的URDF)的仿真中训练,而真实机器人的物理参数——包括关节摩擦、阻尼、连杆质量与质心偏差、末端负载等——往往与理想模型存在差异。这种差异会导致同一力矩指令在真实机器人上产生与仿真不同的运动响应,进而影响策略的执行效果。
传统方法通常采用域随机化(在训练时随机化物理参数)或策略侧在线自适应(如RMA,将自适应信号嵌入策略内部)。然而,域随机化要求每个任务策略都重新训练,可能使学习到的行为趋于保守;策略侧自适应则难以在不重新训练的情况下复用于第三方或独立编写的策略(如强化学习、行为克隆或模型预测控制生成的策略)。
针对这些局限,研究团队提出了TAM(Torque Adaptation Module,力矩自适应模块)——一种轨迹条件化的力矩自适应层。TAM的核心思路是将自适应层置于策略和低层控制器之下,直接工作在力矩接口层面。它不访问策略的观测、奖励、任务标签或内部结构,仅要求策略动作能够转换为名义力矩。
TAM的工作机制
TAM由两个运行时模块组成:
历史编码器:以约5Hz的频率异步运行,将机器人侧的长期本体感受和施加力矩历史(12秒滚动窗口)压缩为紧凑的隐状态z,用于推断当前的机器人侧失配。

Figure 1:TAM 部署接口
力矩适配器:以1kHz的硬件控制频率运行,接收隐状态z、当前状态历史和低层控制器产生的名义力矩,输出残差力矩Δτ,与名义力矩相加后形成修正力矩,应用于真实机器人。
训练数据来自任务无关的自由空间关节运动滚动,通过随机化物理参数和注入平滑外部力矩扰动来覆盖多样的状态、速度和失配情形。训练目标为局部力矩匹配:在给定状态下,使扰动模型在修正力矩驱动下的局部响应尽可能接近理想模型在名义力矩下的响应。

图 2:TAM 的数据生成与训练流程
Franka Research 3在TAM项目中的角色
Franka&TAM:面向机器人迁移的力矩自适应模块
TAM的真实世界评估主要在Franka Emika Panda机器人上进行,而Franka Research 3(FR3)正是Panda的后续升级型号,两者共享7自由度构型、±0.1mm重复定位精度和全关节力矩传感等核心特性。TAM项目所依赖的硬件能力,与Franka Research 3的技术特征高度对应:

关节力矩接口与全关节力矩传感:TAM的核心前提是能够访问机器人的力矩接口。Franka系列机器人每个关节均集成扭矩传感器,支持1kHz的力矩级控制,为TAM的残差力矩注入提供了硬件基础。TAM在Panda上以1kHz运行力矩适配器,这一频率与Franka控制接口的能力相匹配。
七自由度与冗余运动能力:TAM的评估任务包括视觉强化学习推箱、行为克隆翻转、MPC平衡球以及带负载的末端跟踪。这些任务涉及接触丰富的操作和动态运动,Franka的七自由度构型为这些任务提供了必要的运动灵活性。
理想模型的可用性:TAM的训练和评估依赖厂商提供的URDF及刚体惯性参数作为理想模型。Franka系列机器人拥有公开、详细的动力学模型,便于研究者构建理想参考模型,这是TAM方法能够落地的重要前提。
跨机器人迁移的验证基础:TAM在仿真中对Panda、Piper、iiwa14、Flexiv Rizon4、RBY-1、Google Robot、Unitree Z1等多种机械臂进行了跨机器人跟踪评估。其中Panda作为训练机器人之一,其模型质量和控制接口的规范性为多机器人预训练提供了可靠的数据来源。
在真实世界实验中,TAM在Panda上以单一共享权重集,支持了无需机器人侧域随机化的RL策略、BC策略和MPC策略的迁移。在带1kg未知负载的末端跟踪任务中,TAM将直接执行的位置跟踪误差从6.04cm降至1.29cm(carried状态)。
结语:
TAM提出了一种将自适应层置于力矩接口的模块化思路,使独立编写的策略能够在无需重新训练的情况下,通过力矩修正更好地适应目标机器人的物理特性。Franka Research 3(及项目实际使用的Panda)凭借其全关节力矩传感、1kHz力矩控制接口和公开的动力学模型,为TAM的验证提供了合适的硬件平台。
项目详情:https://dongwon-son.github.io/tam-project-page/
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)