论文信息:Kushal Kedia, Tyler Ga Wei Lum, Jeannette Bohg, C. Karen Liu. “SimToolReal: An Object-Centric Policy for Zero-Shot Dexterous Tool Manipulation”. Robotics: Science and Systems (RSS), 2026. arXiv:2602.16863.

一、为什么工具操作是机器人学的"硬骨头"

工具操作(tool manipulation)在机器人学中是一个既古老又年轻的课题。说它古老,是因为从工业机械臂拧螺丝到手术机器人持器械,人类早已在特定场景下实现了高度可控的工具使用;说它年轻,是因为要让一台通用机器人在面对从未见过的家用工具时,像人一样随手拿起、调整姿态、完成操作,至今仍远未解决。

这篇论文的起点正是这个"通用性"缺口。作者指出,工具操作之所以难,不是难在某一个孤立环节,而是难在技能链的完整性上。一个完整的工具使用过程通常包含三个紧密衔接的阶段:

  1. 抓取(grasping):工具可能平躺在桌面上,机器人需要以合适的姿态和力度将其握起。对平行夹爪来说,薄柄工具(如锤子把手、马克笔身)的抓取尤其困难——两个接触面沿单一轴线对齐,难以抵抗外部施加的扭矩。
  2. 手内重定向(in-hand reorientation):抓起工具后,往往需要将其旋转到"功能姿态"。以锤子为例,敲击前需要让锤头朝下;马克笔书写前需要让笔尖朝向白板。这种重定向完全依赖手指的独立运动,不能指望机械臂绕手腕转一圈来代劳。
  3. 力交互(forceful interaction):工具最终要与环境产生作用——敲击、擦拭、旋转、清扫。这一阶段不仅需要维持稳定的接触,还要根据环境反作用力动态调整握持力度。

这三个阶段对机器人硬件和算法提出了完全不同的要求:抓取考验感知与精细控制,重定向考验多自由度手指的协调,力交互考验接触动力学的建模与响应。现有方法往往只能覆盖其中一两个子问题。例如,DexGraspNet 系列专注于抓取姿态生成;OpenAI 的 Rubik’s Cube 工作展示了动态手内旋转,但依赖特定物体;而一些工业应用则通过预设握持姿态来回避重定向问题。真正打通整条技能链、并且能泛化到未知工具的尝试,在 SimToolReal 之前几乎不存在。

另一个深层困难在于数据。模仿学习(imitation learning)是当前机器人操作的主流范式,但它严重依赖高质量的人类演示数据。遥操作(teleoperation)灵巧手收集数据时,操作者面临三重障碍:首先,人手与机器手的运动学差异导致动作映射不直观;其次,操作者缺乏力觉和触觉反馈,难以凭视觉判断接触状态是否稳定;最后,复杂的手内旋转动作在遥操作界面中几乎无法精确表达。这些限制使得为每一个新工具、每一项新任务收集足够数据,在经济上和工程上都不可持续。

二、核心洞察:把"学会用锤子"变成"学会把东西搬到目标位姿"

SimToolReal 的核心贡献不是提出了一种新网络架构或新训练算法,而是重新陈述了问题本身。作者的关键观察是:无论使用什么工具、执行什么任务,其本质都可以被抽象为将一个物体(工具)沿着一条位姿轨迹移动。锤子敲击 = 将锤头按特定轨迹移动到钉子附近并施加冲击;马克笔书写 = 将笔尖按笔迹轨迹移动;螺丝刀旋转 = 将刀头对准螺丝并保持绕轴旋转。

这个洞察的直接产物是一个统一的数学框架。设 ot∈SE(3)o_t \in SE(3)otSE(3) 为工具在时刻 ttt 的位姿(包含三维位置和三维姿态),sts_tst 为机器人本体感知信息(关节角度、速度等),ϕ\phiϕ 为一个粗粒度的物体描述符(例如手柄区域的3D边界框),g∈SE(3)g \in SE(3)gSE(3) 为目标位姿。策略学习的目标是:

at=πθ(st,ot,ϕ,g)a_t = \pi_\theta(s_t, o_t, \phi, g)at=πθ(st,ot,ϕ,g)

即给定当前状态、工具位姿、物体描述和目标位姿,输出机械臂和手指的关节位置指令。任务执行的过程就是不断重复"到达当前目标位姿 → 切换到下一个目标位姿",直到完成整条轨迹。

这个重述的巧妙之处在于,它把任务信息完全外化到了目标位姿序列中,策略本身不需要知道"这是锤子"“要敲钉子”,它只需要知道"要把这个物体的功能部位送到这些位置去"。这种解耦带来了几个工程层面的实际好处:

第一,训练阶段完全不需要真实工具数据。 策略在仿真中训练时,面对的是程序化生成的简单几何原语(圆柱体和长方体组合而成),而不是真实扫描的3D模型。这些原语虽然看起来不像真实的锤子或马克笔,但它们在拓扑结构上保留了"手柄+头部"的抽象,而策略学习的是在这种抽象结构上完成位姿到达的通用技能。

第二,测试阶段完全不需要任务特定训练。 遇到新工具时,只需要从人类演示视频中提取出一条位姿轨迹,直接喂给同一个策略即可。策略在训练时从未见过这把真实的锤子,也从未学过"敲击"这个动作,但它已经学会了"将手柄握稳、将头部送到目标位置"的底层技能,而敲击轨迹只是这些底层技能的一次特定编排。

第三,避开了视觉域迁移问题。 传统的 sim-to-real 方法最大的痛点之一是视觉感知的不匹配:仿真中的物体渲染与真实世界的外观差异巨大。SimToolReal 通过把任务信息编码在目标位姿中,策略在运行时只接收工具当前位姿、目标位姿和一个粗粒度的3D边界框,而不接收原始视觉输入。这意味着视觉感知的责任被完全移交给了外部的位姿估计模块(FoundationPose),策略本身不受视觉域差异的影响。

三、训练阶段:程序化原语与SAPG

3.1 仿真环境与程序化物体生成

SimToolReal 的训练在 IsaacGym 中进行,这是 NVIDIA 提供的大规模并行 GPU 物理仿真环境,可同时运行数万个环境实例进行并行采样。作者基于 DexPBT 的 Kuka Allegro 重定向环境进行了大量修改,最终配置了一个 29 自由度的机器人系统:7-DoF KUKA iiwa 14 机械臂 + 22-DoF Sharpa 五指灵巧手。

训练时,每个 episode 开始时随机摆放一个程序化生成的物体,并随机初始化机器人关节配置。随后采样一条目标位姿序列 {gk}k=1K\{g^k\}_{k=1}^K{gk}k=1K。机器人需要先学会从桌面上抓起物体,然后依次到达每个目标位姿。如果物体掉落,episode 立即终止并重新开始。

程序化物体的生成策略值得仔细分析。每个工具被抽象为手柄 + 头部的组合:

  • 手柄:长度在 5-30 cm 之间采样,截面尺寸(宽度/高度/直径)在 1-4 cm 之间采样
  • 头部:长度在 1-15 cm 之间采样,截面尺寸在 0.5-12 cm 之间采样
  • 形状:手柄和头部各自随机选择长方体或胶囊体(带圆头的圆柱)
  • 密度:手柄密度较低(300-600 kg/m³,近似木头或塑料),头部密度较高(300-2000 kg/m³,近似金属或 dense rubber)

这种设计有两个重要的工程动机。其一,长方体 + 胶囊体的组合虽然几何简单,但已经覆盖了从细马克笔到粗锤子的常见手持工具的形状空间。其二,通过在手柄和头部之间引入密度差异,物体的质心位置会系统性偏向头部,这恰好模拟了真实工具(如锤子)的惯性特征。策略在训练时被迫适应不同质心位置的物体,从而学会了根据惯性调整握持方式和运动规划。

3.2 奖励函数设计:从"到达"到"稳定握持"的引导

奖励函数是整个训练框架中最能体现作者工程经验的环节。总奖励包含三个主要成分:

r=rsmooth+rgrasp+Igrasped⋅rgoalr = r_{smooth} + r_{grasp} + \mathbb{I}_{grasped} \cdot r_{goal}r=rsmooth+rgrasp+Igraspedrgoal

平滑奖励 rsmoothr_{smooth}rsmooth 惩罚关节速度的 L1L_1L1 范数,分别对机械臂和手指使用不同的权重系数 λarm\lambda_{arm}λarmλhand\lambda_{hand}λhand。这个设计的直觉是:高频抖动动作在仿真中很容易产生(因为 IsaacGym 的物理引擎允许瞬时速度变化),但真实执行器无法复现这些动作,会导致电机过热、机械磨损甚至硬件损坏。通过在奖励中嵌入平滑性偏好,策略自然学会了生成柔和、连贯的动作轨迹。

抓取奖励 rgraspr_{grasp}rgrasp 只在 episode 前期生效,目标是引导机器人从随机初始姿态过渡到稳定握持。它由两项组成:

rgrasp=rapproach+(1−Igrasped)⋅rliftr_{grasp} = r_{approach} + (1 - \mathbb{I}_{grasped}) \cdot r_{lift}rgrasp=rapproach+(1Igrasped)rlift

其中 rapproachr_{approach}rapproach 鼓励手指接近物体,rliftr_{lift}rlift 鼓励将物体抬离桌面。这里有一个细节值得关注:rapproachr_{approach}rapproach 使用了一个"状态记忆"机制——它只奖励相对于历史最优距离的改进,而不是简单地奖励"当前距离小"。具体公式为:

rapproach=λapproach⋅max⁡(dˉft∗−dˉft,0)r_{approach} = \lambda_{approach} \cdot \max(\bar{d}_{ft}^* - \bar{d}_{ft}, 0)rapproach=λapproachmax(dˉftdˉft,0)

其中 dˉft\bar{d}_{ft}dˉft 是当前指尖到物体的平均距离,dˉft∗\bar{d}_{ft}^*dˉft 是 episode 开始以来达到的最小距离。这个设计的动机是防止策略停留在"刚好接近但不抓取"的局部最优:如果没有状态记忆,策略可能在物体附近徘徊获取持续的接近奖励,却永远不执行抓取动作。

目标位姿奖励 rgoalr_{goal}rgoal 是整个训练的主导信号,但只在物体被成功抓起后(Igrasped=1\mathbb{I}_{grasped} = 1Igrasped=1)才激活:

rgoal=max⁡(d∗−d(ot,g),0)+Bsucc⋅I[d(ot,g)<ϵ]r_{goal} = \max(d^* - d(o_t, g), 0) + B_{succ} \cdot \mathbb{I}[d(o_t, g) < \epsilon]rgoal=max(dd(ot,g),0)+BsuccI[d(ot,g)<ϵ]

第一项是稠密的进度奖励,其中 d∗d^*d 是当前目标位姿被达到过的最小距离,同样使用状态记忆来避免"原地蹭奖励"。第二项是稀疏的成功奖励 BsuccB_{succ}Bsucc,在距离低于阈值 ϵ\epsilonϵ 时一次性发放。这个两阶段奖励结构(先学抓取、再学到达)本质上是一种隐式课程学习(implicit curriculum),让策略先掌握基础技能,再逐步攻克复杂技能。

位姿距离 d(ot,g)d(o_t, g)d(ot,g) 的定义也经过了仔细设计。作者没有直接使用位置 + 旋转的加权距离,而是采用了基于关键点的表示:在物体局部坐标系中定义 4 个关键点,计算当前位姿和目��位姿下这 4 个关键点在世界坐标系中的最大欧氏距离。关键点被放置在物体边界框的四个角上:

k∈{[sx/2sy/2sz/2],[sx/2sy/2−sz/2],[−sx/2−sy/2sz/2],[−sx/2−sy/2−sz/2]}\mathbf{k} \in \left\{\begin{bmatrix}s_x/2 \\ s_y/2 \\ s_z/2\end{bmatrix}, \begin{bmatrix}s_x/2 \\ s_y/2 \\ -s_z/2\end{bmatrix}, \begin{bmatrix}-s_x/2 \\ -s_y/2 \\ s_z/2\end{bmatrix}, \begin{bmatrix}-s_x/2 \\ -s_y/2 \\ -s_z/2\end{bmatrix}\right\}ksx/2sy/2sz/2,sx/2sy/2sz/2,sx/2sy/2sz/2,sx/2sy/2sz/2

这种表示有一个几何直觉:它同时编码了位置和旋转误差,而且对细长的工具(如手柄较长的锤子)更敏感于俯仰和偏航误差(绕 y 轴和 z 轴的旋转),因为这些误差会导致头部大幅度偏移。通过设置 sxrew>syrew,szrews_x^{rew} > s_y^{rew}, s_z^{rew}sxrew>syrew,szrew,奖励自然引导策略优先对齐工具的主轴方向。

3.3 SAPG:为什么标准PPO不够用

SimToolReal 使用 SAPG(Split and Aggregate Policy Gradients)作为训练算法,这是 PPO 的一种变体。标准 PPO 在大规模并行仿真中会遇到探索瓶颈:当同时运行数万环境实例时,所有环境共享同一个策略,导致采集到的经验高度同质化,策略很容易陷入局部最优。

SAPG 的解决方案是维护一个策略群体(population of policies):将并行环境划分为多个块(block),每个块使用不同的策略进行探索。在策略更新阶段,SAPG 汇总所有策略的梯度信息,用一种类似重要性采样的方式将不同策略的经验聚合起来,更新一个"领导策略"(leader policy)。这样做的效果相当于在策略空间中维持了多个并行的探索线程,每个线程在不同的行为模式中进行试错,最终的经验被统一用于改进主策略。

消融实验验证了 SAPG 的必要性:将 SAPG 替换为标准 PPO 后,训练奖励显著下降。这说明在灵巧操作这种高维动作空间、接触不连续、奖励稀疏的任务中,单纯的熵正则化(PPO 的标准探索机制)不足以维持有效探索,必须引入显式的群体多样性机制。

3.4 非对称Critic:给评论家"开天眼"

SimToolReal 采用非对称 Actor-Critic 架构。Actor(策略网络)在训练和测试时只接收有限的观测信息:本体感知、物体位姿(带噪声和延迟)、目标位姿、粗粒度边界框。而 Critic(价值网络)在训练时可以访问特权状态(privileged state),包括无噪声的精确物体位姿、真实的线速度和角速度、即时的奖励信号、历史最优距离等。

这个设计的工程动机很直白:真实部署时我们无法获得精确的物理状态(尤其是接触力和物体速度),但训练时如果能给价值函数提供更准确的状态估计,Critic 就能更好地评估策略的表现,从而给出更可靠的策略梯度信号。从另一个角度看,这相当于让 Critic "开天眼"看到底层真相,而 Actor 必须在信息受限的情况下学会鲁棒决策。测试时 Critic 不参与推理,所以这种信息不对等不会影响部署性能。

消融实验同样证实了这个组件的重要性:移除非对称 Critic、强迫 Critic 和 Actor 使用相同的受限观测后,训练性能严重下降。这说明部分可观测性(partial observability)是灵巧操作任务的核心挑战之一,直接基于噪声观测估计价值函数会导致策略学习不稳定。

3.5 域随机化:让策略对真实世界"脱敏"

SimToolReal 在训练中应用了系统性的域随机化,覆盖以下几个方面:

  • 观测延迟和动作执行延迟:用 FIFO 队列模拟真实系统的通信和控制延迟
  • 物体位姿估计噪声和延迟:对物体位姿观测注入高斯噪声并引入随机延迟,模拟 FoundationPose 在实际运行中的不确定性
  • 抓取区域边界框扰动:对输入策略的边界框中心和尺寸添加随机扰动,使策略不依赖精确的边界框标注
  • 外部力和扭矩扰动:对物体施加随机力和扭矩,迫使策略学习强稳定的握持
  • 桌面高度随机化:在每个 episode 开始时轻微扰动桌面高度,提高对几何标定误差的鲁棒性
  • 手指自碰撞限制:保守地限制手指外展/内收关节的活动范围,防止策略在仿真中发现可能导致真实硬件自碰撞的姿态

这些随机化策略的选择反映了一个核心原则:不是对所有物理参数均匀随机化,而是针对性地对真实部署中最不确定、最可能出错的环节进行扰动。例如,物体位姿估计的噪声和延迟被赋予了比关节速度噪声更大的随机范围,因为作者观察到在真实系统中视觉跟踪的不稳定性是主要误差源。

四、部署阶段:从人类视频到机器人动作

4.1 感知管道:SAM 3D + FoundationPose

SimToolReal 的零样本能力在很大程度上依赖于一个精心设计的外部感知管道。给定一段第三人称 RGB-D 人类演示视频,管道输出两样东西:

  1. 工具的度量级3D网格(metric-scale mesh)和一个3D抓取边界框
  2. 一条6D物体位姿轨迹

具体流程如下:

步骤一:物体分割。 使用 SAM 2(Segment Anything Model 2)在第一帧中对工具进行分割。作者发现,虽然 SAM 2 支持文本提示,但在实际操作中,用两个点提示(一个在物体上、一个不在)比文本提示更可靠。

步骤二:3D网格重建。 使用 SAM 3D 从分割结果和深度图生成度量级3D网格。SAM 3D 默认依赖单目深度估计来恢复三维结构,但 SimToolReal 直接使用采集到的真实深度图替代预测深度,确保尺度准确。

步骤三:功能部位分割。 这一步的目标是将网格分成"手柄"(可抓握区域)和"头部"(功能区域)。作者采用了一个半自动化的方案:从虚拟相机围绕物体旋转拍摄一组渲染图,用户在第一帧上用点提示标注手柄和头部,SAM 2 自动将这些标注传播到整个序列。随后将掩码反投影到3D空间,得到手柄和头部的点云,进而裁剪出两个子网格。

步骤四:抓取边界框定义。 边界框以手柄的几何中心为中心点,x轴沿手柄指向头部的方向对齐。这个坐标系的定义至关重要,因为它确保了不同工具实例的边界框在语义上是一致的:x轴总是"从手柄到头部",y轴和z轴定义了截面的两个方向。

步骤五:位姿轨迹提取。 使用 FoundationPose 在整个 RGB-D 视频上进行6D位姿跟踪,输出30Hz的原始轨迹。随后进行两个后处理:

  • 时间下采样:从30Hz降到3Hz,起到低通滤波作用,消除帧间位姿估计的抖动
  • 截断静止段:自动删除物体还在桌面上静止的预备阶段,只保留物体被拿起后的操作段

4.2 推理时闭环控制

在实际部署时,SimToolReal 以 30Hz 的频率运行闭环控制。每一时刻,策略接收以下输入:

  • 机器人本体感知:29个关节的位置和速度,前一步的关节目标位置,手掌位姿(3D位置+四元数),5个指尖相对于手掌的位置
  • 物体状态:物体方向四元数,4个物体关键点相对于手掌的位置,4个关键点到目标的误差向量,物体尺度(抓取边界框的尺寸)
  • 目标位姿:来自人类视频轨迹的当前目标位姿

策略输出29维的关节位置目标值。对机械臂(7-DoF),动作被解释为相对于上一目标位置的增量(delta control),乘以一个缩放因子 karm=0.025k^{arm} = 0.025karm=0.025;对手指(22-DoF),动作被直接映射为绝对关节位置目标。两组目标都经过指数移动平均(EMA)滤波后发送到机器人控制器。

目标切换的逻辑很简单:当当前物体位姿与目标位姿的距离 d(ot,g)d(o_t, g)d(ot,g) 小于阈值 ϵ=2cm\epsilon = 2cmϵ=2cm 时,就切换到轨迹中的下一个目标位姿。这种闭环协议意味着策略不会盲目地追赶时间线,而是根据实际执行进度自适应推进。

值得注意的是,整个推理过程中策略不接收任何原始视觉输入,所有与工具相关的信息都已经被压缩为6D位姿 + 3D边界框。这种设计虽然牺牲了部分感知丰富性(例如无法根据视觉纹理判断工具材质),但极大地降低了 sim-to-real 迁移的难度——只要位姿估计模块能工作,策略就不需要关心真实世界与仿真之间的视觉差异。

五、DexToolBench:系统化的真实世界评估

为了量化评估 SimToolReal 的零样本泛化能力,作者构建了一个名为 DexToolBench 的真实世界基准。它包含 6 个工具类别、12 个真实物体实例、24 个操作任务轨迹:

类别实例1实例2任务1任务2
锤子Claw Hammer(3D打印,薄黑柄+灰头)Mallet Hammer(橡胶锤,木柄+黑色圆柱头)Swing Down:90°旋转后向下敲击3次Swing Side:90°旋转后侧向敲击3次
马克笔Sharpie Marker(标准记号笔)Staples Marker(干擦笔,略细)Draw Smile:在白板上画两个点和一个笑脸Write C:在白板上写C
橡皮Handle Eraser(带柄黄色刷毛橡皮)Flat Eraser(Expo泡沫块,无柄)Wipe Smile:擦除笑脸Wipe C:擦除C
刷子Blue Brush(厚黑柄+同向黄色刷毛)Red Brush(长黑柄+90°侧向黑色刷毛,较轻)Sweep Forward:90°旋转后向前清扫3次Sweep Right:90°旋转后向右清扫3次
锅铲Spoon Spatula(长圆柱黑柄+浅椭圆勺)Flat Spatula(薄矩形柄+平矩形刀片)Serve Plate:舀起、移动到另一盘、倒出Flip Over:180°翻转后舀起并翻转
螺丝刀Long Screwdriver(长杆+木柄,贴彩带降对称)Short Screwdriver(短杆+球状红黑手柄)Spin Vertical:90°旋转后垂直轴旋转360°Spin Horizontal:水平配置下旋转360°

每个任务由一段 RGB-D 人类演示视频定义,机器人需要"复现"视频中工具功能部位的轨迹。评估指标是Task Progress:成功跟踪的位姿路点占全部路点的百分比。阈值 ϵ=2cm\epsilon = 2cmϵ=2cm,低于此距离认为成功到达当前目标位姿。

六、实验结果:什么决定了泛化的成败

6.1 整体表现:零样本泛化的有效性

在 120 次真实世界 rollout(24 个任务 × 每个任务 5 次重复)中,SimToolReal 展现了相当可观的零样本性能。最亮眼的表现来自橡皮类任务:Handle Eraser 和 Flat Eraser 在所有 rollout 中都达到了 100% 的 Task Progress。这是因为橡皮操作主要依赖平移运动,几乎不需要手内旋转,且橡皮本身有一定质量和体积,位姿跟踪相对稳定。

马克笔的表现次之(平均约 73-90%)。有趣的是,较粗的 Sharpie(80%, 77.6%)反而略逊于较细的 Staples(90.6%, 66.2%)。这似乎违反直觉,因为细物体更难抓握。但论文中的失败分析指出,马克笔的主要失败来源不是抓取,而是位姿跟踪丢失:细圆柱体在视觉上缺乏特征,且容易因手指遮挡导致 FoundationPose 失跟。较粗的 Sharpie 虽然抓握更稳,但其较大的体积在演示轨迹中更容易与机器人手臂发生碰撞,导致轨迹执行困难。

锤子类任务整体表现良好(Claw 平均 97.8%, Mallet 平均 81%)。Claw Hammer 比 Mallet Hammer 表现更好,后者质量更大(331g vs 36g),在挥动过程中惯性力更大,策略需要更强的握持力来维持稳定。这印证了一个直观的物理直觉:策略对重物体的泛化能力受限于训练时见过的质量分布范围

刷子类任务的表现出现了显著的两极分化:Blue Brush 的 Sweep Forward 仅 51.1%,而 Sweep Right 达到 100%;Red Brush 的 Sweep Forward 82.7%,Sweep Right 61.4%。作者分析发现,Blue Brush 的刷毛与手柄同向,向前清扫时刷毛接触地面产生较大阻力,而侧向清扫时阻力较小;Red Brush 的刷毛与手柄垂直,因此向前清扫更容易(刷毛自然接触地面),侧向清扫则需要额外调整姿态。这说明工具几何与任务方向的匹配度对性能有决定性影响。

锅铲类任务中,Spoon Spatula 表现不错(平均 90.3%),但 Flat Spatula 的 Flip Over 仅 46.1%。翻转动作需要将锅铲从"铲面朝下"旋转180°到"铲面朝上",这要求手指在狭小空间内完成大角度旋转,对薄而扁平的物体尤其困难。Flat Spatula 的薄柄(约1cm厚)使得手指的接触面积很小,旋转时容易滑脱。

螺丝刀是整个 benchmark 中最具挑战性的类别。Long Screwdriver 的 Spin Vertical 仅 55.8%,Spin Horizontal 61.7%;Short Screwdriver 的 Spin Vertical 低至 37.9%,Spin Horizontal 75.6%。螺丝刀任务要求策略同时完成两件事:将细长的刀杆从水平姿态重定向到垂直(或保持水平),然后持续绕长轴旋转。细长的几何形状使得位姿跟踪极易丢失(手指遮挡严重),而持续旋转要求策略维持稳定的扭矩输出,这在真实硬件上尤其困难。

6.2 失败模式分析

作者对失败案例进行了系统分类:

  • 位姿跟踪丢失:占所有失败的 43.7%。FoundationPose 在三种条件下容易失效:重度遮挡(如小螺丝刀被手指完全遮挡)、旋转对称性引起的视觉歧义(如圆柱形马克笔绕轴旋转时外观不变)、低对比度(如黑色刷毛在黑色桌面上)。
  • 物体掉落:占 34.5%。主要发生在重物体(如 331g 的 Mallet Hammer、325g 的 Blue Brush)的重定向或环境接触过程中。策略虽然学会了基本的握持,但在应对突发惯性力或外力时仍不够稳定。
  • 未完成旋转:占 18.2%。策略反复尝试旋转薄物体(如 Flat Spatula),但手指接触面积不足导致旋转动作失败。
  • 抓取失败:仅占 3.6%。这说明策略在基本抓取能力上已经相当鲁棒,失败主要来自后续的操作阶段。

一个有趣的观察是策略的恢复行为:当物体掉落时,如果位姿跟踪仍然有效,策略会主动尝试重新抓取物体。这种涌现行为并非显式编程,而是训练过程中"掉落 → episode终止 → 奖励归零"的自然结果——策略学会了尽量避免掉落,也在掉落发生后尽可能恢复。

6.3 与基线方法的对比

SimToolReal 与两类基线进行了对比:

运动学重定向(Kinematic Retargeting):从人类视频中提取手部关键点,通过逆运动学(IK)求解机器人关节轨迹。这种方法完全忽略了接触动力学和力交互,仅仅复制了人类手部的运动学轨迹。在刷子清扫任务中,重定向基线甚至无法完成基本的抓取——因为人类手指的柔性变形和接触模式无法直接映射到刚性机械手指。

固定抓取(Fixed Grasp):先用 SimToolReal 的策略抓起物体,然后固定手指关节位置,仅通过机械臂运动来跟踪轨迹。在不需要手内旋转的简单变体中(如刷子已经处于清扫姿态),固定抓取可以完成任务,但性能低于 SimToolReal(因为它是开环的,无法修正误差)。在需要手内旋转的变体中(如刷子侧放需要旋转90°),固定抓取完全失败——机械臂的运动学工作空间不足以在不碰撞桌面的情况下完成工具的旋转。

定量对比显示,SimToolReal 比运动学重定向和固定抓取基线的平均 Task Progress 高出 37%

6.4 与专家策略的对比

作者还训练了 6 个"专家策略"(specialist policies),每个只针对一个工具类别、一个物体实例、一条轨迹进行训练。对比结果令人意外:SimToolReal 的通用策略在专家策略的训练设置(相同物体、相同轨迹)上达到了与专家策略相当的性能。但当测试条件偏离训练设置时(换轨迹或换物体),专家策略的性能急剧下降,而 SimToolReal 保持稳定。

这个结果有力地证明了 SimToolReal 的泛化没有以牺牲性能为代价。在机器学习领域,通用性和性能之间的权衡(bias-variance tradeoff)是一个常见的顾虑,但这篇论文的结果表明,在灵巧操作领域,通过正确的问题重述(从"任务专用"到"位姿到达通用"),可以兼得两者。

七、消融实验:训练设计决策的重要性

除了 SAPG 和非对称 Critic 的消融之外,作者还进行了另一组关键实验:验证训练目标(随机目标位姿到达)与测试目标(人类演示轨迹跟踪)之间的相关性。

在训练过程中,他们定期在仿真中评估两个指标:

  1. 训练奖励(在程序化原语上到达随机目标位姿的表现)
  2. 零样本 Task Progress(在未见过的 DexToolBench 工具上跟踪人类轨迹的表现)

结果显示,两条曲线高度正相关:随着训练奖励的提升,测试任务上的表现也稳步提升。这一发现具有重要的方法论意义:它表明随机目标位姿到达确实是一个有效的代理任务(proxy task),优化这个通用目标能够可靠地提升下游工具操作能力。换句话说,论文中的"核心洞察"不仅是一种哲学层面的重述,更是在统计学上得到了验证的有效策略。

八、讨论与局限性

SimToolReal 的局限性在论文中被坦诚地列出,这些局限性也为后续研究指明了方向:

功能完成度不保证。 Task Progress 衡量的是轨迹跟踪精度,而非任务的实际功能完成度。例如,锤子 “跟踪了轨迹” 不等于 “成功敲入了钉子”,因为后者还取决于敲击速度、力度和角度。这种评估方式简化了实验设计,但也意味着策略在力敏感型任务上的实际表现仍有不确定性。

环境盲性。 策略只接收工具位姿和目标位姿,对环境几何(如桌面位置、障碍物位置)完全没有感知。在杂乱场景中,策略可能在追逐目标位姿的过程中与环境中未建模的物体发生碰撞。

刚性工具假设。 当前的物体表示假设工具是刚体,无法处理柔性或可变形工具(如剪刀、软管)。对于非刚性物体,单一的6D位姿不足以描述其状态。

静态轨迹。 目标位姿序列在执行前就被完全确定,不会根据执行过程中的实际状态进行动态调整。例如,如果策略发现当前握持不稳,它无法请求一个"中间调整姿态",只能继续追逐下一个预设目标。

工具注册开销。 每次遇到新工具时,需要手动进行第一帧分割提示和3D网格重建,这个过程虽然比训练一个新策略快得多,但仍需要人工介入。未来可以考虑自动化这一流程,例如通过类别级别的先验模型来初始化分割和网格重建。

九、设计哲学与应用场景映射

从技术博客的视角来看,SimToolReal 的设计蕴含着几条值得其他机器人项目借鉴的哲学原则:

问题重述优先于算法改进。 这不是一篇"提出了新损失函数"或"改进了网络架构"的论文,而是一篇"换了个角度看问题"的论文。很多时候,难题之所以难,是因为我们问错了问题。SimToolReal 通过将"如何学会用锤子"重新表述为"如何将物体送到目标位姿",把一个需要大量任务特定数据和奖励工程的问题,转变为一个可以通过程序化生成和通用目标解决的标准强化学习任务。

解耦优先于端到端。 论文的策略、感知管道、轨迹生成三个模块是完全解耦的。这种解耦牺牲了一定的端到端优化潜力(三个模块分别优化,可能存在次优的组合),但换来了每个模块的独立可替换性和可维护性。例如,如果未来出现更好的位姿估计算法,可以直接替换 FoundationPose 而无需重新训练策略。

面向失败的设计。 从奖励函数中的"状态记忆"(防止蹭奖励)、到域随机化中的"针对性扰动"(而非均匀扰动)、到手指自碰撞限制(保护硬件),SimToolReal 的每一个设计细节都透露出对真实部署失败模式的深刻理解。好的机器人系统不是设计来"正常工作"的,而是设计来"优雅地处理各种异常"的。

在应用场景上,SimToolReal 的零样本工具操作能力使其特别适合以下场景:

  • 工业装配线的小批量定制:当产线需要处理多种不同规格的零件时,传统方法需要为每种零件编程。SimToolReal 的范式下,只需要给出一个新的装配视频,机器人就能自动学会操作新零件。
  • 家庭服务机器人的日常辅助:家用工具(扫帚、锅铲、螺丝刀等)种类繁多,为每种工具训练专用策略不现实。SimToolReal 提供的通用底层技能可以大幅降低家庭场景下的策略部署成本。
  • 医疗辅助操作:手术器械的操作轨迹可以从专家演示视频中提取,SimToolReal 的策略负责将器械送达指定位置和姿态,而具体的力控制可以交给专门的力伺服模块。
  • 遥操作的自动化:在遥操作中,操作者只需给出高层次的轨迹意图(通过视频示范),SimToolReal 负责处理低层次的接触动力学和握持稳定性,减轻操作者负担。

十、结语

SimToolReal 为灵巧工具操作领域提供了一个令人耳目一新的视角:与其教机器人"学会用每种工具",不如教它"学会将任何东西送到目标位姿"。这个看似简单的问题重述,实际上触及了机器人学习中一个更深层的问题——通用性究竟应该编码在策略中,还是编码在任务表示中?

SimToolReal 的回答是:策略负责通用技能(抓取、重定向、稳定控制),任务表示负责特定意图(目标位姿序列)。这种分工让策略可以专注于底层物理交互的学习,而不被上层任务的语义复杂性所干扰。在 120 次真实世界 rollout 中,这个框架展现了令人信服的零样本泛化能力,也为未来"通用机器人技能 + 任务特定表示"的范式提供了一个坚实的实证基础。

当然,从实验室到实际应用之间仍有距离。位姿跟踪的脆弱性、对刚性工具的假设、以及静态轨迹的限制,都是需要在后续工作中逐一攻克的障碍。但正如作者所言,SimToolReal 是"朝着通用的 sim-to-real RL 工具操作策略迈出的一步"——它不是终点,而是一个起点,一个证明"问题重述的力量"的起点。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐