机器人抓取通常不存在唯一正确答案。同一个物体可以从不同方向、不同位置和不同夹爪姿态进行抓取,因此模型需要学习的是一个多峰抓取分布,而不是单一位姿。扩散模型与流匹配模型能够生成多样化的六自由度抓取姿态,但通常需要数十甚至上百次迭代,难以满足动态场景中的闭环重规划需求。

普渡大学提出快速生成式抓取方法 GraspMF ,将MeanFlow建立在乘积李群 SO(3)×R³ 上,直接对夹爪旋转和平移组成的抓取位姿进行建模。传统流匹配需要沿连续速度场逐步积分,GraspMF则预测一段时间区间内的平均速度,用一次或少数几次“弦式更新”把初始随机位姿直接推向有效抓取分布。在ACRONYM数据集上,GraspMF仅使用 5次 网络评估便取得 87.40% 的域内抓取成功率和 71.73% 的域外成功率,生成每个物体的100个抓取姿态只需 15.5毫秒 。单步版本只需 6.3毫秒 ,仍达到 81.11% 和 66.34% 的域内、域外成功率。与需要140次网络评估的SE3Dif相比,5步GraspMF获得约 39倍 加速,同时保持更高的抓取成功率。

图 1:Flow Matching与MeanFlow抓取姿态生成过程对比。

核心逻辑:

从李群上的随机抓取位姿采样 ➔ 使用点云编码物体几何信息 ➔ 直接预测目标抓取端点 ➔ 计算时间区间内的平均速度 ➔ 使用半群一致性约束不同时间区间的预测 ➔ 使用流匹配目标连接真实抓取分布 ➔ 在SO(3)×R³上执行一步或少步更新 ➔ 快速生成多样化六自由度抓取姿态 ➔ 结合碰撞检测和运动规划完成真实抓取

具体流程与核心设计

扩散与传统流匹配方法会把随机位姿沿学习到的速度场逐步移动至真实抓取分布。较多迭代有助于模型逐渐满足夹爪与物体之间的隐式接触约束,但也带来较高推理延迟;如果直接减少迭代次数,大步长产生的截断误差可能让抓取姿态偏离有效接触流形。MeanFlow不再只预测某个时刻的瞬时速度,而是预测整个时间区间上的平均速度,从而以较少更新近似完成原本需要多步积分的传输过程。

抓取姿态包含旋转和平移,不能简单视为普通欧氏向量。GraspMF将其定义在乘积李群 G=SO(3)×R³ 上,使用李群指数映射、对数映射和测地线处理旋转变化。网络直接预测干净抓取端点,再由端点闭式计算平均速度和流映射。输出中的9维原始旋转矩阵通过奇异值分解投影到合法SO(3)旋转,另外3维表示夹爪平移。

图 2:Flow Matching与MeanFlow在SO(3)旋转群上的生成效果。

训练目标包含流匹配锚点与半群一致性约束。流匹配锚点把平均速度连接到真实抓取数据,避免模型只满足内部一致性却偏离目标分布;半群一致性则要求从起点直接移动到终点,与先移动到中间时刻、再从中间时刻移动到终点得到相同结果。该约束完全通过前向计算、指数映射和对数映射实现,不需要教师模型、轨迹模拟或高成本协变导数。模型还加入辅助有符号距离回归任务,让共享特征编码器理解物体表面几何。训练初期以数据锚点为主,随后逐渐提高半群一致性损失权重,使模型先学习抓取分布,再强化不同采样步数之间的一致性。这种设计使同一个模型能够在单步、5步乃至更多采样预算下稳定工作。

实验表现

实验使用ACRONYM中的Book、Bottle、Bowl、Cap、CellPhone、Cup、Hammer、Mug、Scissors和Shampoo十类物体,共包含 416个 物体实例和约 78万个 有效抓取姿态。每类物体的90%实例用于训练,剩余10%用于域内测试;Car、Donut、Laptop、Pencil、RubiksCube和Spoon六类完全不同的物体用于域外测试。每个物体生成100个抓取姿态,并在Isaac Gym中依次执行张开夹爪、接近、闭合、抬升和5秒晃动,物体仍留在夹爪中才被判定为成功。

5步GraspMF的域内与域外成功率分别达到 87.40% 和 71.73% ,均为主要对比方法中的最高结果。EGF达到 85.48% 和 65.09% ,VSIGD达到 68.57% 和 69.05% ,SE3Dif则为 70.40% 和 57.60% 。单步GraspMF仍取得 81.11% 的域内成功率和 66.34% 的域外成功率,说明模型只进行一次网络计算时依然能够覆盖多种有效抓取模式。

表 1:GraspMF与生成式抓取方法在ACRONYM上的性能比较。

图 3:不同方法在笔记本电脑、铅笔和汽车模型上的抓取姿态。

速度方面,GraspMF生成每个物体的100个抓取姿态时,5步推理延迟只有 15.5毫秒 ,单步延迟只有 6.3毫秒 。SE3Dif需要140次网络评估和 600.1毫秒 ,BRIDGER需要40次评估和 120.6毫秒 ,EGF需要80次评估和 187.9毫秒 ,VSIGD需要140次评估和 1124.4毫秒 。GraspMF因此能够在相同时间内生成更多候选姿态,为拒绝采样、碰撞过滤和闭环重规划留下计算空间。

表 2:不同抓取生成方法的网络评估次数与推理延迟。

研究还将采样步数从1扩展至100。GraspMF在不同预算下的域外成功率平均为 70.15% ,标准差仅为 1.63 ,说明减少采样步骤不会引起明显性能崩溃。相比之下,SE3Dif在1步和5步时的成功率分别下降至 6.65% 和 18.58% ,VSIGD分别只有 7.04% 和 20.86% ,EGF单步成功率也降至 27.48% 。

图 4:不同采样步数下的成功率、分布覆盖率与推理延迟。

消融实验进一步验证各模块的作用。移除辅助有符号距离回归后,域内和域外成功率分别下降 3.8个百分点 和 5.1个百分点 ;取消半群损失的渐进权重调度后,分别下降 2.4个百分点 和 5.8个百分点 。使用Gram-Schmidt正交化替代SVD投影虽然把延迟从15.5毫秒降至13.5毫秒,但域外成功率下降 4.7个百分点 。影响最大的是将半群一致性目标替换为另一种分解式MeanFlow目标:域内成功率从 87.40% 降至 62.25% ,域外成功率从 71.73% 降至 52.29% 。这说明GraspMF能够在少步采样下保持接触可行性,关键并不只是使用MeanFlow,而是李群上的代数半群一致性约束。

在单视角不完整点云实验中,5步GraspMF取得 86.08% 的域内成功率和 68.46% 的域外成功率,其中域外结果仍为所有方法最高。BRIDGER的域内成功率略高,为 88.84% ,但其域外成功率为 65.38% ,推理延迟则达到 120.6毫秒 ,约为GraspMF的7.8倍。真实实验使用7自由度Franka Research 3机械臂、Franka Hand夹爪和腕部Orbbec Femto Mega RGB-D相机。系统先使用SAM分割场景点云,再由GraspMF生成抓取姿态,最后使用RRT-Connect规划无碰撞轨迹。整个过程没有进行额外训练或真实域适配。5步GraspMF在黑色杯子、红色杯子和灰色碗上的10次实验中分别成功 9次、9次和10次 ,总计 28/30 ;10步版本分别成功 9次、10次和10次 ,总计 29/30 。这表明模型在真实深度相机噪声和不完整观察条件下仍能生成稳定抓取姿态。

图 5:GraspMF在三种日常物体上的真实机器人抓取实验。

结论

GraspMF将MeanFlow扩展到SO(3)×R³乘积李群,通过端点预测、流匹配锚点和半群一致性约束,在保持六自由度抓取分布质量的同时,将传统生成模型所需的数十至上百次迭代减少到5次甚至1次。实验中,5步GraspMF以 15.5毫秒 生成100个候选抓取姿态,域内和域外成功率分别达到 87.40% 和 71.73% ;单步版本仅需 6.3毫秒 ,仍取得 81.11% 和 66.34% 。真实机器人实验则分别完成 28/30 和 29/30 次成功抓取,而且不需要额外训练或域适配。

不过,当前方法主要面向单机械臂夹爪抓取,真实实验只包含三种桌面物体,每种设置测试10次。单视角点云中的遮挡仍会导致物体中心偏移和抓取分布歧义。未来可以将这一框架扩展到双臂SE(3)×SE(3)协同操作、非抓取式接触流形和动态物体抓取,并利用毫秒级生成速度开展更高频率的闭环碰撞检测与在线重规划。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐