成功率不到 70%,Kinova双臂做遮挡抓取究竟差在哪?
COMBO‑Grasp 是牛津大学团队提出的面向双臂遮挡抓取的机器人学习框架,针对机器人操作中普遍存在的遮挡抓取难题开展研究。遮挡抓取指物体受桌面等环境约束,标准抓取位姿发生碰撞,机械臂无法直接完成抓取的场景。人类处理这类任务时会采用双手协同策略,一只手固定稳定物体,另一只手调整物体姿态再完成抓取,而传统机器人技术很难复刻这种协作行为。

传统强化学习方法面对双臂任务时动作空间维度高,样本消耗巨大,很难收敛得到稳定策略;示教学习则需要大量人工专家演示数据,采集成本很高。该研究构建两套相互配合的策略,约束策略通过自监督数据集生成物体稳定支撑位姿,抓取策略依靠强化学习完成物体姿态调整与抓取。论文核心创新是价值函数引导的策略协同机制,在抓取策略强化学习训练过程中,利用价值函数梯度修正约束策略输出的支撑位姿,提升双臂之间的配合效果。同时采用师生策略蒸馏,把仿真环境训练得到的教师模型迁移到以点云作为输入的学生模型,实现仿真到真实物理世界的算法落地。
仿真与真机实验结果表明,该方法相比纯 PPO、增加约束奖励的 PPO、固定约束位姿等基线方案,在样本效率与抓取成功率上都具备明显优势。在真实 Kinova 机械臂平台上,对见过和未见过的物体都可以实现抓取,整体平均成功率可以达到 68.3%。研究也指出该方案存在局限性,面对球形圆形物体,物体容易发生滑动,稳定支撑难度大,抓取成功率会明显下降,同时对几何形态差异过大的未知物体泛化能力有限,后续可以引入闭环残差策略,在线实时调整约束位姿来优化性能。Kinova Gen3 双臂平台下遮挡抓取技术的实现与思考。

在机器人操作研究领域,双臂协同操作一直是极具挑战性的方向。单臂机器人只能完成简单直接的拾取任务,当物体被桌面遮挡,标准抓取点无法到达时,单臂机器人很难处理。双臂机器人可以模拟人类双手分工,一只手完成物体固定,另一只手执行推移、翻转等非预抓取操作,开辟出可行的抓取空间,这也是 COMBO‑Grasp 研究选择双臂硬件方案的出发点。在众多科研级协作机械臂产品中,Kinova Gen3 凭借硬件特性、开放软件生态,成为该论文实物实验的核心载体,也成为很多双臂机器人研究的主流硬件选择。
COMBO‑Grasp 实物实验平台采用两台 Kinova Gen3 机械臂组成双臂系统,两台机械臂垂直安装在同一个机体基座上,分别承担不同功能角色。右臂作为约束臂,负责运动到预测的支撑位姿,对物体施加侧向支撑,限制物体发生大幅度滑动;左臂作为操作臂,执行推移、抬升、抓取整套动作。末端执行器选用 Robotiq 2F‑85 二指夹爪,研究团队更换了柔性指尖,提升接触物体时摩擦力,增强物体夹持和支撑过程中的稳定性。外部搭配 RealSense L515 深度相机,采集环境点云信息,作为视觉输入给到学生策略模型。控制层面采用任务空间与关节空间混合阻抗控制器,实现柔顺接触,避免机械臂和物体发生刚性撞击造成损坏,保证支撑和推移过程的安全性。

Kinova Gen3 能够适配这类复杂双臂操作任务,来源于硬件层面多项特质。首先该机械臂具备冗余自由度,运动空间灵活,在桌面狭小工作空间内,可以同时完成侧向抵靠支撑、近距离推移抓取两类动作,同时规避自身以及环境碰撞,不会出现运动奇异锁死的情况。整机轻量化设计,不需要大型安全防护围栏,实验室桌面就可以搭建整套双臂实验平台,降低科研部署门槛。关节内置扭矩传感,原生支持阻抗和柔顺控制,这对于 COMBO‑Grasp 任务至关重要。约束臂接触物体的时候不能是刚性硬接触,柔顺特性可以缓冲接触冲击,防止把目标物体直接推飞,还原人类用手轻轻抵住物体的操作逻辑,保障非预抓取操作安全开展。
软件生态是 Kinova Gen3 另一个突出优势,也是算法能够从仿真迁移到真机的重要基础。该机械臂提供 Kortex 开放 API,支持 Python C++ 开发,完整适配 ROS 与 MoveIt 工具链。在 COMBO‑Grasp 工作流程中,算法模型输出约束臂六维目标位姿,通过逆运动学求解得到关节角度,借助 MoveIt 完成运动规划,控制右臂移动到支撑位置。当约束臂就位之后,抓取策略输出连续末端位姿增量,控制左臂完成后续操作。整套算法开发过程中,研究人员不需要投入大量精力开发底层运动控制,只需要聚焦高层策略模型的设计,把模型输出的位姿指令下发给机器人控制系统,极大缩短算法迭代周期。仿真环境 Isaac Sim 同样提供 Kinova Gen3 的机器人模型,仿真环境与真实硬件的模型参数可以对齐,方便开展大量仿真预训练,之后再做师生蒸馏迁移到真实机器人上,实现仿真到现实的闭环开发流程。

COMBO‑Grasp 整套任务执行流程可以分为四个阶段。
第一阶段约束臂运动到模型预测得到的支撑位姿,抵靠在目标物体侧面;
第二阶段操作臂接触物体,借助约束臂提供的侧向支撑,推移抬升物体,改变物体姿态,把原本被桌面遮挡的抓取位姿暴露出来;
第三阶段约束臂回到初始位置,解除对物体的支撑;
第四阶段操作臂完成抓取并且向上抬起物体,判定任务完成。在这套流程中,两台 Kinova 机械臂需要严格时序协同,约束臂没有到位,操作臂不能开始推移动作;操作臂执行抓取动作之后,约束臂才能够复位。
Kinova 的控制系统可以实现双臂时序同步,保障多步骤操作有序执行,这是多步骤机器人操作任务落地的基础条件。

从实验结果可以看到硬件与算法之间的相互影响。真机实验数据显示,当输入包含目标抓取位姿信息时,整套系统平均成功率 68.3%;如果不输入抓取位姿,仅依靠点云观测,平均成功率下降到 58.3%。部分物体表现差异十分明显,键盘这类薄型物体,缺少抓取位姿输入时成功率直接下降到 40%,而圆形物体因为极易滑动,无论是否输入抓取位姿,整体成功率都处于较低水平。这些结果一方面反映算法本身还有优化空间,另一方面也体现硬件平台的物理约束。哪怕机械臂运动精度足够,现实世界摩擦、物体形状带来的不确定性,依然会造成仿真和真机之间的性能差距。柔性夹爪指尖可以改善接触效果,但无法完全消除圆形物体滑动的物理问题。这也说明机器人学习算法不能脱离硬件物理特性单独设计,算法研发必须充分考虑真实硬件的局限性。

该研究也暴露出基于 Kinova 双臂开展遮挡抓取任务的现实瓶颈。第一,整套系统角色固定,右臂固定做约束臂,左臂固定做操作臂,不能动态切换两个手臂功能,未来需要进一步研究动态角色分配策略。第二,目前约束位姿只在任务开始阶段生成一次,任务执行过程中不会动态调整。现实操作中物体发生微小位移之后,原本的支撑位姿可能失效,就会造成任务失败。论文提出可以引入残差修正策略,在任务运行过程中实时更新约束臂目标位姿,这就对机械臂控制提出更高要求,需要控制器可以高频接收更新位姿指令,Kinova Gen3 的千赫兹级底层控制接口具备实现该方案的硬件基础,但是需要算法层面进一步开发验证。第三,视觉感知链路存在误差,真实环境点云存在噪声,物体分割、位姿估计的误差会向下传递,直接影响策略模型输出,最终降低抓取成功率。
站在科研应用的角度来看,Kinova Gen3 双臂平台配合 COMBO‑Grasp 这类学习型操作算法,拓展了桌面机器人的能力边界。传统机器人大多只能处理可以直接抓取的物体,而这套技术可以处理大量日常生活中被桌面遮挡的物品,键盘、盒子、包装袋等都可以完成操作,对于服务机器人、家庭机器人领域有参考价值。同时这套研究范式也给同类项目提供参考,使用仿真环境大规模采集数据训练策略,再通过师生蒸馏把模型迁移到真实机器人硬件,降低真实机器人上强化学习训练对实物样本的消耗,缓解真机采集数据成本高、损坏风险大的痛点。

距离真正落地到消费级服务机器人还有很长距离。COMBO‑Grasp 当前实验环境是结构化桌面场景,物体初始位置大致可控,现实家庭环境场景更加复杂,物体堆叠、多种障碍物共存都会带来新挑战。同时整套系统依赖外部深度相机,需要完成物体分割、点云预处理,整套感知链路计算开销较大。未来一方面要继续优化算法,提升对未知物体、复杂场景泛化能力;另一方面也要充分挖掘 Kinova 硬件平台能力,例如利用关节内置力传感信息,把力反馈信号加入策略输入,结合视觉信息共同判断物体状态,进一步提升双臂协同操作的鲁棒性。
综合来看,COMBO‑Grasp 的研究充分发挥 Kinova Gen3 双臂平台的硬件优势,实现了遮挡场景下双臂协同抓取,验证了双策略配合、价值函数引导协同、仿真到现实蒸馏整套技术路线的可行性。该工作既体现出学习驱动机器人操作的巨大潜力,也清晰展现出算法与硬件相互制约、相互成就的关系。后续的相关研究可以以此为基础,进一步解决动态约束调整、角色动态分配、复杂环境泛化等问题,持续推动双臂机器人非预抓取操作技术向前发展。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)