机器人抓取,学会 “不赌猜测”
Kinova Gen3是科研圈非常普及的7自由度轻型协作机械臂,凭借902mm工作半径、全关节扭矩传感、原生支持ROS/MoveIt!、末端可快速搭载深度相机与Robotiq 2F‑85两指夹爪,成为家庭场景物体抓取、具身智能算法验证的标杆硬件平台。
但很多使用Gen3做抓取开发的开发者都会遇到同一个痛点:单视角拍摄桌面物体,物体背面被遮挡,深度相机拿不到完整三维信息。

相机只能采集朝向自己一侧的点云数据,物体背光、被遮挡的部分完全空白。如果直接拿残缺的局部点云下发给Kinova Gen3做抓取规划,很容易出现夹爪碰撞物体、夹空、运动规划无解;如果采用形状补全AI网络,由模型“脑补”被遮挡部分的几何,又会带来新风险:AI的重建结果不一定等于真实物体。算法自信输出一个抓取姿态,Kinova Gen3严格按照轨迹执行,到现场才发现模型脑补的外形和实物不一致,直接抓取失败。
硬件性能再好,也弥补不上视觉感知环节的预判偏差。葡萄牙、意大利的研究团队,就以Kinova Gen3 + Robotiq 2F‑85 + Intel RealSense D430这套标准科研配置作为完整测试平台,针对3DSGrasp形状补全抓取管线做了一次关键升级,全部实验数据都来自机械臂真机执行,而非仿真模拟。论文《Measuring Uncertainty in Shape Completion to Improve Grasp Quality》,解决的就是“机械臂盲目信任AI脑补形状”的现实工程难题。

Kinova Gen3拥有7个自由度,关节支持无限旋转,在桌面场景下能够实现非常丰富的夹爪姿态,理论上可以实现侧面、斜向等多种非俯视抓取,适配大量家居杂物的拾取任务。论文的实验配置完全复刻科研人员日常开发环境:机械臂固定在桌边,夹爪末端挂载RealSense D430深度相机,物体随机摆放在桌面任意位置,机器人每次都从同一个斜向初始位姿启动拍摄,模拟现实家庭环境里机器人的观测视角,不是理想的俯视视角。
原始3DSGrasp方案工作流程是:相机拍摄得到局部点云,网络补全物体被遮挡的完整外形,输出完整点云,送入GPD/PointNetGPD生成候选抓取位姿,把排名靠前的抓取位姿下发给Kinova Gen3,由MoveIt!完成运动规划,控制Robotiq 2F‑85夹爪完成拾取,抬举保持一段时间才算抓取成功。
这套流程已经比直接用局部点云抓取效果更好,但存在致命逻辑漏洞:3DSGrasp输出的完整点云,分不清哪些是相机真实观测、哪些是AI预测生成。物体远离相机的背面,属于完全遮挡区域,模型的猜测成分最高,重建误差最大;但抓取算法会一视同仁,如果最优抓取点刚好落在猜测区域,就会输出一个几何上看起来没问题,但现实会失败的抓取姿态。
此时Kinova Gen3机械臂硬件本身没有任何故障:运动规划可以解算出轨迹,关节执行到位,夹爪正常闭合。失败根源来自上层视觉算法对预测结果过度自信。

研究团队的改进思路很清晰:不更换Kinova硬件,不推翻3DSGrasp网络主体,也不改写GPD抓取检测算法;只新增不确定性评估模块,量化每一个三维点的预测置信度,把风险纳入抓取打分,压低高猜测区域抓取姿态的优先级,让Kinova Gen3优先去执行建立在可靠观测数据之上的抓取。
蒙特卡洛Dropout,给每一个三维点标注置信水平
团队采用蒙特卡洛Dropout实现形状补全网络的不确定性估计。推理阶段不关闭Dropout层,同一帧来自RealSense的局部点云,网络重复运行60次前向推理。
多次推理输出点位置取平均值,作为最终补全物体点云;多次预测之间的标准差代表不确定性。论文真机实验中点云标准差处于2‑6mm区间:蓝色代表低不确定性(相机直接观测的物体正面),红黄色代表高不确定性(AI脑补的遮挡背面)。
得到逐点不确定性之后,算法对GPD/PointNetGPD输出的15个候选抓取姿态做后处理修正:
-
对每一个候选夹爪位姿,计算Robotiq 2F‑85夹爪闭合时的接触包围盒,裁剪夹爪覆盖范围内的点云与对应不确定性;
-
抓取分数修正公式:$\boldsymbol{S'=S-W_{u}\sum\sigma_{u}}$,原始抓取分数减去夹爪覆盖区域不确定性加权和。GPD权重$W_u=105$;PointNetGPD权重$W_u=0.1$;
-
使用修正后的分数重排序抓取,取Top‑5下发给Kinova Gen3执行。
如果抓取位姿落在AI高度猜测的背面,扣分变多,排名下沉;如果抓取接触区域集中在相机可见的物体侧面,扣分很小,保留高排名。

这个改进恰好解决Kinova Gen3真机上的一类高频问题:原版3DSGrasp经常输出几何可行,但机械臂很难抵达的远端抓取姿态,大多分布在物体背对机器人一侧;高不确定性区域会被自动扣分降权,算法更多推荐朝向机械臂一侧的抓取,间接提升运动规划成功率,减少MoveIt!规划失败。
Kinova Gen3真机实测,全部数据来自论文Table‑I
整套测试硬件固定为Kinova Gen3七自由度臂 + Robotiq 2F‑85两指夹爪 + Intel RealSense D430深度相机,运动规划统一使用MoveIt!,所有对比基线硬件环境完全一致,排除硬件差异干扰。
测试集合选用YCB数据集10种常见家居物体,每件物体10次试验,每次试验依次执行Top‑5抓取姿态;每种方法500次抓取尝试,全部实验合计3000次真机抓取,所有成功率均为机械臂真实执行统计,不是仿真数据。
-
GPD(只用局部点云):35%
-
GPD + 3DSGrasp:51%
-
GPD +3DSGrasp+不确定性(本文方案):58%
-
PointNetGPD(只用局部点云):18%
-
PointNetGPD +3DSGrasp:32%
-
PointNetGPD +3DSGrasp+不确定性(本文方案):49%
对比原版3DSGrasp基线,GPD后端提升7个百分点;PointNetGPD后端提升17个百分点。 论文同时记录,Mustard、Jell‑o两件物体,改进方案没有实现性能提升,作者归因于不确定性权重的调参平衡问题。整套管线耗时:形状补全+不确定性估计约4秒,分数修正额外消耗2秒,对于Kinova Gen3桌面抓取任务时延可以接受。

消融对比也和其他不确定性形状补全方案横向对照,rank‑1抓取指标同样具备竞争力。
硬件层面Kinova Gen3本身没有改动,全部增益来自感知‑决策层的算法优化。这也给所有使用Gen3做抓取开发的团队一个启示:机械臂硬件运动精度再高,也不能无条件信任AI三维重建输出。仿真中表现完美的抓取算法,部署到真机上经常跳水,很大一部分原因,就是没有考虑模型预测的不确定性。

Kinova Gen3在全球高校与实验室被大量用于具身智能、物体抓取研究,很多开发者习惯在仿真调优算法,再直接迁移真机。仿真环境里面物体几何100%准确,不存在“脑补出错”,算法效果很漂亮;但真机环境,深度相机噪声、遮挡、物体未知外形全部真实存在。
本次研究给出一套低成本落地范式:不需要大改网络,不需要更换Kinova整套硬件,在现有3DSGrasp管线基础上,通过蒙特卡洛采样拿到重建不确定性,作为惩罚项修正抓取排序,就可以带来真机上实实在在的成功率提升。

当然方案依旧存在局限:60次前向推理带来不小计算开销,未来可以研究单次前向输出不确定性,进一步降低延时,适配高速抓取场景;当前不确定性只是抓取结果的后过滤,未来可以直接嵌入抓取生成网络;本次实验局限桌面两指夹爪,还可以拓展到杂乱堆叠、灵巧手任务。
Kinova Gen3机械臂可以完成流畅、精准的运动轨迹,但“判断哪里值得抓”这件事,要交给视觉算法。
基于Gen3真机验证的研究告诉我们一个朴素道理:机器人抓取的成败,从来不是只看机械臂硬件参数。AI给出的物体形状预测,不仅要看结果,更要看预测的置信度。机械臂不应该无脑执行AI的每一个猜测,学会规避高风险抓取,才是从仿真走向真实物理世界的关键一步。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)