当前机器人领域最难的问题之一:AI 能不能直接从视觉生成灵巧手动作?

答案:

可以,AI模型正在解决这个问题,但目前还没有完全替代传统方法。现在工业和科研中通常采用“AI生成 + 优化约束 + 控制反馈”的混合方案。

这个方向现在已经有很多论文和开源研究在做,但“任意机器人手、任意物体、一次成功”的通用模型目前还没有完全解决。

核心思想:

输入:

物体模型
+
手模型

输出:

q_hand
=
[
拇指关节角,
食指关节角,
中指关节角,
...
]

本质就是:

从物体 → 手的动作

也就是:

我要抓这个杯子

↓

手应该变成什么姿态?

以上就是Dexterous Grasp Generation(灵巧抓取生成)

现在工业上为什么还没有普及?

因为这个问题非常难。

原因:

(1) 自由度太高

普通夹爪:

2 DOF

灵巧手:

16~30 DOF

搜索空间巨大。


(2) 接触非常复杂

两个手指:

碰一下
夹住

还行。

五指:

20个接触点
+
摩擦
+
力矩
+
滑动

复杂很多。


(3) 物体无限多

杯子:

10000种形状

工具:

10000种

不能全部人工标注。

这里目前问题是建不建议去研究AI直接生成灵巧手关节角度?

(1)如果是科研的角度,答案是很有必要,非常有价值

它本质是:

输入:

物体:

point cloud / mesh


↓

AI模型


↓

输出:

q_hand

[
拇指角度,
食指角度,
中指角度,
...
]

这个方向目前属于:

      Dexterous Grasp Generation

      Embodied AI

      Robot Manipulation

是非常热门的方向。

(2)如果站在一位机械人研发工程师的角度来想,不建议

问题一:没有唯一答案,纯在太多解了,抓一个物体可能有成千上百种抓取办法

问题二:输出空间太大了,太复杂,灵巧手的自由度太多了

问题三:资源太少,必须经过大量的灵巧手测试后才可以得出结论,本身一个灵巧手价值昂贵

目前我的想法是如下:

AI + 优化 + 控制 的混合方案。

AI生成 + 优化

也就是:

RGB-D

↓

点云

↓

物体模型

↓

AI Grasp Generator

↓

初始q_hand

↓

Grasp Optimization

↓

最终q_hand

↓

MoveIt

↓

控制

当然这里可以直接上强化学习

其实你拆开AI的本质来看,我认为简单的AI生成抓取规划就是监督学习

但是实际生成中并没有标签,所以监督学习这里会提供好多候选 ,经过评分得到一个分值最高的答案,经过优化器处理后,得到就是目前我所应用的方案

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐