在机器人操作领域,准确感知环境是完成任务的关键。目前的机器人往往面临一个难题:要么依靠摄像头“看”环境,但在接近物体时会被自己的手挡住视线;要么依靠触觉传感器“摸”物体,但必须接触后才有感觉。现有的技术很难让机器人同时具备这两种能力,通常需要在“看”和“摸”之间来回切换,或者因为背景干扰导致触觉感知失灵。

为了解决这个问题,本论文提出了一个名为 TacThru 的新型传感器和一个名为 TacThru-UMI 的学习框架。这个框架通过一种全透明的“皮肤”和特殊的标记点设计,让机器人手指既能像眼睛一样看清物体,又能像皮肤一样敏锐地感知接触。

实验证明,这种“视触融合”的能力让机器人在处理像抽纸这样柔软轻薄的物体,或是在需要极高精度的螺丝分类任务中,成功率大幅提升,总平均成功率达到了85.5%。

一、论文基本信息

  • 论文标题:Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
  • 作者姓名与单位:Yuyang Li, Yinghan Chen, Zihang Zhao 等;北京大学人工智能研究院、通用人工智能国家重点实验室、北京通用人工智能研究院(BIGAI)。
  • 论文链接arXiv:2512.09851v1

二、主要贡献与创新

  1. 全透明视触觉传感器 TacThru:设计了全透明弹性体配合持续照明,无需模式切换即可实现同时的视觉与触觉感知。
  2. Keyline Marker(轮廓线标记):提出了双色同心圆标记设计,解决了在复杂背景下传统实心标记无法被识别的难题。
  3. 高效鲁棒的标记追踪算法:结合卡尔曼滤波与数据关联,实现了在6.08毫秒/帧的速度下对标记点的精准追踪。
  4. TacThru-UMI 学习框架:基于通用操作接口(UMI)开发了模仿学习系统,将视触觉多模态信号融入Transformer扩散策略中。

三、研究方法与原理

该论文提出的核心思路是:通过设计一种全透明且带有特殊“空心”标记的弹性体指尖,配合内部摄像头,使机器人能够透过手指“皮肤”直接看到物体,同时通过追踪标记点的位移来感知接触力,最后利用扩散模型学习如何利用这些同步的视觉和触觉信息来控制机械臂。

【模型结构图】

1. TacThru 传感器设计

TacThru 传感器的关键在于实现“既能看又能摸”。

  • 透明弹性体与持续照明:放弃了传统视触觉传感器(如GelSight)使用的半透明或反光涂层,改用全透明材料,并使用持续的LED照明。这使得内部摄像头可以透过弹性体捕捉外部世界的清晰图像。
  • Keyline Markers(轮廓线标记):为了在透明背景下也能检测到触觉标记,作者设计了由黑色内圆( r i n ≈ 0.6 r_{in} \approx 0.6 rin0.6 mm)和白色外圆( r o u t ≈ 1.0 r_{out} \approx 1.0 rout1.0 mm)组成的同心圆标记。这种设计确保了无论背景颜色如何,标记的边缘(Keyline)始终可见。

2. 标记追踪算法(Marker Tracking)

由于环境背景复杂,简单的斑点检测会产生很多噪声。作者采用了 卡尔曼滤波(Kalman Filtering) 来对每个标记点的位置 x t ∈ R 2 x_t \in \mathbb{R}^2 xtR2 进行鲁棒追踪。

状态转移方程与观测方程如下:
x t = A t x t − 1 + w t , z t = H t x t + v t x_t = A_t x_{t-1} + w_t, \quad z_t = H_t x_t + v_t xt=Atxt1+wt,zt=Htxt+vt
其中, w t ∼ N ( 0 , σ w 2 I 2 ) w_t \sim \mathcal{N}(0, \sigma_w^2 I_2) wtN(0,σw2I2) v t ∼ N ( 0 , σ v 2 I 2 ) v_t \sim \mathcal{N}(0, \sigma_v^2 I_2) vtN(0,σv2I2) 分别代表过程噪声和测量噪声。模型假设为随机游走( A t = I 2 A_t = I_2 At=I2)且直接观测位置( H t = I 2 H_t = I_2 Ht=I2)。

为了去除环境中的误检测,算法使用距离进行 数据关联,将每个标记匹配到最近的检测点:
z t = arg ⁡ min ⁡ z ∈ Z t ∥ z − x ^ t − 1 ∥ z_t = \arg \min_{z \in Z_t} \| z - \hat{x}_{t-1} \| zt=argzZtminzx^t1
最终计算标记的偏移量 Δ x t : = x ^ t − x ^ 0 \Delta x_t := \hat{x}_t - \hat{x}_0 Δxt:=x^tx^0 作为触觉信号。

3. TacThru-UMI 学习框架

该框架基于 Diffusion Policy(扩散策略),利用Transformer架构处理多模态输入。

  • 输入数据:包括手腕相机图像 I t w I_t^w Itw、传感器内部视角图像 I t s I_t^s Its、标记点偏移量 Δ x t \Delta x_t Δxt 以及本体感知信息 s t s_t st(如夹爪宽度)。
  • 编码器:视觉图像使用 DINOv2(ViT-Base 和 ViT-Small)进行编码,标记偏移和本体感知使用 MLP 编码。
  • 融合机制:为了区分不同模态,模型为每种特征添加了可学习的嵌入(Embedding):
    z w = ( DINO w ( I ) + z w ∣ I ∈ I t w ) z_w = (\text{DINO}_w(I) + z_w | I \in I_t^w) zw=(DINOw(I)+zwIItw)
    z s = ( DINO s ( I ) + z s ∣ I ∈ I t s ) z_s = (\text{DINO}_s(I) + z_s | I \in I_t^s) zs=(DINOs(I)+zsIIts)
    z x = ( MLP x ( Δ x ) + z x ∣ Δ x ∈ Δ x t ) z_x = (\text{MLP}_x(\Delta x) + z_x | \Delta x \in \Delta x_t) zx=(MLPx(Δx)+zx∣ΔxΔxt)
    这些特征拼接后输入到 Transformer 中,预测未来的动作序列 a a a,实现精准的机器人操作控制。

四、实验设计与结果分析

1. 实验设置

  • 硬件平台:基于 UMI 改装的数据采集器和低成本机械臂末端执行器,均配备 TacThru 传感器。
  • 任务设置:包含5个具有挑战性的真实世界任务:PickBottle(抓瓶子)、PullTissue(抽纸巾)、SortBolt(螺栓分类)、HangScissors(挂剪刀)、InsertCap(瓶盖插入)。
  • 评测指标:主要使用 任务成功率(Success Rate)
  • 基线对比
    • TT-M:TacThru + 图像 + 标记偏移(本文完整方法)。
    • TT:TacThru 仅图像(消融实验,去除了显式的标记数据)。
    • GS-M:GelSight + 标记(传统的视触觉传感器基线)。
    • Wrist:仅手腕相机(纯视觉基线)。

2. 对比实验结果

作者在 Fig. 6 中详细列出了各任务的成功率对比。

任务 (Tasks) TT-M (本文) TT (仅图像) GS-M (GelSight) Wrist (仅视觉)
PickBottle 100.0% 95.0% 95.0% 100.0%
PullTissue 95.0% 85.0% 0.0% 15.0%
SortBolt 83.0% 83.0% 45.0% 50.0%
HangScissors 79.0% 20.0% 90.0% 36.0%
InsertCap 90.0% 70.0% 76.8% 55.0%
平均 (Avg) 85.5% 66.3% 66.3% 55.4%
  • 结果分析
    • PullTissue 任务中,TT-M 达到95%成功率,而传统触觉传感器(GS-M)因为无法感知柔软纸巾的微小接触力,成功率为0%。
    • SortBolt 任务中,由于 TacThru 能近距离看清螺栓头部的形状和颜色细节,远超单纯依靠模糊触觉或远距离视觉的基线。

3. 可视化对比与分析

  • 标记追踪鲁棒性:在 Fig. 3 中,对比了实心标记和 Keyline 标记。结果显示,实心标记在黑色背景下会完全消失,而 Keyline 标记始终清晰可见。

  • 特征空间分析:在 Fig. 8 中,作者展示了 DINOv2 特征的 t-SNE 可视化。TacThru 的图像特征能够清晰地区分形状相同但颜色不同的螺栓,而 GelSight 的特征则混淆在一起,这解释了为什么 TacThru 在分类任务上表现更好。

4. 消融实验

对比 TT-MTT(不输入显式标记偏移量)的结果可以看出,在需要明确力反馈的任务(如 HangScissors 挂剪刀)中,TT-M 的成功率(79%)远高于 TT(20%)。这说明虽然传感器图像中包含了标记,但显式地提取并输入标记偏移量( Δ x \Delta x Δx)对于理解接触力和判断任务状态(如剪刀是否挂住)至关重要。

五、论文结论与评价

本文通过提出 TacThru 传感器和配套的 TacThru-UMI 学习框架,成功验证了“同时视触觉感知”在机器人操作中的巨大潜力。理论上,该研究证明了全透明弹性体配合特殊的轮廓线标记,可以兼顾清晰的视觉观测和鲁棒的触觉追踪,无需在不同模态间进行物理或逻辑上的切换。实验上,该系统在处理精细物体(如螺丝分类)和柔软物体(如抽纸巾)时,表现出了远超单一视觉或传统视触觉方案的鲁棒性,平均成功率提升了近30%。

这项研究对实际应用的启示在于,它为机器人提供了一种低成本且高效的方案来弥补近距离感知的盲区。特别是在家庭服务或精细装配场景中,机器人往往需要处理从未见过的、材质各异的物体,TacThru 这种能“透视”的手指让机器人在接触物体前后都能保持对环境的掌控。此外,证明了现有的预训练视觉模型(如 DINOv2)可以直接迁移用于处理这种透明触觉传感器的图像,降低了部署门槛。

客观来看,该方法的优点在于其感知的连续性和全面性,能够自适应地利用视觉引导接近和触觉反馈调整;其标记追踪算法计算量小,适合实时控制。然而,该方法也存在缺点:首先,全透明设计意味着传感器内部图像容易受到外部强光或剧烈光照变化的影响,虽然使用了关键线标记,但极端光照下仍可能失效;其次,相比于带有涂层的 GelSight,全透明弹性体在获取物体表面微米级的三维形貌细节上可能稍逊一筹,因为它更多依赖透视而非光度立体视觉原理。

作为批判性讨论,虽然作者在多个任务上展示了成功,但目前的抓手设计仅为简单的两指夹爪,未来可以进一步探讨该传感器在多指灵巧手上的集成与应用。此外,对于长期使用的磨损问题——即弹性体表面的划痕是否会严重干扰视觉感知和标记追踪,文中尚未深入讨论,这在实际工业应用中是一个不可忽视的因素。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐