0. 引言

想象这样一个场景:你正在擦桌子、削水果,或者插拔一个精密零件。这些动作对人类来说轻而易举,然而对于机器人来说,这些看似简单的操作却是一道难以跨越的技术鸿沟。当前,机器人领域深陷于一个反直觉的困境:即便触觉传感器在机器人领域已经广泛应用,整个行业却面临着**"感知更多、做得更差"的窘境。机器人明明"摸得到",却依然"不会用"。这一现象背后,揭示了当前主流方案对触觉本质存在的根本性误解**。

为什么给机器人提供额外的触觉感知,反而可能让它表现更差?答案在于,机器人操作领域长期缺乏对接触动态的建模和对触觉信息的有效利用。当前主流方案仅将视觉与触觉特征简单拼接后输入策略网络,这种方式看似合理,实际上却忽视了触觉的核心特征。相较于具备全局语义与连续观测能力的视觉,触觉信号高度局部且由接触事件驱动,无法提供全局感知,难以支撑长时序规划。更关键的是,接触本质上是一个随时间演化的动态过程

1. 触觉感知的本质与挑战

1.1 触觉信号的独特性

触觉感知是机器人与物理世界交互的直接桥梁,它与视觉感知有着本质的区别。视觉传感器可以从远距离捕捉相对稳定的物体几何特征,提供全局语义信息和连续观测能力。而触觉信号则反映了接触界面处力的瞬态时空演化过程,具有高度局部性事件驱动的特点。要有效利用触觉模态,不仅需要对力分布进行空间推理,还需要对力分布在动态交互中的演化规律进行时间推理。这种时空耦合的特性,使得触觉信息的处理远比简单的特征拼接复杂得多。

在这里插入图片描述

在实际应用中,触觉传感器能够捕捉到视觉无法观测的关键信息。例如,在抓取透明塑料杯时,视觉系统可能无法准确判断杯壁的形变程度,但触觉传感器可以直接感知接触压力表面变形。在削皮操作中,工具与物体表面的摩擦力变化滑动趋势等细微信号,都是触觉传感器的优势领域。然而,这些优势只有在系统能够正确理解和利用触觉信号的前提下才能发挥作用。

1.2 当前触觉融合方案的局限

现有大多数触觉增强型机器人系统通过两种方式融入触觉信息:一是将触觉嵌入投影到预训练的视觉-语言隐空间,将其视为额外的语义表征;二是在下游策略中,将触觉特征与语言条件视觉表征进行拼接。尽管这些方法让模型接触到了触觉输入,但给表征学习带来了巨大负担。模型必须在为视觉对齐和静态场景描述优化的语义嵌入空间中,隐式推断接触物理特性,而非为物理预测优化。

在这里插入图片描述

要学习特定的触觉模式对应滑动、变形或不稳定性,需要通过静态相关性间接挖掘这些概念,这往往需要大规模的标注数据,且无法保证底层的高频动力学被准确捕捉。缺乏显式的时间建模,这些学习到的表征难以编码连续触觉帧之间的因果关系,而这正是预测初期滑动等失效模式所需的核心结构。此外,由于许多视觉-语言-动作模型优先考虑语义对齐而非预测性物理建模,进一步导致触觉信号在细粒度时空推理中未被充分利用。

1.3 高分辨率触觉传感器的发展

近年来,以GelSight为代表的高分辨率触觉传感器取得了显著进展。GelSight传感器通过光学成像原理,能够捕捉接触表面的三维形变信息,分辨率可达微米级。这种传感器在机器人夹爪指端的应用,使得机器人能够感知细微的表面纹理、接触力分布以及滑动趋势。传感器采集的触觉图像不仅包含空间信息,还能通过连续帧之间的变化反映时间动态,为接触动力学建模提供了丰富的数据基础。

然而,高分辨率触觉数据的获取只是第一步,如何有效处理和利用这些数据才是关键。触觉图像的高维性、高频性以及与视觉信息的异构性,都给数据处理带来了挑战。传统的图像处理方法往往难以捕捉触觉信号中蕴含的物理意义,需要专门设计的编码器来提取有效的触觉表征。同时,触觉数据的采集频率通常高于视觉数据,如何在不同频率的多模态数据之间建立有效的时间对齐和融合机制,也是一个重要的技术问题。

2. 从VLA到WAM的范式转变

2.1 VLA模型的成就与局限

视觉-语言-动作模型(VLA) 是近两年具身智能领域最重要的技术突破之一。VLA模型通过大规模多模态对齐,实现了通用型机器人控制,将视觉观测和语言指令嵌入共享的语义隐空间,从而能够在各类操作任务和环境中实现泛化。当我们说一句"把桌上的杯子洗了",机器人之所以能够理解"杯子"“桌上”"洗"这些开放语义,并进一步调动已有技能,很大程度上依赖的就是VLA这类模型。VLA的意义在于实现了 语义到策略的跨越,它告诉机器人 “何为正确动作”

在这里插入图片描述

然而,VLA模型并不天然负责 “物理理解”。它最擅长做的,是把人类意图翻译成机器人可以执行的任务表达。VLA缺失的是对 物理因果的深度建模:它擅长回答 “What to do”,却在回答 **“What if”**时显得力不从心。因为真实世界不是静态图片,也不是清晰标注好的训练集,而是一个持续变化、充满接触、碰撞、摩擦、遮挡、形变和不确定性的物理系统。机器人抓取的不是"杯子的像素",而是一个会受力、会滑动、会倾倒的实体;它面对的不是"门把手的类别",而是一套包含铰链、阻尼、反作用力的物理结构。

这也是为什么很多系统在语义层面已经显得很聪明,但一进入真实交互,仍然会暴露出脆弱性。它知道"应该抓杯子",却未必知道"怎么抓才不会把杯子捏扁";它知道"应该开抽屉",却未必能在抽屉被卡住时做出合乎物理逻辑的调整。VLA主要负责理解任务和承载策略,而机器人对世界后果的预判,还需要另一层能力来补上。

2.2 世界模型的核心价值:后果意识

世界模型(World Model) 或 **世界动作模型(World-Action Model, WAM)**真正补上的,不是"想象力",而是 “后果意识”。很多人第一次听到世界模型,会自然联想到"让机器人脑内生成一段未来视频"。这个理解不能算错,但它抓住的更多是表现形式,而不是问题本身。世界模型真正重要的地方,不是把未来"画出来",而是让机器人在执行动作之前,先形成一套关于 世界将如何变化的内部假设

在这里插入图片描述

如果说传统策略模型更像是在回答"类似场景里,人类通常怎么做?",那么世界模型会多问一步:**“如果我这样做,接下来会发生什么?这些变化会不会让任务失败?”**一个典型的例子是抓取一个装满水的软杯。假设一台七自由度机械臂需要把桌面上的透明软塑料杯抓起并移动到旁边托盘里。这个任务表面上只是一个简单的抓取-放置操作,但从物理上看,它其实同时包含了几层耦合约束。

首先,杯壁是可形变的,夹爪法向力稍大,杯身就会局部塌陷。其次,杯中液体会改变整体的质心与惯性分布,杯身一旦被挤压或倾斜,液面就会发生滞后晃动。第三,抓取点、夹持力和抬升轨迹并不是彼此独立的变量,它们共同决定了这个动作最终会不会滑落、会不会倾斜、会不会泼洒。在这种任务里,纯策略模型很可能会输出一个"最像训练数据示范"的抓取动作,但它的问题在于,系统并没有显式判断这个动作会带来什么后果。

而带世界模型的系统,哪怕并不真的生成一段可视化视频,也会在内部比较几个不同的候选后果。它会额外评估:如果夹持力增加一点,杯壁形变会不会超过安全阈值?如果抓取点下移两厘米,接触会更稳定,还是会带来更大的液体晃动?如果轨迹从"直接平移"改成"先竖直抬升、再平移",杯口姿态是否会更稳定?这时候,系统关心的已经不是"哪个动作最像人类示范",而是"哪个动作导致的后果最可控"。

2.3 世界模型的两种作用模式

当前世界模型研究正在探索两条互补路线。第一条路线重视测试时显式推演(rollout),希望通过可见的未来推演提升决策质量。这种方式强调规划、可解释性和风险控制,让机器人在执行动作前先"想一想"。代表性工作如Motus、LingBot-VA等,试图把理解、动作和世界建模统一到一个框架里,通过闭环推演、因果一致性来提升长时任务控制能力。

第二条路线重视训练时未来监督,希望把世界知识沉淀到表征和策略内部,换取更低时延、更强闭环和更高部署效率。这种方式不执着于逐像素预测未来,而更关心能否在更抽象的特征空间里,学到足够好的世界演化规律。像Fast-WAM的实验观察显示,如果在测试阶段去掉未来视频生成,性能下降并不显著;但如果在训练阶段去掉视频协同训练,性能则会明显变差。这提示我们,世界模型的收益未必主要体现在推理时"脑内放一遍未来",也可能相当大一部分来自训练时利用未来监督去塑造更符合物理因果的状态表征。

在这里插入图片描述

这两种理解并不是非此即彼,而是对应不同的系统设计路径。测试时显式推演适合高风险、长时程、需要可解释性的场景;训练时世界监督适合对实时性要求高、需要快速闭环反应的场景。未来哪条路线更占优势,将取决于任务风险、控制频率、时域长度以及真机算力约束。

3. 视触觉融合的技术方法

3.1 人类神经机制的启发

如何破解触觉利用不足的困局?答案藏在人类自身的神经机制中。神经科学研究表明,人类在进行接触操作时,依赖的是一套**"预测+反馈"的协同机制**。大脑一方面通过前向模型提前预测动作将带来的感觉变化,另一方面通过实时感觉反馈进行快速修正,抵消误差和扰动。正是这种"先预测再修正"的机制,让人类能够在不确定的环境中,依然完成稳定而灵巧的接触操作。这一神经科学发现为机器人触觉融合提供了重要的设计原则。

3.2 数据集建设与质量标准

高质量的视触觉数据集是训练有效世界模型的关键基础。当前研究社区已经发布了多个具有代表性的数据集,它们在规模、质量和覆盖范围上各有特色。OmniViTac数据集收录了两万余条操作轨迹,将接触模式系统性分为擦拭、削皮、切割、抓取、装配和手内调整六类,覆盖近百类任务和百余种物体。Touch and Go数据集则专注于动态抓取场景,记录了机器人在移动过程中的触觉反馈和视觉观测。YCB-Slide数据集关注滑动检测,包含多种材质物体在不同表面上的滑动数据。此外,还有针对特定领域的专用数据集,如针对织物操作的ClothTouch、针对工具使用的ToolManip等。

在这里插入图片描述

这些数据集的共同特点是强调多模态同步精度和接触模式多样性。时间戳误差通常控制在毫秒级,确保不同模态数据之间的严格对应关系,这对于学习准确的因果关系至关重要。接触模式涵盖从刚性到柔性、从滑动到滚动、从轻触到重压等各种状态,物体材质包括金属、塑料、木材、布料、食材等,为模型学习通用的接触动力学规律提供充分支撑。数据采集过程中通常保留原始传感器频率,避免降采样导致的信息损失,同时记录完整的机器人状态(关节角度、末端位姿、夹持力等)以支持精确的动作复现。

然而,当前数据集仍面临多重挑战。首先是规模有限,相比视觉领域动辄百万级的数据集,触觉数据集通常只有数千到数万条轨迹,限制了大规模模型的训练。其次是场景覆盖不足,大多数数据集聚焦于特定任务或物体类别,跨域泛化能力有待验证。第三是标注成本高,触觉数据的物理意义(如接触力、滑动趋势、形变程度)往往需要专业知识才能准确标注。未来研究需要探索如何通过自监督学习、仿真数据增强、主动学习等方法降低对大规模标注数据的依赖,同时提升数据集的多样性和代表性。

3.3 系统架构模式:从单层到多层

…详情请参照古月居

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐