📋 目录


🤖 开场:一个反常识的实验结果

2026 年 6 月,一篇论文在具身智能圈投下了一颗炸弹。

论文名字叫 T-Rex: Tactile-Reactive Dexterous Manipulation。作者阵容极其豪华:李飞飞、Jim Fan、Pieter Abbeel、Jitendra Malik、Ken Goldberg、Trevor Darrell,加上一批来自伯克利、英伟达、斯坦福、MIT 的研究者。

他们做的事情很朴素:拿当前机器人领域最主流的视觉-语言-动作模型 π0.5,在输入里多加一路触觉信号。

按常理,多一个感知维度,模型应该更强对吧?

结果是:任务成功率从 17% 跌到 6%。

一个降幅 65% 的相对损失。触觉不但没帮忙,还成了猪队友。

论文标题里的 “T-Rex”(霸王龙)是个双关梗——霸王龙的前肢短小。而这项研究要解决的,正是灵巧手如何真正"感知"世界这个难题。

这组数字出自对论文实验表格的完整梳理:T-Rex 65%、EgoScale 35%、π0.5 17%、Tactile-VLA 15%、Reactive Diffusion Policy 6%、π0.5+tactile 6%、ViTacFormer 3%。

同一条赛道上,最强基线是 35%,T-Rex 是 65%,绝对差 30 个百分点。而"朴素加触觉"这个看起来最合理的方案是 6%——比最强基线低了 29 个百分点。

这篇论文出自李飞飞团队,不是无名小作坊。那么问题来了:为什么触觉这个被寄予厚望的模态,会在真实机器人上"水土不服"?今天我们不猜,直接把数据和工程逻辑摆出来。

🖐️ 触觉到底在感知什么:先拆开这个模糊的概念

在讨论"怎么用触觉"之前,得先说清楚"触觉"是什么。

《硅谷101》这期机器人触觉专题请到了一目科技创始人兼 CEO 李智强(Eric)、联合创始人陈天一,以及亚德诺半导体(美国)人工智能总监于弢。三人带着摄制组进了实验室和试产车间。

节目里把触觉拆成了两个正交的维度,这个拆法比"触觉 = 压力传感器"要准确得多:

维度具体内容机器人为什么要它
力感知 · 静态力抓握时手指持续施加的压力判断捏得够不够紧、物体有多硬
力感知 · 动态力物体滑动时产生的高频信号判断是不是要掉了、摩擦力够不够
形态学感知材质、表面粗糙度、纹理分辨苹果和橘子、光滑还是粗糙

为什么这个区分重要?因为静态力和动态力的物理机制完全不同,对传感器的要求也完全相反。后面讲五条技术路线时会看到,有些方案天生只能测其中一类。

节目里还有个硬证据:有实验把正常人的手部触觉神经短暂麻醉,被试的拧、抓、系扣子立刻失灵。这说明视觉在精细操作上无法替代触觉——不是"不够好",是"原理上做不到"。

但这里有个容易被误读的地方。受访者说了一句很关键的话:一些没有触觉的机器人任务成功率看起来很高,但这并不等于可用性强。

原因是:只靠视觉的做法可以「动得非常非常慢,每次微调一毫米,不断去试」,最终总能成功。如果你只看成功率,这个指标本身就是个伪命题。

拧螺丝是典型场景——等你用视觉发现螺丝已经拧花,才判断出力过大,太晚了。

🔍 五条技术路线,没有一条通吃

目前市面上的触觉传感器主要有五条路线。它们的差异不在"精度高低",而在测量哲学的根本分歧。

路线原理优势局限
压阻式材料受力形变→电阻变化→反推压力最成熟、便宜、门槛低只测垂直方向的力,温度湿度下漂移
压电式石英/PZT 受力→电荷偏移→电压对振动、冲击等高频信号敏感只对变化的力敏感,静态力会衰减到零
电容式平行板电容器,形变改变间距/面积→电容变化灵敏度高、响应快、成本较低动态范围有限,易受电磁干扰
光学式(视触觉)柔性材料形变,内嵌摄像头拍摄后反算精度最高,能同时解算形貌与力分布成本高、结构复杂、做小很难
磁感应弹性体加磁性颗粒,底部磁传感器测磁场同样能推算三维力易受电磁干扰,分辨率有限

前两条路线直接把"力"转成电信号;后三条先让材料形变、再测形变程度。后三者的关键优势是突破了垂直方向的限制,能感知三维力。

压电式的失效机制值得单独说:它只在按下的那一瞬间产生电压信号,一直按着不动,信号会慢慢衰减到零。所以它天生测不了"我需要持续握紧多久"这类问题。

工程上的结论是:没有哪条路线通吃,多传感器结合更可能是最终方案。

逻辑很直白——人的每一寸皮肤都有感知,机器人要达到同等水平,全身铺最贵的方案成本扛不住;而且不同部位的精度要求本来就不一样。指尖需要光学式的高分辨率,手掌和手臂用压阻式或电容式覆盖更大面积更划算。

节目在 WAIC 展会看到的情况印证了这个逻辑:采用电容式的方案已批量用于工厂分拣与检测,采购价只有光学式的四分之一到二分之一。

🔬 视触觉的四个难点:精度最高,也最难落地

一目科技选的是光学式。节目组进了他们的材料实验室和试产车间,看到的是这条路线全部的真实代价。

材料:软、薄、耐磨的"不可能三角"

要求业内术语为什么必须要
软杨氏模量低才能通过细致形变精确反映物体硬度和力度
耐磨—否则长期执行任务会性能漂移或破损
薄—才能缩小传感器尺寸、扩大应用场景

三点天然对立,只能找平衡。节目里展示了他们正在研发的「可恢复性材料」——类似皮肤自愈,机理是特定官能团的分子键断裂后能恢复。

结构:视距是物理硬约束

视触觉本质上是微距摄影。镜头和感光芯片之间必须留出对焦距离,这是它做不大的底层原因。

他们的解法是自研超表面与芯片技术压缩视距,把厚度做到和 SIM 卡差不多、不到 16 毫米;下一代目标是 3 毫米。

照明层更难:手指表面不是平面,两侧有弧度,灯珠排布要做大量光路仿真(他们叫光追踪),才能做到 270 度覆盖且不串扰。

还有个细节挺能说明这行的真实门槛:测量材料光学特性的 BSDF 设备专业款要百万元级,他们的博士是自己搭了一台。

算法:三条路,各有取舍

方法做法优点缺点
标记点法皮肤上印微小标记点,跟踪位移算形变算法简单、制造容易精度上限低——标记点数就是分辨率上限
纹理分析法随机喷涂颗粒或材料自带纹理,追踪光影流动硬件简单,无需做标记点算法复杂、算力大、延迟高
光度立体法RGB 三色光不同方向打光,按像素 RGB 值反算形变精度与制造复杂度折中,算力居中需多色照明,制造稍复杂

这里有个容易忽略的知识点:前两种方法只看亮度和对比度,单色照明就够了;光度立体法必须用多色光。

纹理分析法原理上相当于光学鼠标的三维版——鼠标检测二维平面变化,触觉传感器要检测三维。

成本:单指千元级

这是光学式最硬的一道坎。单价在单指千元级,比压阻、电容贵一个档次。

降本路径是随量下降,受访者认为未来有可能降到小几百元。但也要算清另一笔账——不光是制造,后续的算法和算力要求也更高,因为视触觉要复用视觉模型,而视觉模型通常都不小。

高成本对应的是高上限。实验室里的对比很直观:

  • 没有触觉的灵巧手夹薯片,很容易夹飞
  • 带视触觉的夹爪能轻轻夹起,你从它手里抽走薯片时它会感知到轻微晃动与摩擦,慢慢卸力
  • 夹树叶时能感知树叶的微小形变和弹性反力

🕳️ 数据采集的死结:要采触觉,先得屏蔽触觉

机器人训练最缺的是数据。在触觉领域,业内的原话是更极端的:可用的数据基本为零。

原因在于高保真触觉传感器此前一直缺失,用传统方法采来的数据跟人的差距很大。而普通视频、文字这类互联网数据,根本无法反映"力"的大小和方向。

所以这个领域尤其强调真机数据。但真机采集撞上了一个悖论:

要采集人的触觉,就得在人手和物体之间加一层传感器;而这层传感器会屏蔽掉人自己的触觉。

操作者的手变笨了,示范质量下降,训出来的机器人自然没有人的灵巧。节目组做了个实验:戴上厚手套拿豆腐,要么滑落,要么按碎——判断摩擦力够不够、形变到什么程度,全靠触觉。

除了这个悖论,还有两个硬伤:

一是数采设备本身笨重,尺寸大、穿戴麻烦,会影响操作员的动作本身。下一代方案是超薄传感器,只在关键位置贴触觉点,而不是戴复杂手套。

二是数据密度根本不够。 最好的织物触觉手套一只手也只有约 500 个感知点。抓一颗 M2 螺钉,在手套上就是一个点——连方向都测不出来。于弢团队与 MIT 合作的项目发现,用这类手套采的数据大部分有效场景是「整个手掌抓一个较大的东西」,一旦涉及精细操作,数据直接失效。

节目组把这种状态描述成一个恶性循环:

第三条路也没走通:触觉字段的采集格式各家不统一——两指设备只适合工业夹爪,不适合灵巧手;触觉、视觉、本体信息之间的时间轴对齐能力也做得不够好。没有统一格式,就形不成大规模训练集。

🧪 仿真补位,以及它补不上的一段

既然真机采集这么难,行业把希望放到了仿真上。英伟达是这条路线最重要的押注者,用的是 Isaac Lab 框架。

做法分两层:给不同物体赋予刚重、软硬、表面粗糙度等物理属性;同时输入触觉传感器自身的特征(弹性体物理特性、手指内的光源分布)。然后推算接触时的形变与光路变化,最后用真机数据标定修正。

障碍是算力。用有限元方法精细计算弹性体形变,可能一帧要算一个小时,实时训练完全用不了。

所以学术界提出各种简化。最有代表性的是英伟达的 TacSL 论文——用「软接触模型」代替有限元:把物体和皮肤都当刚体处理,但允许它们按接触力大小互相穿透。形变不是最精确,但能大致模拟,速度快得多。

⚠️ 这里要纠正节目的一处口误。 TacSL 论文发表于 IEEE Transactions on Robotics,arXiv 版本是 2024 年(不是节目说的"2025 年")。它的加速幅度是实测数据:在 512 个并行环境下生成速度达 1631 FPS,相比 Taxim 的 7.28 FPS 提速超过 200 倍;力场生成在 32,768 并行环境下达到 1,541,043 FPS,相比 CPU 基线加速 428 倍。

节目提到的 82.7% 成功率,核实后是 Peg Insertion(插销插入)任务在 81 次 policy-trial 试验中取得的零样本迁移结果,对应的是 ColorAug 配置。对照组数据能看出这个数字有多"脆":

Peg Insertion 配置真机零样本成功率
Vanilla27.2%
Concat+ColorAug77.9%
ColorAug82.7%

也就是说,82.7% 不是"仿真就能白拿"的结果,而是精心调过数据增强和域随机化之后才拿到的。换句话说,仿真本身不解决问题,仿真 + 随机化 + 增强这套组合才解决问题。

至于仿真与真机的差距,一目科技 Eric 给出的数字是:仿真准确率 90% 以上,剩下那 10% 主要差在柔性物体的模拟上。

而他对数据配比的判断是:真机和仿真至少 1:1,甚至仿真会占多数。 这跟"仿真替代真机"的叙事相反,但工程上更诚实。

触觉的数据量:视觉的十分之一

这里有个反直觉但合乎逻辑的判断。

Physical Intelligence 的研究员 Kay 给视觉模型的答案是:100 万小时(约等于一个人一生的物理经验)。

而触觉只需要十分之一,10 万小时左右就开始显现泛化能力。

原因不难理解:机器人的行为数据里塞满了「转身、伸手、移动」这类过程信息,而这些对训练真正有效的往往只是「拿起」「放下」等关键接触动作。而触觉在没有操作时输入基本为零——那 10 万小时里已经天然减掉了大量无效部分。

⚡ 回到开头:为什么"加了触觉反而更差"

现在可以正面回答那个问题了。节目把触觉应用的三道坎列得很清楚:

障碍具体表现为什么难
触觉没法用规则定义拿起纸杯力气小点行,稍微夹紧有形变也可接受;鸡蛋绝不能让蛋壳变形软硬、脆弹、破坏阈值无法写成单一数值规则
触觉信号维度太多纵向压力、横向剪切力、摩擦力、温度、振动、音频不加处理直接输入,模型无法分解,信号退化为噪声
频率不匹配触觉天然高频,视觉语言模型跑在低频计算资源浪费、反应慢、触觉噪声干扰高层规划

第三条是主因。 前两条还有工程解法,第三条是结构性矛盾。

有第三方技术解读把频率错配讲得更直白:视觉是"慢感知",摄像头以大约每秒 5 帧的频率扫描世界;触觉是"快感知",接触瞬间的压力、滑动、形变以毫秒计变化,天然需要每秒 20 次以上频率才能发挥作用。

打个比方:让一个长跑运动员和一个短跑运动员在同一条跑道上用同样速度跑——长跑觉得节奏太快跟不上,短跑觉得节奏太慢憋得慌。强行塞进同一个低频 Transformer,结果不是 1+1=2,而是 1+1<1。

T-Rex 的解法:三个专家,两种频率

T-Rex 给出的不是"修修补补",而是架构层面的重做。核心叫 MoT(Mixture-of-Transformer-Experts),借鉴 MoE 思路,由三个专家分工:

专家职责运行频率
Latent Expert(潜在专家)处理视觉语言观察,预测未来视觉表征,提供慢速上下文理解低频
Action Expert(动作专家)根据上下文生成动作序列,输出粗略动作约 5 Hz
Tactile Expert(触觉专家)像反射系统一样,在执行中用触觉反馈快速修正力度、角度、接触状态约 20 Hz

关键的创新不在"多设一个专家",而在异步执行:推理时动作专家生成动作规划,同时触觉专家以更高频率独立运行,复用已算好的上下文缓存,只做快速触觉推理。

这个设计的直觉等价于基础模型的双系统结构——System 2 负责慢思考和长程规划,System 1 负责快反应和本能动作。

消融实验证明这个设计不是花架子:去掉异步精修,平均成功率从 65% 掉到 60%(掉 5 个百分点)。而在六任务消融里,去掉触觉输入会掉到 42%(掉 23 个百分点)。

还有个数字更狠:去掉 22,889 小时的第一视角人类视频预训练,平均成功率从 65% 崩到 18%。这说明触觉不是万能药,视觉预训练依然是地基。

业界分歧:单练还是合练?

观点提出者理由
单独训练触觉模态李智强(Eric)触觉自身语义理解先闭环,再与其他模态融合;每个模块可独立训练测试,像插件一样即插即用
必须与视觉同时训练于弢(亚德诺)视觉是全局的、触觉是极度局部的;手形变化时力在空间上的分布也变,只有结合才能让模型理解"我拿了什么才会有这样的感知"

于弢还提了一个迁移层面的问题:视觉-触觉融合后的 latent space 表征,在一个 embodiment 上做同一件事可以,但迁移到另一个载体上非常难。哥大李昀烛团队的做法是把触觉的力分布结合到三维点云上——这时"力"不再是一个标量,而是空间中的一个分布。

两条路线目前没有绝对优劣。T-Rex 走的是执行过程中的高频修正,Tabero 论文主打前置的语义力控。

顺带说个时间线:节目里提到"今年五月有一篇名为 Tabero 的论文"。核对下来,TacSL 发表于 2024 年(IEEE TRO),T-Rex 发表于 2026 年 6 月(arXiv:2606.17055)。

🏭 量产卡在一致性:最不性感,也最要命

最后一环是量产。节目组在 ICRA 2026(维也纳)上手测了多家触觉传感公司的产品——大多数做不到一致性。

原因是触觉传感器太精密了:弹性体厚度相差太大、弹性系数不一致、传感器间距不同,都会让参数出现偏差,算法就算不出正确数值。

而手指的调整动作本身非常微小,做精密操作时输出力稍微偏差就可能导致任务失败。这种"传感器比任务要求还精密"的错配,是量产阶段最尴尬的问题。

试产车间的流程能看出这个行业的真实成熟度:

环节工艺要求现状
凝胶固化超净工作台,局部 100 级洁净,不能有灰尘和气泡依赖超净环境,成本高
视觉筛选拍摄剔除带气泡与杂质的样品,上位机再筛一次已自动化
粘接/预总装壳体、灯带、相机、芯片精密组装大量步骤仍依赖手工
总装前成像检测力学反馈画面 + 内置 AI 算法检验已自动化
批次试产样品自动化测试验证工艺参数稳定性已自动化

受访者承认,现阶段很多步骤仍依赖手工,因为触觉传感器是新品类,上下游的标准化和自动化设备尚未统一——数采设备、灵巧手各有不同的协议、接口和手型适配要求。

他们的做法是双线并行:自动化量产线稳定交付标准品,试产线承接定制化需求和新工艺验证。 两条线协同运转,被视为这个行业走向成熟的标志。

📐 行业判断:爆发前夜,还是为时过早

节目结尾给出三条行业信号:

  • 2026 年触觉传感器需求出现明显上涨,行业逐渐意识到触觉数据对训出更好的物理 AI 模型很关键
  • 灵巧手、上下游和具身整机都在拼命出货,反过来带动触觉传感成熟
  • WAIC 上已有汽车电池装配工厂把触觉传感器装上机械臂——不同电池包形态变化频繁,传统纯编程自动化无法适应产线的频繁调度

第三条我个人认为最有说服力,因为它跳出了"机器人必须像人才有意义"的叙事。触觉的第一个规模化落地场景,可能不是人形机器人,而是需要应对来料变形的柔性产线。 汽车电池装配就是典型——电池包的形变、来料差异是刚性的,视觉再准也读不出"这个边角有没有翘起来"。

市场规模上,节目引用了美国银行(BofA Global Research)的预测:

指标数值来源
2026 年人形机器人年出货量9 万台BofA Global Research
2030 年人形机器人年出货量120 万台BofA Global Research(Exhibit 2)
2025→2035 年复合增长率86%BofA Global Research
2030 年中国人形机器人物料成本降至 1.7 万美元以下BofA Global Research

节目里说"假设都装配了触觉传感器、每个机器人 10 根手指,触觉的市场需求将提升到千万级别"——这个换算是对的,120 万台 × 10 指 = 1200 万个触觉传感器。但要注意,这是2030 年的年出货口径,不是存量,更不是市场规模。用单指千元级成本算,仅中国以外的全球市场年出货对应的传感器产值就在百亿元人民币量级。

至于时间点,受访者按量产周期倒推,认为下一个里程碑在 2026 年底或 2027 年初。这个判断和美银的出货曲线节奏吻合——2027 年 29 万台、2028 年 50 万台,量的爬坡确实在这两年。

李智强在节目里的说法被节目组放在了最后作为收束:

“触觉是让机器人类人甚至超越人的最后一块拼图,因为它不仅是多了一个维度的数据,更是让机器人掌握到了’人类的第一语言’。”

这个说法有个旁证。GelSight 的灵感来源是 MIT 视觉科学教授 Edward Adelson 观察自己孩子时发现的——婴儿伸手去摸一切,触摸对他们的吸引力远超视觉。Adelson 是视觉专家,他想做人工触觉,思路是"把机械的触觉信号转换成视觉信号——因为如果是图像,我就知道该怎么处理"。

🏗️ 这件事对做数据平台的人意味着什么

聊到这儿可能有点远了,但既然要说就说透一点。

机器人行业现在遇到的"数据采集悖论",在企业数据治理里有一个几乎同构的版本。

同构点在于:采集本身就是一种干预。 触觉采集要在人与物体之间插入一层介质,企业的数据采集要在业务与系统之间插入一层流程。插入的瞬间,被观测的行为已经不是自然行为了。

差别在于介质能不能做到足够薄。一目科技的答案是把传感器从 16 毫米压到 3 毫米——介质越薄,对主体行为的干扰越小。这是一个纯工程解,但它给了数据平台一个直接启示:

机器人触觉的约束数据平台的对应工程取舍
传感器要薄(<3mm)才不干扰操作数据采集链路要薄,才不改变业务行为埋点/CDC 越轻量越好,重量级 Agent 越少越好
各家格式不统一,模态间时间轴对不齐各业务系统口径不统一,跨域关联对不上先统一元数据与主键,再谈数据融合
仿真与真机要 1:1 搭配业务真实数据与模拟/推演数据要搭配纯仿真失真,纯真样本量不够
量产要一致性,不能每批都漂数据质量要可度量、可追溯一致性靠自动化校验,不靠人工抽检

这里要克制地说一句:SPARK 融合平台做的事,是把"数据从哪来、怎么对齐、谁能看到"这几件事变成可执行、可追溯的流程——iPaaS 负责接数据,治理中心把质量校验和口径统一前置到入库之前,全域守卫划权限边界。

但这些只解决"数据可不可信、能不能被用起来"的问题,不解决"判断标准本身对不对"。触觉领域那个真正的死结——“哪些接触算成功”——最终得由做机器人的人来定。平台能保证这个标准被一致地执行,但定标准仍然是人的工作。

📝 落地清单

如果你正在评估要不要上触觉方案,这几条是从上面的核实里抽出来的可操作判断:

先明确目标场景属于哪一类。 接触丰富的精细操作(拧螺丝、插销、剥鸡蛋)触觉收益最大;粗放的分拣搬运,光学式性价比不划算,WAIC 上电容式四分之一到二分之一的价格就是答案。

别信"加个传感器试试"式的方案。 T-Rex 的 17%→6% 是个明确的反例。如果你的模型架构是低频单流,先改架构(异步双频)再上传感器,否则数据采回来也是浪费。

数据采集方案要先算介质成本。 评估的不只是传感器单价,还有"对操作者行为的干扰程度"——织物手套只有 500 个感知点这个数字,说明薄和大比精更重要。

仿真要跟域随机化一起上。 TacSL 的 82.7% 是在 ColorAug 配置下拿到的,Vanilla 只有 27.2%。只搭仿真环境不做随机化和图像增强,会得到一个"看起来很美"的假数字。

量产一致性要写进验收标准。 ICRA 2026 上多家公司产品的一致性都做不到。这一项如果不提前写进去,量产阶段一定会回来返工。

🎯 写在最后

这篇论文最有价值的地方,不是那个 30 个百分点的领先,而是它证明了一件事:多一个模态不等于模型更强。

过去两年具身智能的默认假设是"把所有感知转成 token 塞进同一个大模型,数据多了智能自然涌现"。T-Rex 用一组消融实验把这个假设否掉了一半。

而它给出的解法——慢思考负责规划、快反应负责修正、两者异步运行共享状态——并不是什么新鲜架构。人类神经系统就是这么工作的,机器人直到 2026 年才刚开始照抄。

倒是那个数据采集悖论值得反复咀嚼:要采触觉,先得屏蔽触觉。 这句话听起来像个段子,但它精确描述了每一个想要"客观记录真实世界"的系统都会撞上的墙。你一测量,就改变了你测量的对象。

那些被迫在"记录的准确性"和"被记录者的自然性"之间做取舍的,从传感器到日志系统,其实是同一道题。


参考资料

  • T-Rex: Tactile-Reactive Dexterous Manipulation,arXiv:2606.17055(2026-06)
  • TacSL: A Library for Visuotactile Sensor Simulation and Learning,IEEE Transactions on Robotics(arXiv 2024)
  • Bank of America Institute,Physical AI, part 2: Humanoid robots
  • 《硅谷 101》机器人触觉的爆发前夜:五大技术路线、数据困局与模型之争(2026-09-04 上线,片长 42 分 45 秒)
  • 本文数据来源标注:论文实验数据引自原论文及公开实验表格梳理;出货量预测引自 BofA Global Research;受访者观点为节目口述,未经独立验证在这里插入图片描述
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐