《Advanced Materials》综述:从“各自感知”到协同融合,多模态人工感知如何走向具身智能
2026年,华中科技大学 郭洋、黄奕华 等研究者在《Advanced Materials》发表综述 Emerging Multimodal Artificial Sensory Fusion Paradigms Toward Advanced Embodied Intelligence,系统梳理了人工多模态感知从传感器、人工突触到具身应用的技术版图。论文的核心判断很明确:具身智能的感知瓶颈,已经不只是“能不能测到”,而是不同感觉能否在低延迟、低功耗的硬件中完成协同编码、记忆与决策。
用更直白的话说,今天的机器人可以有高清相机、灵敏电子皮肤和麦克风,但这些部件若只是各自采集数据,再把海量原始信号送往后端计算,就还不像真正的“感官系统”。人类抓起一只杯子时,不会先把画面、触压、温度和声音分别存盘,再等待大脑批处理;多种感觉会在接触发生的同时相互校验,并直接改变下一步动作。
这种差别在黑暗救援、透明物体抓取、食品新鲜度判断等场景中尤其突出。视觉会受遮挡和光照影响,触觉只能在接触后工作,听觉难以还原精确形状,嗅觉又缺少空间定位。多模态融合的价值,不是把传感器数量相加,而是让一种感觉补上另一种感觉的结构性盲区。
综述收录的代表性研究已经给出一些有说服力的结果:视觉—触觉协同任务中,融合识别率最高达到92.5%,高于单独触觉的69.6%和单独视觉的79.6%;另一套将硬度与透明度联合编码的系统,对9种材料的分类准确率达到98.6%。但这些数字来自特定器件、样本和任务,不能直接等同于开放世界中的通用机器人能力。这篇综述真正值得看的,是它把“漂亮的单点演示”放回了材料—器件—阵列—算法—系统的完整链条。

Fig. 1 | 多模态人工感知的研究路线图。代表性工作从2021年的视觉—触觉融合,逐步扩展到视觉、触觉、听觉、嗅觉和味觉的多种组合;读图重点不是年份本身,而是融合对象正从两个物理维度走向更复杂的感觉网络。
01|问题不在感官数量
具身智能强调“感知—理解—决策—执行”的闭环。相机、压力传感器或气体传感器只是这个闭环的入口;如果入口提供的是彼此孤立、格式不同、时间尺度不一致的数据,后端仍要承担大量传输、模数转换和对齐工作。设备越多,信息未必越完整,冗余和延迟反而可能一起增长。
生物系统给出的启发是:光、声、压力和化学分子先由不同受体转成统一的神经信号,再通过可塑突触动态调节连接强度。于是,某一路信号变弱时,其他通道能够补偿;多路信号在时间上吻合时,又能相互增强。人工多模态感知要复现的,正是这种“转导—加权—融合—学习”的过程。

Fig. 2 | 从生物多感官系统到人工融合框架。不同刺激先被编码成电信号,再进入人工突触或神经形态网络;图中最关键的关系是,融合发生在信息进入决策之前,而不是事后简单拼接结果。
02|两条硬件路线
综述把现有系统归为两类。第一类是异质集成:视觉、触觉、听觉等传感器各自工作,再通过外部电路连接到独立的人工突触或处理器。它像一套可以替换镜头和麦克风的模块化平台,工艺成熟、组合灵活,也便于单独优化每个部件;代价是连线、数据搬运、模数转换和系统体积。
第二类是单片集成,也就是让同一器件或紧密耦合的结构同时承担感知、存储和初步计算。物理信号一旦到达,局部电导或突触权重随之改变,省去长距离传输。它追求的不是“更小的传感器”,而是让计算发生在感知产生的地方。难点同样明显:一种材料要同时响应多种物理场,信号串扰、解耦、封装与器件一致性都会变得更棘手。

Fig. 3 | 多模态人工感知的两类架构。异质集成保留独立传感器和处理单元,单片集成则把多种感知与突触处理压进同一器件;两者的核心权衡是模块灵活性与传输开销、集成度之间的取舍。
03|让信号留下记忆
在这条链路里,传感器负责把光子、压力、声波、气体分子或离子浓度转换成可读电信号;人工突触则负责改变信号的“通过权重”。短时塑性可以过滤重复刺激,反复训练后形成的长时塑性则承担记忆。由此,多模态融合不再只是软件中的特征拼接,而能部分下沉到材料和器件的电导变化中。
两端忆阻器结构简单、集成密度高,借助导电细丝、离子迁移、相变或铁电极化切换来调节电阻;三端突触晶体管则把读取与权重调控分开,通常拥有更好的线性和更丰富的可塑行为,但制造与阵列集成更复杂。完整机制链应当是:材料响应外界刺激,物理过程改变载流子或离子状态,器件电导随之更新,最终为识别或控制任务提供可学习的权重。

Fig. 4 | 两端与三端人工突触器件。RRAM、PCRAM、FeRAM依靠不同物理机制改变阻态;FeFET、浮栅晶体管和电解质栅晶体管则通过栅极调制沟道电导,分别对应高密度与高可控性的两类实现路径。
04|视触融合先行
视觉—触觉是目前研究最充分的组合:前者提供远距离的轮廓、颜色与位置,后者补充接触后的硬度、纹理和受力。早期系统通常由相机、柔性应变传感器和后端神经网络组成;进一步的方案则把触觉和视觉信号送入同一个突触晶体管,在硬件层完成初步融合。
更紧凑的思路,是把“触摸”先转成光。机械致发光层受到压力后发光,光刺激发光材料再完成接收、存储和处理,整个链路以光为信息载体。综述引用的一项工作中,融合识别率最高达到92.5%,而触觉和视觉单模态分别为69.6%和79.6%。另一种二维 NbOI2 压电—铁电—光电人工突触,则利用同一材料的光响应、压电效应和铁电性,让应变直接调节视觉记忆:拉伸条件下,双脉冲易化指数从116%升至180%。这里的关键不是两路输出相加,而是触觉输入改变了视觉通道的载流子动力学与记忆行为。

Fig. 5 | 视觉—触觉融合的两种器件路径。上半部分用机械致发光与光刺激发光材料完成“力到光”的跨模态转导;下半部分利用二维 NbOI₂ 同时感受光和应变,显示触觉可直接增强视觉通道的突触响应。
05|更多模态入场
当系统需要判断食品、体液或危险气体,仅靠外观远远不够。视觉—嗅觉融合把空间和颜色信息与挥发性分子指纹结合。综述列举的一款芯片级系统,在同一 CMOS 图像传感器中心成像、外围记录气体引起的颜色变化,再由双路深度网络提取和融合特征;它在设定的肉类新鲜度与类别任务中达到100%准确率。这个结果属于“芯片采集+神经网络”的端到端系统贡献,不能归因于气敏材料本身。
视觉—味觉器件则尝试在液体中完成融合。一种有机光电化学晶体管以450 nm光作为视觉输入,以H+/OH−浓度变化模拟味觉刺激;pH会改变界面能带弯曲、光生电荷分离和离子注入效率。实验观察到弱单模态输入下更明显的融合增强,以及随刺激时间间隔变化的响应,说明器件开始具备非线性和时间相关的多感官特征,而不只是两个电流的叠加。

Fig. 6 | 视觉与嗅觉、味觉的融合。上半部分展示芯片同时获取目标图像与气味颜色指纹,下半部分展示光照和酸碱离子如何共同调节光电化学晶体管;应关注系统级算法融合与单器件物理耦合的证据层级不同。
声音提供的是全局、瞬态信息。现有视觉—听觉系统多数仍借助商用声音传感器,或者让声波振动光斑,再由光电探测器间接“听见”;真正能在器件层直接接收原始声波的方案仍少。触觉—听觉融合更常利用摩擦电效应,因为压力和声波本质上都可表现为机械激励。代表性自供能平台的声学检测范围为60—10000 Hz,声学灵敏度约1.65 V/dB,压力灵敏度约63 mV/N,但两项指标来自不同刺激条件,不能合并理解为整机在同一状态下的综合性能。

Fig. 7 | 视觉—听觉与触觉—听觉融合。前者以光敏突触晶体管配合声音输入编码音量、音调和音色,后者用摩擦电单元同时感知声波与压力;图中响应曲线说明两种机械刺激可以进入统一的神经形态处理链。
触觉与化学感觉的组合,则更适合非视觉环境和贴身设备。全凝胶有机电化学晶体管可承受50%拉伸,在30%应变下循环10000次后仍保持稳定,并分别实现0.1 Pa的压力检测下限和1 ppm的氨气检测;另一种全聚合物晶体管在0.1 V工作,可区分5种接触材料与4种基本味觉。这里展示的是共享柔性平台的多功能性,距离混合气体中的高选择性、长期封装和实时解耦仍有明显距离。

Fig. 8 | 触觉—嗅觉与触觉—味觉融合。全凝胶 OECT 兼顾拉伸、压力和氨气响应,全聚合物电化学晶体管利用接触起电与离子调控区分材料和味觉;读图重点是同一器件平台如何处理机械与化学刺激。
06|三模态如何合流
视觉、触觉和听觉同时加入后,系统才更接近机器人操作的真实需要:视觉负责定位,触觉控制接触力,听觉捕捉碰撞、摩擦或故障声。垂直摩擦晶体管把摩擦电纳米发电机与垂直有机场效应晶体管做成一体,摩擦电部分感知触摸和声音,MXene 电极兼具光吸收能力。与独立摩擦电器件相比,其触觉灵敏度提高711倍,并获得91.8 mV/dec的亚阈值摆幅。这些是器件层的集成和电学指标,还不是复杂场景中的三模态决策准确率。
另一条路线是可训练衍射光神经网络芯片:16个输入单元、5层共80个可调衍射单元和4个输出端,在预处理并统一编码后,分别对触觉、视觉和听觉数据获得89%、86%和82%的分类准确率。论文报告的217.6 TOPS潜在吞吐量、447.7 TOPS/mm²计算密度和30.2 ps光学延迟,描述的是片上光传播与计算能力,不包含前端传感、数据预处理和电光加载的完整系统开销。

Fig. 9 | 视觉—触觉—听觉三模态融合。上半部分展示单器件中的多感知、存储与计算,下半部分展示片上衍射光网络对三类已编码数据进行学习;两者分别回答“如何原位感知”和“如何高速融合计算”。
07|从识别走向行动
多模态器件最终要进入任务闭环。健康监测中,电化学发光触觉—视觉突触可把手指弯曲次数转成可见光反馈,并与脉冲神经网络结合识别心律失常;集成在口罩内的石墨烯/MoS2电子皮肤,则在同一像素中分别记录呼吸引起的形变和湿度变化,从而区分平静、轻度与高强度运动后的呼吸状态。这些应用的进步在于同步获取互补变量,而不是某一个传感指标单独变高。

Fig. 10 | 健康监测与仿生皮肤。可穿戴指套把康复动作转成电流和发光反馈,口罩内电子皮肤同时读取呼吸形变与湿度;图示强调多变量同步监测如何提供比单一波形更完整的生理语境。
识别任务进一步显示了互补信息的作用。二维 NbOI2 器件用应变增强受污染或受力不均的指纹图像,使识别准确率从原始图像的84.82%提升至92.08%;机械—光学人工突触同时编码硬度和透明度,对9种材料达到98.6%;压力与摩擦双感知系统对6种外观相近的柑橘品种达到97%。但每个结果都依赖各自的样本集合、采集流程与分类器,彼此不能横向排出“最好器件”。

Fig. 11 | 目标识别与材料分类。触觉增强模糊指纹,硬度与透明度联合区分9种材料,压力与摩擦特征帮助识别外观相近的柑橘;不同准确率对应不同任务和算法,不能脱离测试集直接比较。
更接近具身智能的是“感知后行动”。一只仿星鼻鼹的机器人手在完全无视觉条件下,利用70个力传感器和6类气体传感器识别11类对象;经动态调整触觉与嗅觉权重的关联学习后,准确率达到96.9%,并在气体干扰、局部掩埋和部分阵列损伤下保持识别能力。另一些系统已经让机械手根据视觉定位、触觉滑移、温度和压力反馈完成抓取、倒水和分拣。只有当多模态信息真正改变下一步动作,感知系统才开始进入具身闭环。

Fig. 12 | 智能交互与控制。从硬件模拟巴甫洛夫式关联学习,到无视觉救援中的触觉—嗅觉机器人手,再到带温压反馈的倒水任务,图中呈现了多模态系统由信号识别走向行为闭环的三个层级。
08|价值与证据边界
这篇综述最重要的贡献,是把零散的“电子眼、电子皮肤、电子鼻”放进统一架构,并指出领域正在从异质拼装走向原位融合。材料负责多物理场响应,器件完成信号转导与权重更新,阵列提供空间分布,外围电路承担读出和编码,算法完成更高层特征融合,完整系统才负责最终识别或控制。任何一个层级的指标,都不能替代其他层级的证据。
边界也很清楚。第一,多数研究仍是实验室功能验证,混合气体选择性、液体环境稳定性、长期机械疲劳和封装可靠性尚未充分解决。第二,单器件能响应两种刺激,不等于阵列能在大面积上保持一致,更不等于信号已经被无串扰地解耦。第三,许多准确率来自研究者自定义的小型任务,缺少统一数据集、样本规模和测试协议。第四,器件级低电压、光学延迟或单次响应能耗,不应被写成完整机器人系统的能耗。
因此,评价这条路线不能只看“又增加了一种感觉”,而要追问四件事:多种信号是否真正产生非线性协同;是否能在统一时间轴上对齐;阵列良率和器件波动是否可量化;在某一路失效或受干扰时,系统是否仍能完成任务。鲁棒性增益,才是多模态融合区别于多传感器堆叠的硬证据。
09|离真正落地还有多远
作者给出的下一步路径横跨四层:在材料层开发可同时响应光、力和化学刺激的二维材料、离子凝胶与柔性有机材料;在器件层通过界面工程、封装和结构设计降低串扰;在阵列层建立器件变异系数、良率和标准化任务;在系统层推进晶圆级生长、异质键合、三维堆叠以及与硅基读出电路的集成。
其中最容易被忽略的,可能不是某种新材料,而是标准。没有统一对象集、噪声条件、模态缺失测试和系统能耗口径,98%、96%或92%的准确率只是各自实验室中的局部答案。只有在同一基准下比较感知完整性、延迟、功耗、失效容忍和闭环任务表现,领域才可能从演示走向工程。

Fig. 13 | 多模态人工感知的未来路线。材料制备、器件设计、阵列与系统集成最终共同指向环境感知、控制决策、人机交互和持续学习;真正的落地依赖四层协同,而不是单个器件指标继续刷新。
多模态感知并不会自动带来智能。它真正改变的是机器与世界接触的方式:信息不再被切割成彼此孤立的数据流,而是在材料发生形变、离子开始迁移、光生载流子出现的那一刻,就进入相互校验与学习。当机器人在昏暗房间里端起一只透明水杯,它不必“看清一切”,也能借由指尖的微滑、杯壁的温度和水声,稳稳完成下一步动作。
文献
Yang Guo, Yihua Huang, Xianyun Zhao, Huirun Chen, Huiqiao Li, Yuan Li, Tianyou Zhai. Emerging Multimodal Artificial Sensory Fusion Paradigms Toward Advanced Embodied Intelligence. Advanced Materials, 2026, e74199.
DOI: https://doi.org/10.1002/adma.74199
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)