(论文速读)IADC-Net:融合小波、自适应去噪与稀疏表示的可解释旋转机械故障诊断网络
论文题目: An interpretable adaptive denoising convolutional network for intelligent fault diagnosis of rotating machinery
中文翻译: 一种用于旋转机械智能故障诊断的可解释自适应去噪卷积网络
期刊: Mechanical Systems and Signal Processing,2026
摘要: 深度学习凭借强大的非线性映射能力,在智能故障诊断领域取得了显著成功。然而,具有黑箱特征的深度学习故障诊断方法缺乏可解释性,严重阻碍了其在工业领域的广泛应用。针对这一问题,论文提出一种用于旋转机械智能故障诊断的可解释自适应去噪卷积网络 IADC-Net,并构建了一个综合可解释性框架。其中,可解释信号处理层由自适应融合去噪小波卷积(AFDWC)模块驱动,以增强模型在不同场景下的泛化能力。AFDWC 集成多种小波基核以捕获丰富的多尺度机械故障信息;自适应软阈值去噪(ASTD)动态消除通道特征中的噪声干扰;能量—熵比通道加权则自适应突出与故障更加相关的频带。随后,可解释特征提取层利用传统卷积的稀疏交互特性,通过稀疏表示解释卷积的内在数学含义。最后,可解释结果分析层利用注意力权重和输出特征对模型结果进行可视化,帮助用户理解模型决策过程并提高对诊断结果的信任。论文通过公开故障数据集和工业机器人实验平台验证了所提方法的有效性,结果表明该模型具有良好的可解释性、合理的网络结构和较强的诊断性能。
一、研究背景与核心问题
旋转机械智能故障诊断现在并不缺“准确率很高”的深度网络,真正困难的是另一个问题:
模型为什么判断这里发生了轴承、齿轮或者谐波减速器故障?
CNN、Transformer 等模型可以直接从振动信号中学习故障特征,但卷积核到底学习了什么、网络为什么关注某一段波形、不同频带为什么被赋予不同重要性,通常并不清楚。
已有可解释方法大体有两条路线。
一类是 CAM、Grad-CAM、SHAP、LIME 等模型无关或后验解释方法。优点是简单直观,但主要解释最终预测结果,并没有真正打开网络内部的“黑箱”。
另一类是把物理模型、故障先验、信号处理知识直接嵌入网络。它的解释性更自然,但又容易受到具体机械结构、专家经验和物理模型准确度的限制。论文 Table 1 对这两类路线进行了系统梳理。

这篇论文主要想解决三个问题:
-
单一小波基难以适配不同类型、不同工况下的故障信号;
-
工业振动信号噪声复杂,传统固定阈值难以自适应去噪;
-
即使输入层使用了可解释小波,后续普通卷积和最终决策仍然存在黑箱问题。
作者因此提出 IADC-Net,希望把解释性贯穿整个诊断过程,而不仅仅是在最后画一张热力图。
其核心思路可以概括成:多小波表征、自适应去噪、故障相关通道加权、稀疏表示解释卷积、可视化解释决策
二、IADC-Net 整体框架:解释性贯穿整个网络

论文 Figure 8:IADC-Net 整体可解释故障诊断框架
Figure 8 是全文最重要的总体框架图。
IADC-Net 从数据流上分为:
-
输入信号层;
-
信号处理层;
-
特征提取层;
-
状态分类层。
但从“可解释性”角度,作者实际上建立了三层解释框架:
2.1 可解释信号处理层
核心是 Adaptive Fusion Denoising Wavelet Convolution,AFDWC,内部又包含:
-
Fusion Wavelet Convolution;
-
Adaptive Soft Threshold Denoising,ASTD;
-
Energy-Entropy Ratio Channel Weighting。
它负责回答:
网络最开始是如何处理原始振动信号的?
这些操作分别对应传统信号处理中的小波分析、阈值去噪和统计特征评价,因此每一步都有明确含义。
2.2 可解释特征提取层
这里仍然使用普通 CNN,但作者从卷积稀疏编码角度重新解释卷积运算:
卷积核可以理解成稀疏字典中的原子,卷积得到的 Feature Map 可以理解成稀疏系数。
这样就试图给传统卷积层建立一条数学解释路径。
2.3 可解释结果分析层
最后使用:
-
Grad-CAM 注意力可视化;
-
中间输出 Feature Map 可视化;
检查模型真正关注的波形区域是否与机械故障机理一致。
因此 IADC-Net 的解释逻辑并不是只做 Post-hoc Visualization,而是:
也就是既解释网络为什么这样设计,又解释网络最终为什么这样判断。
三、AFDWC:多小波 + 自适应去噪 + 通道筛选

论文 Figure 1:AFDWC 模块
Figure 1 给出了 AFDWC 的完整流程,真正值得看的不是模块数量,而是三个模块分别针对三个不同的问题。
3.1 Fusion Wavelet Convolution:为什么要融合三种小波?
普通小波卷积可以写成:
这里:
-
(x) 是输入振动信号;
-
(
) 是第 (c) 个通道中的可学习小波核;
-
(W) 是对应小波系数。
与普通 CNN 随机学习卷积核不同,小波卷积核具有明确的尺度、平移以及频率含义。
但问题是:
一种小波不可能同时最适合所有机械故障。

因此 Figure 2 中,作者将 Laplace、Mexhat 和 Morlet 三类小波一起使用。
它们分别对应不同故障结构:
-
Laplace:更适合衰减振荡;
-
Mexhat:擅长局部冲击脉冲;
-
Morlet:对周期振动更加敏感。
旋转机械信号本身往往同时包含衰减振荡、冲击、周期成分以及背景噪声,因此三者融合可以得到更加全面的多尺度特征。这里的关键并不是“多放几个卷积核”,而是不同Wavelet\ Basis对应不同机械故障形态,因此特征提取本身就是可解释的。
3.2 ASTD:每个通道自己学习去噪阈值

论文 Figure 4:Adaptive Soft Threshold Denoising
传统软阈值的思想很简单:
-
小于阈值的低幅值成分直接置零;
-
大于阈值的成分向零收缩;
-
从而滤除大量低幅值噪声。
但固定阈值的问题是,不同小波通道的信号分布和噪声强度完全不同。
因此作者定义每个通道自己的阈值:
其中:
-
(
) 是第 (c) 个通道的小波系数;
-
(
) 由 FC-ReLU-BN-FC 和 Sigmoid 自适应产生;
-
(
) 是最终通道阈值。
作者还引入可学习偏置 (Bc),将传统的对称区间:
改为可移动区间:
这是因为真实机械振动受到退化状态和传感器方向影响,正负振幅并不一定完全对称。
于是 ASTD 实际在学习:
这个通道噪声有多强,以及阈值区间应该向哪边移动。
这样就把传统人工设定去噪参数,改造成了一个以最终诊断目标驱动的端到端自适应过程。
3.3 Energy-Entropy Ratio:哪些通道真的与故障相关?
多小波融合以后带来另一个问题:
特征更多了,但不是所有频带都同样重要。
作者使用信号能量与熵进行筛选。
对于第 (c) 个通道:
直观理解:
-
故障冲击明显 → Energy 增大;
-
周期结构更加突出 → 随机性降低,Entropy 相对减小;
-
所以与故障关系越密切的通道,Energy-Entropy Ratio 往往越大。
再经过 Sigmoid 和归一化获得:
最后进行残差式加权:
![]()
因此这里不是普通的黑箱 Attention,而是给注意力权重附加了明确的信号统计解释。
作者还在 Figure 6、Figure 7 中做了模拟验证:向 48 个通道中的第 1、2 通道人为加入故障冲击后,这两个通道最终得到 1.00 和 0.83 的较高权重,说明该机制确实能够识别故障敏感特征。
四、普通卷积怎么解释?作者用稀疏表示建立数学联系
这一部分是 IADC-Net 与普通“小波 CNN”比较不同的地方。

论文 Figure 9:基于 Sparse Representation 的卷积解释
单层稀疏表示可以写成:
其中:
-
(x):原始振动信号;
-
(D):Sparse Dictionary;
-
(
):Sparse Code。
而卷积过程可以写成:
论文认为:
-
(
) 可以理解成由卷积核构成的卷积矩阵;
-
(
) 就是卷积得到的 Feature。
因此:
卷积核学习,本质上可以理解为学习一个用于匹配局部故障模式的稀疏字典。
多层 CNN 则对应多层 Sparse Coding:
前向传播不断求取多层稀疏特征,反向传播则更新卷积字典。

Figure 21 又用 CWRU 外圈故障样本做了实例验证:直接从网络中取出真实输入、第二卷积层卷积核和输出特征,构造 Sparse Dictionary 后,可以得到与卷积输出一致的结果,并进一步进行输入信号重构。
所以作者不是把传统 CNN 换掉,而是试图回答:
已经广泛使用的普通卷积究竟可以从什么数学角度理解?
这一点使整个网络的解释路径从输入层继续延伸到了 Feature Extraction Layer。
五、实验结果与消融分析
5.1 四个数据集:三个公开数据集 + 一个真实机器人平台
论文没有只在轴承数据集上测试。
Tables 2~5 对应四个数据集:
| 数据集 | 对象 | 类别 |
|---|---|---|
| D1 | CWRU Bearing | 10 |
| D2 | Jiangnan University Bearing | 4 |
| D3 | WT Planetary Gearbox | 5 |
| D4 | Industrial Robot Harmonic Reducer | 4 |
D4 是作者自行搭建的工业机器人实验平台。

论文 Figure 10:工业机器人故障实验平台
实验对象为 HSR-BR609 工业机器人,振动采样频率 128 kHz,包含:
-
Healthy;
-
Flexspline rupture;
-
Gear wearing;
-
Flexspline rupture + Gear wearing。
每类 500 个样本,共 2000 个。四个数据集均按 6:2:2 划分训练、验证和测试集。
5.2 Table 6 + Figures 12、13:基础诊断效果

Figure 12:Confusion Matrix
IADC-Net 在四个数据集上的结果为:
| Dataset | Accuracy | Precision | Recall | F1 |
|---|---|---|---|---|
| D1 | 100% | 100% | 100% | 100% |
| D2 | 100% | 100% | 100% | 100% |
| D3 | 100% | 100% | 100% | 100% |
| D4 | 90.00% | 91.15% | 90.75% | 90.68% |
三个标准实验数据集几乎完全可分,但真正值得注意的是 D4。
工业机器人数据中的环境噪声更复杂,而且存在复合故障,所以准确率下降到 90%。Figure 13 的 t-SNE 同样显示 D1~D3 类间边界非常清楚,而 D4 中复合故障存在更明显的重叠。
因此这里不能只看“前三个数据集 100%”,D4 才更能体现实际工程条件下的难度。
5.3 Table 7:AFDWC 的三个模块分别有什么作用?

这是全文最重要的消融实验。
Traditional CNN 在四个数据集上的准确率只有:
-
D1:74.67%
-
D2:81.56%
-
D3:98.50%
-
D4:61.17%
单小波 WCNN 明显依赖小波类型。例如:
-
D1 中 Laplace 达到 99.26%;
-
D2 中 Morlet 达到 92.84%;
-
D4 中 Morlet 达到 87.09%。
这恰好证明:
不存在一种 Wavelet Basis 能在所有数据集上始终最好。
三小波融合以后,Laplace + Mexhat + Morlet 在 D2 达到 99.62%,D4 达到 87.75%。
继续加入 ASTD 后,FWD-Net 的 D4 提升至 88.06%;
加入通道加权后,FWW-Net 达到 88.50%;
最后三者全部组合成 IADC-Net。
所以这组消融不是简单说明“模块都有效”,而是在解释模块分工:
-
Fusion Wavelet:解决不同故障与不同小波匹配的问题;
-
ASTD:负责抑制噪声;
-
Energy-Entropy Weighting:从融合特征中进一步突出故障敏感通道。
5.4 Table 8 + Figure 14:ASTD 的抗噪能力
作者进一步人为加入 4、2、0、−2、−4 dB 的 Gaussian White Noise。


Figure 14:不同 SNR 下的含噪振动信号
Table 8 将 ASTD 与传统 Soft Threshold Denoising(STD)以及 Hard Threshold / ReLU(HTD)比较。
以最强噪声 −4 dB 为例,Table 8 中 ASTD 准确率分别达到:
-
D1:79.00%
-
D2:58.50%
-
D3:91.10%
-
D4:64.00%
对应 STD 为:
-
77.00%
-
56.65%
-
85.90%
-
61.25%
HTD 则为:
-
70.50%
-
57.19%
-
81.70%
-
59.50%
可以看到,随着噪声增强,各方法性能都会下降,但在 −4 dB 强噪声下 ASTD 在四个数据集上均保持最高准确率,说明动态通道阈值确实改善了强噪声条件下的鲁棒性。
5.5 Tables 9~11:准确率高的同时,模型并不大

Table 9 与 LeNet、AlexNet、ResNet18 进行统一实验。
IADC-Net 参数量只有:0.17M,FLOPs:1.24B
而:
-
AlexNet:3.41M,13.93B FLOPs;
-
ResNet18:3.85M,11.49B FLOPs。
IADC-Net 在 D4 上达到 90.00%,而 LeNet、AlexNet、ResNet18 分别为 84.50%、84.33%、85.25%。需要说明的是,LeNet 参数和训练时间仍然更小,因此 IADC-Net 的优势是准确率、复杂度和解释性之间的折中,而不是绝对最轻量。

Table 10 又加入 SVM、CNN-Attention、WDCNN、CNN-Transformer、Liconvformer、TON、WaveletKernelNet、MWKCNN 等方法。
其中 IADC-Net 在 D1~D3 均达到 100%,D4 为 90%;Liconvformer 在 D4 同样达到 90%,因此并不能简单写成“四个任务全部绝对领先”。不过综合 D1~D4、参数量与解释框架来看,论文结果仍具有明显竞争力。

Table 11 再与近期文献中公开的最佳结果比较,在 D1、D2、D3 上 IADC-Net 均为 100%,高于表中列出的对应参考方法。
5.6 Figures 17~23:作者怎么证明“可解释”?
这一部分其实是论文后半部分最重要的证据链。
Figure 17:小波核训练前后。
训练后参数发生调整,但 Laplace、Mexhat、Morlet 原有的物理波形结构仍然保留,说明网络不是把小波核训练成完全无法解释的任意卷积核。
Figure 18:故障频率分析。
CWRU 中理论故障频率分别为:
-
BSF:70.59 Hz;
-
BPFI:162.18 Hz;
-
BPFO:107.37 Hz。
三个小波处理后的包络谱峰值与理论故障频率及其谐波对应较好。工业机器人数据中还识别出 Gear Wearing 约 200 Hz、Compound Fault 约 300 Hz 的明显特征。
Figure 19:ASTD 前后波形。
低幅值成分被明显削弱,而较大的正向特征和负向冲击仍得到保留,直观对应其“去噪但保留局部奇异性”的设计目标。

Table 12 + Figure 20:Cross-validation 与 Channel Weight。
三种数据划分下 D1~D3 基本保持 99.5%~100%,D4 为 90.00%、91.03%、90.52%;同时三次实验学习到的通道权重分布较为一致,说明加权机制具有一定稳定性。


Figure 21:Sparse Representation 验证。
真实卷积输出可以由构造出的卷积稀疏字典复现,并进一步完成输入重构,用实例支持前面的卷积—稀疏表示解释。

Figure 22:Grad-CAM。
不同故障产生不同注意力模式。例如内圈故障更关注周期冲击,外圈故障更多聚焦较大脉冲峰,齿轮磨损注意力也呈明显周期性。对于 CWRU,理论故障周期约为 0.0334 s,大多数高注意力区域与理论周期具有对应关系。

Figure 23:Feature Map。
经过网络以后,数据量明显减少,但冲击特征仍得到保留,而且多通道特征图中的能量更加集中、背景噪声更弱。

六、总结与思考
如果把这篇论文压缩成一句话:
IADC-Net 的核心不是单纯设计一个更高准确率的故障诊断 CNN,而是把小波分析、自适应去噪、信号统计、稀疏表示和可视化解释串成一条完整的“信号输入—特征提取—分类决策”解释路径。
不过作者也明确指出,目前 IADC-Net 仍然没有彻底解决“黑箱”问题:最终分类决策的一部分解释仍依赖 Grad-CAM 等可视化工具,内部完整决策逻辑并非完全透明;同时整个可解释故障诊断领域尚缺少统一、可量化的解释性评价指标。
因此,从方法设定上看,这篇论文真正值得借鉴的研究思路是:
与其在模型训练完成以后再解释一个黑箱,不如从网络设计阶段就让每个关键模块尽可能对应一个已有的信号处理或数学概念。
这也是 IADC-Net 相比普通“高准确率故障诊断网络”更有价值的部分。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐




所有评论(0)