2025年华为杯研究生数学建模竞赛E题完整论文全网首发


高速列车轴承智能故障诊断问题
在轴承故障诊断的研究中,混合采样率的信号处理和迁移学习的应用为提高诊断精度和模型鲁棒性提供了新的方向。本项目旨在利用不同采样率的振动信号进行特征提取,并通过多种机器学习模型和迁移学习方法,提升故障诊断的准确性和可解释性。
首先,本项目从源域数据集中提取了混合采样率(12kHz与48kHz)的轴承振动信号特征,包括时域、频域和时频域特征。这些特征为后续的故障诊断和健康监测提供了全面的信息。在数据预处理阶段,采用了分层抽样方法,确保源域数据集的每个故障类别在训练集和测试集中均能得到充分代表。多个机器学习模型(如随机森林、支持向量机、梯度提升和多层感知器)被用来进行故障诊断,并通过准确率、精确率、召回率、F1分数和AUC等指标评估模型性能。
在迁移诊断阶段,加载了训练好的源域随机森林模型,通过MMD距离、统计差异分析和分布重叠度计算等方法分析源域与目标域的特征差异,并实施了多策略域适应,包括CORAL二阶统计量对齐、批归一化域适应和基于特征稳定性的特征选择。最终,采用软投票机制集成多个迁移模型的预测结果,对低置信度样本进行二次优化,并通过可视化技术展示迁移学习的效果。
针对迁移诊断的可解释性分析,本项目分为事前、迁移过程和事后三个层面进行提升。事前分析通过决策树规则提取和特征重要性分析理解关键诊断特征;迁移过程分析利用PCA/t-SNE可视化域间分布差异;事后分析通过排列重要性和故障机理解释验证特征的物理意义和模型决策依据。此全过程结合轴承故障机理,增强了对跨工况诊断结果的理解与信任。
关键词:轴承故障诊断,混合采样率,特征提取,迁移学习,RandomForest,机器学习,域适应,PCA,t-SNE,特征选择
一、模型假设
为了方便模型的建立与模型的可行性,我们这里首先对模型提出一些假设,使得模型更加完备,预测的结果更加合理。
1.假设给出的数据均为真实数据,真实有效;
2.假设模型使用的特征能够充分反映实际问题;
3.假设目标域与源域在一定程度上具有相似性;
4.假设所有设备都已按照相同标准进行维护与操作;
5.假设模型所需的计算资源足够支持实时预测和在线更新;
6.假设模型输出的预测结果能够为决策提供有效支持;
假设模型的迁移学习过程可以消除源域与目标域之间的差异。
一、问题求解与分析
4.1 问题1求解与分析
4.1.1 问题1分析
针对问题1,要求我们建立混合采样率的轴承振动信号特征提取系统,从源域数据集(包含12kHz和48kHz两种采样率)进行数据的筛选、信号的重采样、特征的提取等,提取统一的故障诊断特征,涵盖了时域、频域以及时频域的多种特征,能够为后续的故障诊断或健康监测模型提供全面的信息。售后群不定时进行修正,倒卖资料根本不可能完整无误的传递(二手贩子连题目都看不懂,你难道指着他完整的给你复述售后群的内容嘛)
4.1.2 问题1建模与求解
4.1.2.2数据预处理与数据统计分析
问题1要求组成数据集,在组成数据集之前,先检查缺失值,处理异常值,由于类别间数据量级差异导致不能直接使用IQR分数法进行异常值的剔除,那可可以在同类样本内进行比较,避免不同类别间数量级差异的影响。首先对数据集Normal、OR、IR、B进行分类,分别剔除其异常值。由于Normal数据集样本个数较小,因此选择每类最大移除比例10%,尽可能让Normal值不要太小。
表1 异常值处理情况

表1异常值处理统计表详细记录了数据预处理的完整过程和效果。原始数据集包含116个文件,其中48kHz文件56个,12kHz文件60个,体现了多采样率数据融合策略。经过特征提取后获得10,937个样本,其中Normal类别450个,OR类别5,097个,IR类别2,674个,B类别2,716个,显示出明显的类别不平衡现象。通过分类别异常值处理,每个类别均移除10%的异常样本,总计移除1,092个异常样本,最终保留9,845个高质量样本。这种分类别处理策略有效避免了传统异常值检测可能过度删除小样本类别(如Normal)的问题,确保了各故障类型都保持足够的样本数量。10%的移除率既保证了数据质量的提升,又避免了过度删除导致的信息损失,为后续的机器学习模型训练提供了均衡且可靠的数据基础。
表2 目标类型分配
|
故障类型 |
样本数 |
占比 |
主要来源 |
|
OR(外圈故障) |
4,588 |
46.6% |
12kHz+48kHz DE数据 |
|
B(滚动体故障) |
2445 |
24.8% |
12kHz+48kHz DE数据 |
|
IR(内圈故障) |
2407 |
24.4% |
12kHz+48kHz DE数据 |
|
Normal(正常) |
405 |
4.1% |
48kHz Normal数据 |
表2展示了目标域数据的类型分布情况,其中外圈故障(OR)样本数量最多,占比46.6%,占据近半数;滚动体故障(B)和内圈故障(IR)分别占24.8%和24.4%,数量相当;正常状态(Normal)样本最少,仅占4.1%。所有故障数据均来自12kHz和48kHz采样率的DE通道数据,而正常数据仅来源于48kHz采样率的Normal数据,体现了数据集在故障类型和采样率来源上的不均衡分布特征。

图1特征分布直方图清晰地展现了不同故障类型在关键特征上的分布差异。从DE_rms特征可以看出,Normal状态的样本主要集中在较小的数值范围内,而故障状态(OR、IR、B)则显示出更大的振动幅度。DE_kurtosis和DE_peak特征显示故障类型具有更宽泛的分布范围,表明故障信号的冲击性和非平稳性特征。DE_spectral_centroid特征显示Normal状态集中在较高频率区域,而故障状态分布更加分散。DE_BPFO_amplitude和DE_BPFI_amplitude等故障特征频率幅值在故障类型中明显高于正常状态,这验证了基于轴承理论计算的故障特征频率的有效性。整体而言,各特征在不同故障类型间呈现出良好的可分性,为后续的故障分类提供了坚实的特征基础。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)