论文题目:Denoising Diffusion Implicit Model Combined with TransNet for Rolling Bearing Fault Diagnosis Under Imbalanced Data(非平衡数据下滚动轴承故障诊断的去噪扩散隐式模型与传输网相结合)
情况:Sensors 2024
摘要:数据不平衡是智能故障诊断的一个严重问题。它们可能会导致诊断精度降低,从而危及设备的可靠性和安全性。在此基础上,提出了一种将去噪扩散隐式模型与卷积神经网络结构相结合的故障诊断方法。首先,使用格拉米亚角度差场(GADF)生成2D图像,然后使用ddim对其进行增强。然后,利用卷积神经网络的权值分担特性和自注意机制,以及变压器的全局数据处理能力,构建了Transnet模型。将增强后的数据输入到模型中进行训练,以建立故障诊断框架。最后,利用CWRU轴承数据集和南昌铁路局数据集对该方法进行了验证和分析。实验结果表明,该方法在两个数据集上的识别率均达到99%以上。同时,与现有的故障诊断方法相比,该模型具有更好的泛化性能和识别精度。
DDIM + TransNet:用扩散模型解决轴承故障诊断中的数据不平衡难题
一、引言:轴承故障诊断,卡在哪里?
滚动轴承是旋转机械中的核心部件,广泛应用于车辆、航空航天、CNC机床、机电设备和精密仪器等各类场景。它被誉为"工业的关节",其健康状态直接关系到整台设备的性能与安全。轴承一旦出现故障,往往引发异常振动和冲击,威胁设备的安全性和生产效率。因此,及时、准确地识别轴承故障,对于预防事故、提升运营效率具有重要意义。
随着深度学习(DL)的快速发展,其在轴承故障诊断中的应用日益广泛。CNN、LSTM、DBN、RNN等模型能够从采集数据中自动提取特征,显著提升了故障诊断的效率与准确性。然而,这些智能诊断方法普遍依赖充足的有标签故障数据——而现实情况是,机械设备绝大多数时间运行在正常状态,故障样本极难获取。
这就导致了一个核心矛盾:正常样本充足,故障样本稀缺,数据严重不平衡。
数据不平衡会直接抑制深度学习模型的精度和泛化能力,成为智能故障诊断落地应用的最大阻碍之一。
本文正是针对这一问题,提出了一套结合去噪扩散隐式模型(DDIM)与TransNet网络的新型轴承故障诊断框架。
二、现有方法的不足
2.1 GAN类数据增强的固有缺陷
数据增强是解决数据不平衡问题的有效手段,而生成对抗网络(GAN)是目前最广泛使用的数据增强模型。然而GAN存在一系列难以根治的问题:
- 训练不稳定:生成器与判别器的对抗博弈天然引入不稳定性,易出现梯度消失和模式崩溃(pattern collapse)
- 参数难以调优:生成器和判别器的参数需要精细平衡,任何一方过强都可能导致训练失败甚至无法收敛
- 可解释性差:GAN通过复杂对抗过程训练,其内部机制和生成过程难以解释
Wasserstein GAN(WGAN)虽然用Wasserstein距离替换JS散度,在理论上缓解了训练不稳定问题,但在实践中仍存在收敛问题和样本质量不稳定的情况。基于梯度惩罚的改进版(WGAN-GP)进一步提升了模型稳定性,但上述根本性缺陷并未完全消除。
2.2 单一CNN模型特征捕获能力有限
以ResNet50、ResNet101、VGG16为代表的CNN模型,虽然在局部特征提取方面表现出色,但缺乏对全局上下文信息的建模能力,对复杂故障特征的区分能力有限,在小样本、不平衡数据条件下泛化性能不足。
三、本文提出的方法框架
本文提出的整体方法由三个关键技术组成:GADF信号转图像→DDIM数据增强→TransNet故障分类。
Figure 2:基于TransNet的故障诊断流程图(从振动信号采集 → GADF预处理 → DDIM数据扩增 → TransNet训练 → 输出诊断结果的完整流程)
整体流程如下:首先对轴承振动信号进行归一化预处理,消除信号的量纲差异;接着通过GADF将一维时序信号转换为二维图像;然后按一定比例划分训练集与测试集,对训练集使用DDIM进行数据扩增;最后将扩增后的图像数据输入TransNet进行训练,保存最优模型参数,并在测试集上输出故障诊断结果。
3.1 GADF:让振动信号"变成图片"
Gramian角差场(GADF)是将一维时序数据转换为二维图像的有效方法,能够在保留原始信号完整信息的同时,有效维持时序数据的时间依赖性。
Figure 3:原始振动信号 → 极坐标编码 → Gramian角差场图像的转换过程示意图
转换过程分三步:
第一步:归一化。对时间序列进行均值归一化,将序列值缩放到
区间:
第二步:极坐标编码。将归一化后的时序数据表示为极坐标形式:
其中为编码角度的余弦,r 为保持时间依赖性的半径,N 为正则化系数。整个编码过程是双射的,保证了信息的完整性。
第三步:生成Gramian角差场矩阵。通过内积运算生成二维Gramian矩阵:
GADF的优势在于:将一维振动信号转化为二维图像后,CNN能够从局部到全局提取多尺度特征(从细微边缘、纹理到整体模式),还能直接捕获信号的时频特性和相邻数据点的空间相关性,从而有效提升故障诊断精度。
3.2 DDIM:稳定高效的数据增强
去噪扩散隐式模型(DDIM)是在去噪扩散概率模型(DDPM)基础上改进而来的先进生成模型,在保持生成质量的同时,大幅提升了生成效率。
前向扩散过程:逐步向原始信号添加高斯噪声,直至信号变为纯随机噪声。在时间步 $t$ 的条件概率分布为:
其中控制每步添加的噪声量。定义累积噪声系数
,DDIM通过直接组合原始信号与随机噪声(而非递归计算)简化了计算过程,使其不再是马尔科夫过程:
反向生成过程:从随机噪声出发,逐步去噪,恢复接近原始数据
的信号。该过程是确定性的:
其中是去噪模型预测的噪声。模型通过最小化预测噪声与真实噪声之间的差异来训练:
相比GAN,DDIM具有更坚实的理论基础,训练过程更稳定,无需在生成器与判别器之间寻求脆弱的平衡,且生成的样本能够保留故障特征的多样性,有助于模型更好地适应不同类型的故障。
3.3 TransNet:CNN与Transformer的有机融合
TransNet是本文提出的核心分类网络,由三个主要模块组成:CNN卷积块、Transformer编码器、分类器。
Figure 1:TransNet模型整体架构图(输入图像 → ResNet50卷积层 → Class Token拼接 → 6层Transformer编码器 → 分类输出)
(1)CNN卷积块:ResNet50骨干网络
以ResNet50为骨干网络,包含5组残差块(Conv2_x到Conv5_x),输出形状从 (112, 112, 64) 逐步压缩到 (7, 7, 2048),参数量共约2358万(详见下方参数表)。卷积层负责提取丰富的局部多尺度特征,从底层的边缘、纹理到高层的故障模式。
Table 1:TransNet架构各层参数汇总表(各层组名称、输出形状、参数量)
(2)Class Token层
在ResNet50输出之后,引入一个特殊设计的Class Token层,将全局上下文信息链接到局部特征表示中,为后续Transformer编码器提供全局感知能力,这一设计借鉴自ViT架构的核心思想。
(3)Transformer编码器:6层全局建模
核心由6层Transformer编码器叠加而成,参数量高达约3.1亿。每层编码器包含:
多头自注意力机制:同时关注序列中不同位置的信息,捕获全局上下文依赖:
前馈神经网络(FFN):对每个位置向量进行相同的非线性变换,使用GELU激活函数:
残差连接与层归一化:保证深层网络的稳定训练
(4)分类器
最终经过一个全连接Dense层(输出维度为故障类别数,参数量40907)输出故障诊断结果。
TransNet的核心优势在于:CNN负责提取丰富的局部多尺度特征,Transformer编码器负责建模全局上下文依赖,两者互补,显著增强了图像分类系统的鲁棒性和泛化能力。
四、实验验证
4.1 实验设置
硬件环境:AMD Ryzen 7 3700X CPU,32 GB RAM,NVIDIA GeForce RTX 2080Ti GPU
软件环境:TensorFlow-GPU 2.6.0
训练配置:
- 优化器:Adam,初始学习率0.0001
- 学习率调度:余弦衰减,每10000步执行一次,提升训练稳定性和收敛速度
- 混合精度训练,降低计算开销
- 每个实验独立重复10次,取平均结果以消除随机性影响
4.2 案例一:CWRU轴承数据集
数据集介绍: 实验数据来自凯斯西储大学(CWRU)轴承数据中心的驱动端加速度数据集。测试台由电机、扭矩编码器、功率计和控制电子设备构成,采样频率12 kHz,转速1797 r/min。数据集包含三类故障:滚动元件故障、外圈故障、内圈故障,故障尺寸分为0.007 in、0.014 in、0.021 in三级,共形成9种故障类型加1种正常状态,合计10类。
Figure 4:CWRU数据集部分图像数据示例(左侧为GADF转换后的原始振动信号图像B021和IR021,右侧为经DDIM扩增后的对应图像)
数据划分:每类振动信号转换为300个GADF图像样本,按4:1比例划分训练集(240个)和验证集(60个),测试集独立取60个;用DDIM将训练集从240个扩增至540个,正常类原始数据充足,直接保持540个。
Table 2:CWRU轴承数据集样本构成详细表(故障类型、故障尺寸、原始训练集、扩增后训练集、测试集、标签)
训练结果:
Figure 5:TransNet在CWRU数据集上50轮训练的准确率变化曲线(训练集与验证集准确率随epoch的变化趋势)
如图所示,在前5个训练周期内,模型训练准确率和验证准确率均快速提升,体现了模型强大的特征学习能力。随着训练推进,两者均稳定趋近于1.0,充分证明了TransNet在训练和验证阶段均具备出色的分类性能。
测试集结果:
Figure 6:Case 1的T-SNE聚类可视化图(10类故障在二维空间中的聚类分布,大部分类别形成清晰簇群)
通过T-SNE特征可视化进一步分析模型的特征提取能力。从图中可以看出,绝大多数类别在二维空间中形成清晰的聚类簇群,说明模型具有强大的特征提取和类别区分能力,尤其在区分正常类别与故障类别方面表现突出。仅有B2和B4的极少数样本出现误分类,这是由于这两类故障对应振动信号转换为GADF图像后特征高度相似。
对比实验:
Figure 7:Case 1中TransNet与ResNet50、ResNet101、VGG16的混淆矩阵对比图((a) TransNet;(b) ResNet50;(c) ResNet101;(d) VGG16)
Figure 8:Case 1中各方法精确率、召回率、F1分数的均值对比柱状图
与ResNet50、ResNet101、VGG16的对比结果清晰呈现了TransNet的优势:
- TransNet:B3、B5、B6、B8、B9五类达到100%正确分类,总体识别准确率超过99%,精确率、召回率、F1分数均优于其他方法
- ResNet50:B0类仅93%,B2类仅90%,部分故障类别混淆严重
- VGG16:B0类仅58%,分类效果最差,多个类别存在较大误差
TransNet的分类效果全面优于其他对比模型,所有评估指标均取得更好的分数,进一步验证了本文方法在轴承故障诊断中的优越性和有效性。
4.3 案例二:南昌铁路局机车轴承数据集
数据集介绍: 实验数据来源于南昌铁路局机车段真实机车轴承测试台(如下图所示)。测试台主要由主轴箱、液压系统、电气系统和台体构成。电源为380 V、50 Hz三相四线制交流电,总电机驱动功率5 kW,测试转速设定为500 rpm。被测轴承为NJ2232WB系列圆柱滚子轴承,内径160 mm,外径290 mm,使用三个加速度传感器(A、B、C)以20 kHz采样频率采集振动信号。
Figure 9:南昌铁路局机车轴承测试台实物图(标注有主轴箱、传感器A/B/C、轴承等关键部件)
传感器B采集的数据包含7类状态:正常轴承(C6)、3种不同程度内圈故障(C0/C1/C2,尺寸4/7/19 mm)、2种不同程度外圈故障(C3/C4,尺寸7/19 mm)和1种滚动元件故障(C5,尺寸4 mm)。
数据划分:每类原始训练集720个样本,经DDIM扩增至1620个;正常类原始数据直接为1620个;测试集每类180个。
Table 3:南昌铁路局机车轴承数据集样本构成详细表(故障类型、故障尺寸、原始训练集、扩增后训练集、测试集、标签)
训练结果:
Figure 10:TransNet在南昌铁路局数据集上的识别准确率变化曲线(训练集准确率迅速趋近1.0,验证集在轻微波动后维持高水平)
训练集准确率随轮次增加快速趋近于1.0,验证集准确率在轻微波动后同样保持高水平,表明模型在训练数据上表现出色的同时,在验证集上也具备良好的泛化能力。DDIM数据扩增在此数据集上同样有效地提升了样本数量,增强了模型的学习能力。
测试集结果:
Figure 11:Case 2的T-SNE聚类效果图(7类故障/正常在二维空间中的聚类分布)
不同轴承故障类别在二维空间中呈现出清晰的聚类分布,展示了TransNet出色的特征提取性能。特别是正常类(C0)与故障类别之间的区分更加清晰,表明模型能够有效识别不同状态下的轴承信号。个别类别(如C6)的样本分布略显分散,说明部分类别之间的特征相似度较高,可能导致分类混淆。
对比实验:
Figure 12:Case 2中TransNet与ResNet50、ResNet101、VGG16的混淆矩阵对比图((a) TransNet;(b) ResNet50;(c) ResNet101;(d) VGG16)
Figure 13:Case 2中各方法精确率、召回率、F1分数均值对比柱状图
从混淆矩阵可以看出,TransNet的对角线元素主导矩阵,所有类别的分类准确率均达到或超过98%:
- TransNet:所有7类中最低准确率为98%(C6),多数类别达到99%,整体识别准确率超过99%
- ResNet50:C0类仅84%,C2类仅82%,C4类仅86%,多个类别存在明显误分类
- ResNet101:C6类仅88%,整体性能弱于TransNet
- VGG16:C0类仅93%,C1类仅83%,C6类仅87%,各类指标明显落后
TransNet的整体分类效果远优于其他对比模型,在所有评估指标上均取得最佳分数,充分验证了本文方法在真实工业场景下轴承故障诊断的有效性和优越性。
五、总结与展望
本文提出的DDIM + TransNet轴承故障诊断框架,通过三项关键技术的协同配合,系统性地解决了故障诊断中数据不平衡和特征提取能力不足两大核心难题。
主要贡献总结:
信号表征创新:GADF将一维振动信号转化为携带丰富时频信息和空间相关性的二维图像,为后续图像处理技术的应用奠定了基础
数据增强有效性:DDIM提供了比GAN更稳定、更高质量的数据扩增方案。CWRU数据集每类样本从240扩增至540个,南昌铁路局数据集从720扩增至1620个,有效缓解了样本不平衡和小样本问题
模型架构优势:TransNet融合CNN的局部多尺度特征提取与Transformer的全局上下文建模,在两个数据集上均实现了超过99%的识别准确率,全面优于ResNet50、ResNet101和VGG16等基线模型
局限性与未来方向:
本文主要关注单一工况下的故障诊断,未来研究将探索更复杂的应用场景,包括变负载和跨设备诊断,以为工业设备健康管理与维护提供更强有力的支撑。此外,未来工作也将在数据驱动研究的基础上,进一步分析轴承故障特征背后的物理机制,推动轴承故障诊断研究的深化。