☰
(论文速读)VibFM:让 Transformer 学会“振动语言”的自监督基础模型
2026/10/9 13:56:11 网站建设 项目流程

论文题目:Learning the Language of Vibration: A Self-Supervised Transformer Foundation Model for PHM(学习振动的语言:面向 PHM 的自监督 Transformer 基础模型)

会议:European Conference of the Prognostics and Health Management Society 2026

摘要:工业预测与健康管理(PHM)越来越依赖基于振动信号的深度学习,但现场部署仍受到两个实际约束:一是故障标签稀缺且获取成本高,二是在一台机器或一个数据集上训练的模型面对不同传感器、采样率、负载和信号规范等分布偏移时,性能往往下降。这推动了振动基础模型的发展:在大规模无标签原始振动数据上一次训练可复用编码器,再以很少的监督适配新设备。本文提出 VibFM,一种通过自监督掩码频谱建模训练的 Transformer 编码器,其思路类似掩码语言模型和 Masked Autoencoder。来自 16 个开放数据集、总计约 400 小时的原始波形被标准化为 128 × 128 的对数幅值 STFT 频谱图,并附加包含采样率及时频分辨率的紧凑条件向量。预训练通过重建被遮挡的时频 Patch,促使编码器学习可迁移的振动基本模式,例如持续窄带脊、调制边带和冲击瞬态。迁移性能在预训练阶段完全排除的 Paderborn University / KAt-DataCenter 轴承数据集上评估,并采用避免数据泄漏的 bearing-level 划分。在三分类故障诊断中,冻结 VibFM 特征明显优于从头训练,而端到端微调取得最佳结果;在基于重建的异常检测中,仅使用目标域健康数据适配 Decoder 后,重建误差能够在不同工况下区分健康与损伤状态。论文还通过掩码重建和池化注意力可视化对模型学到的时频结构进行定性检查,并讨论了这些解释方法的局限。

源码:GitHub - SFZ-Uni-Stuttgart/VibFM · GitHub


一、为什么 PHM 也需要 Foundation Model?

传统振动故障诊断通常是“一个数据集训练一个模型”。换一台机器、换一个传感器、改变采样率或者运行负载后,原来的模型往往需要重新训练。问题在于,工业现场真正稀缺的不是振动数据,而是高质量故障标签:正常数据很多,真实损伤事件少,而且不同设备上的故障分布并不一致。

VibFM 的出发点是把 NLP 中“先大规模预训练,再适配下游任务”的思路搬到振动 PHM。作者认为,不同机器的振动虽然来自不同数据分布,但仍共享一些基础“语法”,例如持续窄带结构、调制边带、共振带以及冲击瞬态。如果模型能先从大量无标签信号中学会这些通用结构,到了新设备上就不必从零开始。

本文因此提出一个train once, adapt many times的范式:先用多源无标签振动信号训练通用 Encoder,再通过冻结特征或少量 Fine-tuning 迁移到新任务。这里的重点不是追求语言模型那种参数规模,而是获得能够跨数据集复用的振动表征。

论文 Figure 1:VibFM 整体流程——标准化频谱输入、Masked Pre-training 与下游迁移

Figure 1 是全文最重要的框架图。整个流程可以概括为:

原始振动 → 标准化 STFT → Patch 化 → 掩码重建预训练 → 保留 Encoder → 故障分类 / 异常检测。


二、如何把 16 个完全不同的数据集喂给同一个模型?

VibFM 的预训练语料来自16 个开放数据集、约 400 小时振动数据,覆盖轴承、齿轮箱和风机传动系统,同时包含稳定工况、变速、变负载、现场数据和 Run-to-Failure 数据。Paderborn 下游测试集被完全排除在预训练之外,从而保证后续结果是真正的跨数据集迁移。

论文 Table 6:用于自监督预训练的 16 个开放振动数据集

这里最大的工程问题是:不同数据集的采样率、记录时长、频率范围甚至传感器安装方式都不一样。作者并没有为每个数据集手工设计特征,而是统一使用固定长度时间窗和 STFT。

每段波形先去直流、按窗口做标准化,再根据需要下采样到常用采样率桶。随后计算单边 STFT,使用 12.5 ms Kaiser 窗和 6.25 ms hop,并取对数幅值。最终把不同尺寸的 STFT 双线性插值到统一的128 × 128网格,裁剪到 [-100, 0] dB 后映射到 [0,1]。

论文 Figure 2:来自不同预训练数据集的标准化 128 × 128 STFT 输入

统一尺寸解决了 Transformer 的 Token 数问题,却带来新的歧义:同一个像素位置在不同采样率下对应的真实频率可能完全不同。因此作者额外构造条件向量

其中 () 是采样率,() 和 () 分别表示标准化网格对应的有效频率与时间分辨率,(T) 是时间窗长度。这个向量通过 FiLM 生成缩放与偏移参数,对 Patch embedding 进行调制:

所以模型看到的不只是“一张频谱图”,同时还知道这张图对应什么物理时频尺度。这个设计是 VibFM 在多数据集预训练中非常关键的一点。


三、核心训练方式:把振动频谱当成“有语法的句子”

128 × 128 频谱图被切成 8 × 8 的非重叠 Patch,因此一共得到 16 × 16 = 256 个 Token。每个 Patch 展平后映射为 384 维 embedding,再输入 8 层、8 头的 ViT 风格 Transformer Encoder。

真正的自监督目标很简单:随机遮掉 70% 的 Patch,只让 Encoder 看剩下约 30%,然后要求 Decoder 把被遮挡区域重建出来。

这个机制和 Masked Language Modeling 很像。语言模型看到“今天北京天气很 [MASK]”,必须根据上下文猜词;VibFM 则看到残缺频谱,需要根据剩余窄带脊、边带、冲击与长距离重复结构恢复缺失区域。

预训练阶段的 Decoder 为 4 层、宽度 256、8 个注意力头。损失只计算被遮挡区域,并使用 L1:

70% 的高 Mask Ratio 很重要,因为如果只遮很少区域,模型可能靠局部插值就能完成任务;遮掉大部分 Patch 后,只能依赖更大范围的时频上下文。

论文 Table 1:VibFM 预训练配置与网络超参数

预训练使用 AdamW,global batch size = 128,共训练93 epochs / 192594 update steps。完成预训练后,Decoder 被丢弃,只保留 Encoder 作为可复用的 Foundation Encoder。

Encoder 后接 8 个可学习 latent tokens 做 attention pooling,最终形成两个 256 维 embedding:() 用于后续故障诊断,() 用于描述数据集或采集条件相关的 nuisance variation。当前实验主要依靠重建目标训练,针对二者的显式解耦正则被作为可选设计而不是核心训练项。


四、模型到底学到了什么?从 Attention 看“振动语言”

论文 Figure 3:Pooling Attention Map 对频谱中重要时频区域的可视化

作者没有把 Attention 直接解释成因果证据,而是将它作为一种“审计工具”。Pooling Attention 决定哪些 Patch 最终被送入下游 embedding,因此可以观察模型主要从哪些区域聚合信息。

在多个预训练样本中,注意力会集中到持续的窄带脊、局部瞬态以及冲击相关区域。尤其在 bearing damage 样本中,关注区域明显转向重复出现的宽带瞬态柱,这与轴承损伤常见的冲击型时频结构一致。

但论文非常谨慎地指出:这个注意力图只有 16 × 16 Patch 分辨率,再上采样到 128 × 128,因此不能拿来精确计算过滚冲击次数或故障重复频率;同时 Attention 也不能证明某一区域对最终预测具有因果必要性。它更适合作为“模型是否在看合理东西”的 sanity check。


五、下游迁移:预训练到底有没有用?

作者没有在预训练数据上继续测试,而是选择完全未参与预训练的 Paderborn / KAt-DataCenter 数据集。任务包括健康、外圈故障和内圈故障三分类,以及只用健康数据训练的异常检测。

更重要的是,论文不是随机拆分信号片段,而是使用bearing-level split。每个类别有 5 个 bearing codes,每次 3 个轴承用于训练、2 个用于测试,遍历全部 10 种组合。训练轴承和测试轴承完全不重叠,从而避免模型通过同一物理轴承的重复测量“记住设备身份”。

论文 Table 3:三分类任务所使用的 Bearing Codes 与 Bearing-level 划分

5.1 三分类:Frozen 和 Fine-tuning 都明显优于从头训练

论文 Table 4:Paderborn 三分类主实验结果

从头监督训练相同架构只能达到48.91% Accuracy / 0.481 Macro F1。直接冻结 VibFM Encoder,仅训练一个小型分类头,准确率已经提高到75.12%,Macro F1 达到0.735;如果进行端到端 Fine-tuning,则进一步达到85.52% / 0.854。

这个结果是论文 Foundation Model 论点最核心的证据。因为 Scratch、Frozen 和 Fine-tuning 使用的是同类架构与统一输入,所以 Frozen 明显优于 Scratch,说明提升并非单纯来自模型容量,而是来自多源自监督预训练已经学到了可迁移结构。

Frozen 模式只训练分类 Head 5 epochs;Fine-tuning 同样只训练5 epochs,Encoder 学习率 1e-5,Head 学习率 1e-4。相比之下 Scratch 最多训练 100 epochs。也就是说,这篇论文的卖点不是“预训练后直接零样本分类”,而是让新任务只需非常轻量的监督适配。

论文 Figure 4:Frozen 与 Fine-tuned 的) t-SNE 分布

Frozen Encoder 已经出现一定的健康/内圈/外圈局部聚类;Fine-tuning 后类簇明显更紧、类别边界更清楚。作者同样强调,t-SNE 只能说明局部可分性,不能把类簇之间的几何距离解释成真正的物理关系。

5.2 不同工况下并没有做到完全不变

论文 Table 5:不同 Operating Condition 下的诊断准确率

Fine-tuning 的整体结果最好,但不同工况并不一致:OC1、OC2、OC3、OC4 的准确率分别为86.25%、93.75%、76.22%、85.83%。特别是 OC3 明显下降,说明 Foundation Encoder 并没有自动获得完全的速度/负载不变性。

这也是论文比较可信的一点:作者没有把“跨数据集预训练”直接等同于“彻底解决 domain shift”,而是明确指出运行工况仍然是部署阶段必须处理的变量。

5.3 只给健康样本,还能做异常检测

第二个任务更贴近没有故障标签的工业场景。这里冻结预训练 Encoder,只用目标设备的健康训练样本适配一个 Decoder,使正常时频结构能够被良好重建。

测试时计算被遮挡 Patch 的平均重建误差,并通过多次随机 Mask 求平均得到 anomaly score。健康样本应该容易重建,而损伤样本因为偏离健康结构,会产生更大的重建误差。

论文 Figure 5:仅健康数据适配后的异常分数分布

阈值完全根据健康验证集确定,设置为健康 anomaly score 的95% 分位点;损伤标签只在离线评估 ROC-AUC 时使用,不参与训练或阈值选择。最终整体 ROC-AUC 为0.8928,按工况分别计算再取平均的 Macro-OC ROC-AUC 为0.8653。

需要注意的是,论文明确把 reconstruction error 定义为“相对于健康适配数据的 OOD 分数”,而不是具体故障分类器。如果不同速度或负载导致健康样本本身的分数发生系统漂移,就可能需要工况相关阈值,而不是强行使用一个全局阈值。


六、总结与思考

如果把 VibFM 压缩成一句话:

先用 16 个多源数据集、约 400 小时无标签振动信号学习一套通用“时频语言”,再把这个 Encoder 低成本迁移到新设备。

它的技术路线并不复杂:统一成 128 × 128 STFT,利用采集条件向量恢复物理尺度信息,再以 70% Masked Spectrogram Reconstruction 训练 Transformer。真正有价值的是实验设计:下游 Paderborn 完全不参与预训练,采用 bearing-level split 防止设备身份泄漏,并同时比较 Scratch、Frozen 和 Fine-tuning。最终 Frozen 从 48.91% 提升到 75.12%,Fine-tuning 达到 85.52%,证明预训练确实提供了可迁移表示。

从工程角度看,VibFM 更应该被理解为通用特征底座,而不是一个拿来就能直接完成所有故障诊断的万能模型。它依然需要分类 Head、Fine-tuning 或 Healthy-only Decoder 适配;在运行工况变化较大时,也仍然可能需要条件校准。

论文自己列出的局限也比较明确:目前下游只验证了一个轴承 benchmark 和较粗的健康/内圈/外圈分类;固定 128 × 128 的 log-STFT 会丢失相位并压缩绝对幅值,也不适合精确解析所有经典故障特征频率;当前 conditioning 只包含采样尺度,没有直接编码 speed、load、torque;多数据集训练也不能证明模型已经对 FRF、安装位置和结构共振完全不敏感。

因此,VibFM 最值得继续看的不是“Transformer 比 CNN 强多少”,而是它展示了一条更接近 Foundation Model 的 PHM 路径:

多源无标签预训练 → 通用振动 Encoder → 少量标签快速适配 / 仅健康数据异常检测。

如果这种思路能进一步扩展到更多设备、变速变载工况、故障严重度和剩余寿命任务,那么 PHM 模型的开发方式可能会从“每个设备重新训练一套网络”,逐渐转向“共享一个振动基础模型,再针对具体资产做小规模适配”。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询