旋转机械故障数据集怎么选?这份开源清单把20个数据集的来龙去脉一次讲清
【免费下载链接】Rotating-machine-fault-data-setOpen rotating mechanical fault datasets (开源旋转机械故障数据集整理)项目地址: https://gitcode.com/gh_mirrors/ro/Rotating-machine-fault-data-set
你的故障诊断模型在验证集上又掉了两个点。调结构、换损失函数,折腾一周纹丝不动——问题往往不在模型,而在数据本身。旋转机械故障数据集是故障诊断研究的起点,而Rotating-machine-fault-data-set(开源旋转机械故障数据集整理)这个项目,恰好把全球20个主流数据集摆成了一面清晰的货架:从凯斯西储大学的CWRU,到西安交通大学的轴承退化数据,每个数据集适用什么任务、试验条件如何、怎么引用,都写进了独立的说明文档。这篇文章带你沿着三条研究路径,把这份清单完整走一遍。
别急着写代码:20个数据集,本质上是三类任务
翻开仓库 README,从CWRU到上海交通大学轴承数据共20个条目,表面看是一份链接合集,实则暗含三条截然不同的研究路径:
- 故障分类类:已知健康/故障标签,训练模型区分故障类型,代表有CWRU、MFPT、Paderborn;
- 退化预测类:从正常到失效的全寿命数据,用于剩余使用寿命预测,代表有XJTU-SY、FEMTO-ST、IMS;
- 特殊工况类:齿轮箱、时变转速、真实工业故障等实验室数据覆盖不到的场景,代表有康涅狄格、东南大学、MFPT真实案例。
关键点在于:三类数据回答的是不同问题。选错类型,再强的算法也白搭。判断依据很直接——你的标签是"哪种故障",还是"还剩多久寿命"?
第一站:CWRU故障分类数据,先给算法做一次"体检"
CWRU(凯斯西储大学轴承数据中心)是故障分类研究中使用最广的标准数据集:用电火花加工在轴承内圈、外圈、滚动体上注入直径0.007至0.040英寸的故障,在0-3马力负载(转速1797-1720 rpm)下以12kHz/48kHz双频采样。它的价值在于故障特征明显、可参考论文极多,适合作为算法的基础检验集。
实践表明,多数研究者的第一个baseline都跑在CWRU上:官方提供MATLAB格式(.mat)数据,社区也有Python自动下载与读取的封装。建议你用它跑通"读取数据→时域/频域特征提取→分类器验证"的完整管线,例如下面这段最朴素的振动特征计算:
import scipy.io as sio # CWRU驱动端振动通道,0马力负载下的内圈故障样本 data = sio.loadmat("105_DE_time.mat") signal = data["DE_time"].flatten() rms = (signal**2).mean()**0.5 # 时域均方根 kurt = ((signal - signal.mean())**4).mean() / rms**4 # 峭度 print(f"RMS={rms:.4f}, Kurtosis={kurt:.4f}")确认管线无误后,再换更难的场景。记住一个原则:先建立可信的对照基线,再谈模型创新。
第二站:轴承退化数据,从"判断坏了没"到"预测还能撑多久"
分类模型回答"现在是什么状态",退化数据回答"还能用多久"。这是预测性维护数据集的核心价值,也是项目里最稀缺的一类资源。三个退化数据集各具侧重,对比如下📊:
| 数据集 | 来源 | 实验规模 | 采样特点 |
|---|---|---|---|
| XJTU-SY | 西安交通大学雷亚国课题组 | 3种工况×5个轴承,覆盖完整寿命周期 | 25.6kHz高频采集,多传感器融合 |
| FEMTO-ST | 法国FEMTO-ST研究所 | PHM 2012挑战赛官方数据 | 加速退化,1500-1800rpm、4-5kN载荷 |
| IMS | 辛辛那提大学李杰教授团队 | 3组test-to-failure实验 | 20kHz,每组2156/984/4448个1秒快照 |
以XJTU-SY轴承退化数据为例:平台以35Hz/12kN、37.5Hz/11kN、40Hz/10kN三档工况加速轴承劣化,记录从健康到完全失效的完整过程,配合温度等通道,可直接用于剩余寿命预测模型的训练与验证。FEMTO-ST同样为寿命预测而设计,下图展示了其完整的传感器布局。
为什么这类数据难得?因为真实工业现场很少能等一台轴承跑完整个生命周期。加速退化实验把数月的劣化过程压缩到几天,才让寿命预测研究有了可复现的数据基础。实践中,剩余寿命预测模型的平均误差能否控制在10%以内,很大程度上取决于退化起始点的定义是否合理——这是文档中需要你重点留意的细节。
第三站:齿轮箱与真实工况,避开"实验室洁癖"
分类和预测都跑通后,你会撞上第三个问题:实验室数据太"干净"。真实设备有齿轮啮合噪声、转速波动、多部件耦合。项目把齿轮箱与工业案例单独成组,正是为了补上这一课:
- 康涅狄格大学齿轮箱数据:标注了输入轴、惰轮轴、输出轴的齿数(N1=32、N2=80、N3=48、N4=64),配合加速度计采集振动,可结合传动比做齿轮故障定位;
- 东南大学齿轮箱数据:在Drivetrain Dynamic Simulator上采集,8通道信号覆盖电机振动、行星齿轮箱三向振动、扭矩与平行齿轮箱振动,常用于跨工况迁移学习研究;
- MFPT真实故障案例:包含风电设备中间轴轴承、油泵轴承与行星轴承三个真实失效样本,是少有的带工业背景、有轴承转速标注的故障数据。
此外,渥太华大学数据集提供200kHz采样、含转速编码器通道的时变转速轴承数据(健康/内圈缺陷/外圈缺陷 × 4种变速模式),适合研究变转速下的诊断——这是CWRU等定转速数据集覆盖不到的难点。
一张表决定下一步:按任务对号入座
| 你的目标 | 首选数据集 | 备选方案 | 注意点 |
|---|---|---|---|
| 故障分类baseline | CWRU | Paderborn、MFPT | 特征明显,小心过拟合 |
| 剩余寿命预测 | XJTU-SY | FEMTO-ST、IMS | 需自行定义退化起始点 |
| 齿轮故障诊断 | 康涅狄格 | 东南大学 | 利用齿数计算特征频率 |
| 真实工业场景 | MFPT真实案例 | 电机异音竞赛数据 | 样本量少,适合迁移学习 |
| 时变转速诊断 | 渥太华 | 都灵理工高速轴承 | 需处理转速同步问题 |
动手之前,先读那本"说明书"🔧
每个数据集在doc/目录下都有一份独立文档,例如 CWRU数据说明、XJTU-SY轴承数据、MFPT轴承数据集说明,内容包括:试验条件(采样率、负载、故障注入方式)、数据格式说明、特征频率表格,以及代表性论文清单。这相当于把"数据从哪来、怎么采的、前人怎么用"一次性打包,省去你逐篇翻论文的时间。
仓库的整体使用路径可以概括为:
README.md(20个数据集总索引) ├── doc/ 每份数据集的试验条件 + 格式 + 引用文献 ├── images/ 实验平台与装置示意图 └── 下载数据 → 按文档预处理 → 复现基准论文 → 提出你的方法引用规范同样重要:多数数据集要求按版权方要求标注来源,文档中已给出对应论文与引用信息,写作时照抄即可,避免学术规范上的麻烦。
从一个数据集开始
回到开头的场景:与其继续在模型上打转,不如回头审视数据选择。旋转机械故障数据集的选型没有银弹,但这份清单给了你一条可验证的路径:先克隆仓库(git clone https://gitcode.com/gh_mirrors/ro/Rotating-machine-fault-data-set),通读doc/下的说明文档,然后从CWRU跑通第一个baseline,再按任务类型逐级挑战退化数据与真实工况。遇到下载或使用问题,可以在仓库Issues中讨论,也欢迎向作者补充新的公开数据源。数据是研究的底座,把底座选对了,模型的每一次进步才真正算数。
【免费下载链接】Rotating-machine-fault-data-setOpen rotating mechanical fault datasets (开源旋转机械故障数据集整理)项目地址: https://gitcode.com/gh_mirrors/ro/Rotating-machine-fault-data-set
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考