这一篇在干嘛?
这是一篇发表在 ACM Transactions on Embedded Computing Systems(TECS)上的系统综述,作者团队来自意大利维罗纳大学,系统地梳理了 2015—2024 年十年间”用深度学习做预测性维护(Predictive Maintenance, PdM)“的全部主流方法。它回答的核心问题是:如何利用传感器数据和深度学习模型,在机器彻底坏掉之前预测故障、诊断原因、估算剩余寿命,并给出维护决策。全文按 PRISMA 系统综述流程筛选文献,覆盖模型、学习范式、数据集、评价指标、硬件部署五大板块,非常适合想进入工业 AI 领域的初学者、算法工程师以及智能制造方向的读者。
阅读导航
- 维护的三代演进:从”坏了再修”到”未卜先知”
- PdM 完整流水线:四个阶段缺一不可
- 模型全景图:从 MLP 到基础模型
- 生成式模型:数据不够,自己造
- Transformer 与其他新架构
- 学习范式:同样的模型,不同的教法
- 公开数据集:练手的弹药库与它们的坑
- 评价指标:选错指标,白忙一场
- 硬件落地:把模型塞进微控制器
- 挑战与未来方向
维护的三代演进:从”坏了再修”到”未卜先知”
要理解预测性维护(Predictive Maintenance, PdM)的价值,得先看看它是怎么一步步进化出来的。按照欧洲标准 EN 13306 的定义,**维护(maintenance)**是指在设备全生命周期内,为保持或恢复其”能执行规定功能的状态”所采取的全部技术、行政和管理动作。说白了就是:让机器别坏、坏了能修。
综述把维护策略分成两大类、四小类,我们用三代的眼光来看:
第一代:反应式维护(Reactive Maintenance)——坏了再修。这是最古老的方式,设备彻底罢工了才动手。它的优点很直白:前期零投入,不需要任何监测设备或规划,特别适合那些便宜、非关键、很少出故障的设备。但代价也很惨烈:非计划停机(unscheduled downtime)导致的生产延误、备件加急空运、加班抢修,都是真金白银的支出;突发故障还会缩短设备寿命、带来安全隐患。反应式维护下面又分两种:**纠正性维护(Corrective Maintenance)**处理那些不直接威胁安全或生产的问题;**紧急维护(Emergency Maintenance)**则用于已经威胁到安全或生产的关键故障,需要立即调配资源,成本更高。
第二代:预防式维护(Preventive Maintenance)——定期体检。不管设备有没有问题,按计划定期检查、保养、更换。这能显著减少意外停机、延长机器寿命,但引入了新的浪费:设备明明还健康,也得停机检修,花了不少冤枉钱。综述里列举了三种经典策略:
- 基于役龄的维护(Age-based Maintenance):按部件的使用年限安排维护。简单好执行,适合寿命可预测的部件,但完全不看设备的实际状态,会把还有剩余寿命的部件提前换掉。
- 不完美维护(Imperfect Maintenance):接受设备带着一定程度的磨损继续运行,只做定期的”够用就好”式保养。省了过度维护的钱,但次要部件带着”可控的不完美”运行,隐性增加了故障风险。
- 固定间隔维护(Constant Interval / Time-based Maintenance):雷打不动按固定时间间隔维护。计划管理容易,但如果部件根本没有明显磨损,这些维护就是纯粹的浪费。
第三代:预测式维护(Predictive Maintenance, PdM)——未卜先知。这是本文的主角:利用传感器数据、机器状态和机器学习,预测设备什么时候可能坏,然后只在真正需要的时候动手。它保留了预防式的”防患于未然”,又消除了”没病也治”的浪费,理论上可以把设备的整体设备效率(Overall Equipment Effectiveness, OEE)推到 90% 以上,投资回报率(ROI)据文献称可高达 1000%。当然天下没有免费的午餐:PdM 需要在传感器、监测系统和数据分析工具上做大量前期投入。

**图 1:维护策略分类树。**紫色和绿色框是两大类维护方式(反应式 vs 主动式),橙色框是各自的细分策略。反应式维护只在故障出现后才行动;主动式维护则进一步分为预防式和预测式,不会等到设备失效才开始维护。
在主动式维护(Proactive Maintenance)的大伞下,PdM 属于数据驱动的一支;而在 PdM 的决策阶段,还有两种著名策略:以可靠性为中心的维护(Reliability-centered Maintenance, RCM)——系统性分析各部件的失效后果,优先保障影响整体可靠性的关键部件;基于状态的维护(Condition-based Maintenance, CBM)——通过传感器持续监测设备实际状态,只有当指标达到预设阈值或出现退化迹象时才维护。CBM 是 PdM 中应用最广的类型,所以这篇综述里 PdM 和 CBM 基本可以互换使用。
综述还给出了一张时间轴对比图,直观展示三种策略在同一台设备生命周期中的差异:

**图 2:三种维护策略的时间轴对比。**横轴是时间,纵轴列出预测式、预防式、反应式三种策略,红圈表示故障发生的时刻。绿色扳手代表把设备恢复如初的维护,黄色扳手代表可能留有残余风险的不完美维护;黄色监测符号表示常规监控,红色监测符号表示对关键部件的重点监控。
常见坑:把 PdM 等同于"定期保养"
很多刚接触这个领域的人会把预测性维护和预防性维护混为一谈。记住一个判据:看它依不依赖数据的实时状态。预防式维护按”日历”行事——不管机器好坏,到期就修;预测式维护按”体检报告”行事——数据说话,坏了才修,修之前还会告诉你快坏了。前者过度维护,后者按需维护,成本结构完全不同。
PdM 完整流水线:四个阶段缺一不可
很多人以为 PdM 就是”训练一个模型预测故障”,实际上它是一条完整的流水线。综述把 PdM 划分为四个阶段,这也是理解整篇综述的骨架:

**图 3:PdM 的四个步骤。**从异常检测开始,经过故障诊断和退化预测,最终输出维护缓解方案,形成一条完整的预测链条。
-
异常检测(Anomaly Detection, AD):分析设备的历史数据,把信号中偏离正常运行模式的点标记为异常。这是流水线的”哨兵”,负责拉响警报。它回答的问题是——“机器有没有不对劲?”
-
故障诊断(Failure Diagnosis,也常写作 FD):发现了异常,还得知道为什么异常。这一步要定位异常的根本原因(Root Cause Analysis, RCA):是正常磨损?某个部件失效了?还是其他问题?通常需要更深入的分析,有时还需要领域专家参与。它回答的是——“哪里出了问题?”
-
退化预测(Prognosis,即 Degradation Prognosis):知道了哪里坏了,下一步预测它会多快彻底坏掉。核心输出是剩余使用寿命(Remaining Useful Life, RUL)——设备还能健康运转多长时间。这一步用高级分析、机器学习算法和预测建模来估计故障的演进速度。它回答的是——“还剩多少时间?”
-
缓解(Mitigation):前三步的成果最终要落到”怎么办”上。综合诊断和预测的结果,制定系统化的维护计划。RCM 和 CBM 这两种策略就在这一阶段发挥作用。它回答的是——“现在该做什么?”
值得注意的是,这四个阶段既可以独立使用,也可以组合使用:一个阶段的输出可以作为下一个阶段的输入,但某些场景下并不严格要求串行。比如有些工厂只做异常检测 + 诊断,不做 RUL 预测,也已经有可观的收益。
模型全景图:从 MLP 到基础模型
这是综述的核心章节。作者用 PRISMA 流程从五大数据库(Web of Science、Scopus、IEEE Xplore、ScienceDirect、Google Scholar)检索了 379 篇记录,去重和筛选后最终纳入 168 篇文献,然后逐类分析了 PdM 中用到的学习模型。

**图 4:基于 PRISMA 的文献检索流程图。**379 篇初始记录经过去重(剔除 48 篇)、自动化工具筛除、可及性筛选、标题摘要筛选(剩 180 篇)等步骤,最终 168 篇入选。这是系统综述透明可复现的黄金标准。
先看一张总表,了解各类模型在近几年的研究热度演变:
| 模型 | 2020 前 | 2021 | 2022 | 2023 | 2024 |
|---|---|---|---|---|---|
| MLPs | 多篇早期工作 | 2 篇 | 1 篇 | 4 篇 | - |
| RNNs | 3 篇 | 2 篇 | 2 篇 | 1 篇 | - |
| ConvNets | 15 篇 | 5 篇 | 9 篇 | 10 篇 | - |
| AEs | 6 篇 | 6 篇 | 7 篇 | 1 篇 | - |
| GANs | 1 篇 | 3 篇 | 1 篇 | - | - |
| 扩散模型 | - | 3 篇 | 1 篇 | 4 篇 | 1 篇 |
| Transformers | 1 篇 | 3 篇 | 2 篇 | 1 篇 | - |
| GNNs | - | - | 2 篇 | 1 篇 | - |
| PINNs | - | - | 2 篇 | 1 篇 | - |
| 基础模型 | - | - | - | 1 篇 | 3 篇 |
(表格目标:展示各类学习模型在综述文献中的研究贡献分布,可以看出 ConvNets 和 AEs 是绝对主力,而扩散模型、GNNs、PINNs、基础模型是近几年的新贵。)

图 5:各类学习模型在 PdM 领域的流行度统计——通过统计讨论某一技术的文章数量得出。ConvNets 一骑绝尘,AEs 紧随其后,这正是后面讨论会重点解释的现象。
多层感知机(MLPs):老当益壮的起点
多层感知机(Multi Layer Perceptron, MLP)是最经典的神经网络:输入层、隐藏层、输出层,每层神经元与下一层全连接。它能学到标准统计模型搞不定的非线性关系,1970 到 2010 年代一直是机器学习的”劳模”。隐藏层多于一层时,它就成了深度神经网络。
由于结构简单,MLPs 是 PdM 领域最早被广泛研究的模型。典型用法包括:区分正常数据与异常数据、在大规模深层网络上预测异常、配合决策阈值把连续输出转成离散故障类别以应对不平衡数据。还有工作把 MLP 和可解释 AI(Explainable AI, XAI)技术结合来预测 RUL——这在工业界很关键,因为工程师需要知道模型”为什么”这么说才敢据此停机。由于 PdM 领域的标签通常很稀缺,也有学者提出半监督方案来训练 MLP 预测机电继电器的 RUL。
MLP 的取舍很清晰:优点是简单、快、好解释;缺点是不会自动提取时序或空间特征,输入特征的好坏高度依赖人工特征工程。
循环神经网络(RNNs):为时序数据而生
工厂里的传感器数据天然是时间序列(time-series),所以循环神经网络(Recurrent Neural Network, RNN)在 PdM 里占有一席之地。RNN 有”记忆”能力,能把之前时间步的结果带到后续计算中。
但普通 RNN 有个致命弱点:梯度消失(vanishing gradient)——训练过程中参数几乎不再更新,导致模型学不到长距离的时序依赖。两个变种解决了这个问题:
- 长短期记忆网络(Long Short-Term Memory, LSTM):通过门控机制(gate,一种阈值函数)决定哪些信息保留、哪些遗忘,有效缓解梯度消失。
- 门控循环单元(Gated Recurrent Unit, GRU):同样是门控设计,但门的数量更少,比 LSTM 更高效。
在 PdM 的实战中,LSTM 被用于预测喷气发动机的 RUL、预测近期可能发生的故障;还有工作在 LSTM 编码器-解码器架构里嵌入自注意力(self-attention)机制——编码器处理输入、提取关键信息,解码器据此生成更准确的预测。更前沿的还有 Multi-Flow BiLSTM:用多学习流加残差连接(residual connections)分析历史数据模式,可以预测未来信号,直接服务于异常检测;以及统计循环单元(Statistical Recurrent Unit)凭借出色的特征提取能力做 RUL 预测。
卷积神经网络(ConvNets):PdM 界的绝对主力
卷积神经网络(Convolutional Neural Network, ConvNet / CNN)是综述统计出的 PdM 最常用模型。它用卷积层在输入上滑动 2D 滤波器提取边缘、纹理、形状等特征。在 PdM 里它有两种打开方式:
**方式一:直接在 1D 信号上卷积。**1D 卷积滤波器作用于序列的时间维度,把远处的和近处的过去”混合”起来,对信号当前状态做出判断,从中提取频率成分、瞬态尖峰、周期模式等对预测故障至关重要的特征。ConvNets 是极好的特征提取器,但通常需要和 MLP 或 RNN 组合使用——ConvNet 负责提特征,后面的模型负责预测。
方式二:把信号变成图像再卷积。传感器信号可以转换成频谱图(spectrogram),最常用的方法是格拉姆角场(Gramian Angular Field, GAF),此外还有功率谱密度(Power Spectral Density)和快速傅里叶变换(Fast Fourier Transform, FFT)。转换后的”图像”就可以喂给标准的 2D ConvNet,直接复用计算机视觉的成熟技术。
ConvNets 的进阶玩法还有很多:
- 联合损失函数(joint-loss function):让一个共享的 ConvNet 同时优化两个任务,比如同时做 RUL 预测和健康状态分类,两个任务的损失函数加权合并,模型同时从两个目标学习。
- ConvNet + RNN 组合:这是综述观察到的最主流组合。ConvNet 提取信号特征,LSTM 维持特征间的时序依赖;双向版本(Bi-LSTM、Bi-GRU)让信息双向流动,在 PdM 各阶段都有应用。
- 时序卷积网络(Temporal Convolutional Network, TCN):用因果卷积和空洞卷积建模长序列,也常用于时序信号的 PdM 任务。
ConvNets 之所以能称霸,一是因为工业信号转图像后可以套用海量视觉领域的预训练成果,二是它的特征提取能力确实对”振动信号里藏着故障前兆”这类问题特别有效。
常见坑:信号转图像不是万能药
GAF、FFT、功率谱密度这些信号转图像技术很流行,但转换方式的选择本身就是一种领域决策。FFT 适合找周期性成分,GAF 保留时序依赖关系,选错了转换方法,后面再强的 ConvNet 也救不回来。另外,ConvNet 直接在原始 1D 信号上工作也是一种完全可行的路线,不一定非要绕道图像——两种路线在文献里都有大量成功案例,不要迷信其中一种。
生成式模型:数据不够,自己造
生成式模型(Generative Models)的核心能力是学习训练数据的底层分布,然后生成和它相似的新数据。在 PdM 这种”故障样本极其稀缺”的领域,这个能力简直是量身定做。
自编码器(AEs):无监督异常检测的瑞士军刀
自编码器(Autoencoder, AE)由两部分组成:**编码器(encoder)**把输入数据压缩到低维的潜在空间(latent space),**解码器(decoder)**再从编码重建原始信号。训练目标是让重建结果尽量接近输入——在这个过程中,编码器被迫学会抓住数据最本质的特征、扔掉无用的噪声和冗余。这是一种无监督学习(unsupervised learning),不需要任何标签。
在 PdM 中的经典用法:用正常数据训练 AE,之后如果某段数据的**重建误差(reconstruction error)**超过阈值,就判定为异常。道理很朴素——模型只见过正常的模式,遇到没见过的异常就”重建不像”。此外,也可以在编码后的表示上接一个分类器做维护决策(识别潜在故障或估计 RUL),相当于让分类器直接在”已经去噪去冗余”的特征空间里工作。
综述中的进阶变体非常丰富:
- 卷积自编码器(ConvNet-based AE):用卷积层做编码器和解码器,擅长提取判别性特征,广泛用于 AD、RCA 和 RUL 各阶段。
- 压缩卷积变分自编码器(Squeezed Convolutional Variational Auto-Encoder, SCVAE):卷积提特征,squeeze 操作让预测更省资源。
- 带故障注意力机制的 AE:让模型对数据中的故障部分投入更多注意力,用于 AD 和 RCA。
- 深度去噪自编码器(Denoising Autoencoder, DAE):训练时故意给输入加噪声,让模型学会从带噪版本恢复干净信号。这样学到的表示专注于数据的关键特征、忽略无关噪声,对预测设备寿命特别有用。
- 离散变分自编码器(Discrete Variational AE):把数据编码到离散的潜在空间,更有效地捕捉关键模式和异常。
AE 之所以是 PdM 第二热门的模型,根本原因还是前文说的:工业场景拿不到故障标签。AE 不需要标签就能学数据分布,完美契合现实约束。
生成对抗网络(GANs):造假大师的另一面
生成对抗网络(Generative Adversarial Network, GAN)由两个网络对抗训练:**生成器(generator)**努力学习训练数据的分布并生成以假乱真的数据,**判别器(discriminator)**努力分辨输入是真数据还是生成的假数据。两者互相博弈,最终生成器学到的分布可以逼真到判别器也分不清。
GAN 在 PdM 有两大用法:
- 数据增强:故障标签数据稀缺是 PdM 的老大难,GAN 可以生成合成异常数据来扩充训练集。有工作用卷积版 GAN 生成异常数据供训练,也有用 GAN 为 RUL 任务生成训练数据。
- 直接做异常检测:判别器本身可以当分类器用。LSTM 版 GAN 让生成器生成正常数据、判别器区分异常与正常,在时序数据上效果拔群。综述指出,GAN 在异常检测上大幅领先 MLP 和 RNN 等传统方案。
扩散模型(Diffusion Models):最新的生成引擎
扩散模型(Diffusion Models)是近几年最火的生成模型家族,灵感来自非平衡热力学:前向过程逐步给数据加噪声,反向过程学会一步步去噪恢复原始数据——学会之后,从纯噪声出发就能”逆向”生成逼真的新数据。它在文生图、超分辨率、图像翻译、时间序列预测等领域都拿下了惊艳的成绩。一大优势是支持条件生成(conditioning)——用额外输入引导采样步骤。
三大技术路线:
- 去噪扩散概率模型(Denoising Diffusion Probabilistic Models, DDPMs):逐步加噪再学习逆转,适合生成新样本或填补缺失数据。
- 基于分数的生成模型(Score-based Generative Models, SGMs):用分数匹配(score-matching)预测数据变化,沿梯度方向生成或重建时序数据。
- 随机微分方程(Stochastic Differential Equations, SDEs):把扩散过程连续化,状态转移更平滑,长期预测更好。
落地到 PdM 时序任务的代表模型:TimeGrad 基于 DDPM 逐步去噪做预测;ScoreGrad 引入 SDE 提升长期精度;D3VAE 把扩散和变分自编码器结合,专治噪声大、数据少的场景;DSPD 把时序建模为连续函数,可以在任意未来时间点预测;TimeDiff 用未来近似避免自回归模型的误差累积,预测更快、范围更长。还有面向时空图(spatio-temporal graphs, STG)的扩散方法:Diff-STG 把 DDPM 扩展到多变量时序并考虑实体间空间关系;GCRDD 用图改造的 GRU 同时捕捉时空依赖;CSDI 用掩码渐进去噪做时序缺失值填补。
为什么扩散模型对 PdM 特别有吸引力?还是那个原因:异常样本太少。扩散模型既能增强稀缺的异常数据,又能提升预测精度和系统鲁棒性,而且这个方向 2023—2024 年的论文数量正在快速攀升。
Transformer 与其他新架构
Transformers:长依赖的新王者
Transformer 靠自注意力(self-attention)机制在自然语言处理、计算机视觉、音频处理领域大杀四方,它处理长期依赖的能力自然也吸引了工业界研究者的目光。综述列举了一批时序领域的 Transformer 变体:
- Autoformer:在 Transformer 里引入自相关(auto-correlation)机制做长期时序预测,能把复杂的时序模式有效分解,提升长期预测的准确性和鲁棒性。
- FEDformer:把频域分析整合进 Transformer,通过分解和捕捉频率成分,提高 PdM 预测的精度和可靠性。
- 高效长序列 Transformer:改进自注意力以降低计算复杂度,处理长序列时既快又能抓住关键依赖。
- LogSparse Transformer:针对 Transformer 的两大弱点——局部上下文敏感性和内存效率——设计稀疏注意力,在细粒度、强依赖的长序列上提升精度、降低内存开销。
- 门控 Transformer 网络(Gated Transformer Networks, GTN):用门控改进多变量时序分类,让模型聚焦相关特征。
- Crossformer:用专门的注意力机制捕捉跨维度依赖——即不同变量之间、不同时间步之间的关系,从而更好地预测多变量时序中的复杂交互。
Transformer 的取舍:优点是天然擅长长距离依赖、可并行训练;缺点是计算量和内存开销大、对数据量要求高,而且自注意力的复杂度随时序长度平方增长——这正是各种稀疏化、频域化变体想解决的问题。
图神经网络(GNNs):教模型理解”传感器之间的关系”
现有的 AE、LSTM、GAN 方法有个共同的盲区:它们不会显式学习哪些传感器彼此相关。当传感器数量很多、相互关系复杂时,这些方法既难以建模,也难以解释异常发生时哪些关系被破坏了。图神经网络(Graph Neural Network, GNN)正好补上这块:把多变量时序自然地抽象为时空图(节点是传感器/变量,边是它们的关系),精确刻画跨时间的、跨变量的动态依赖。代表工作包括用于 PdM 的电气时空图卷积网络(Electrical-STGCN),以及嵌入领域知识来捕捉特征间复杂关系的 MTAP-DK 模型。GNN 家族里常用的还有图卷积网络(Graph Convolution Network, GCN)和图注意力网络(Graph Attention Network, GAT)。
物理信息神经网络(PINNs):把物理定律写进损失函数
物理信息神经网络(Physics-Informed Neural Network, PINN)走了一条完全不同的路线:把已知的物理方程或原理直接嵌入神经网络的训练过程。传统 ML 模型很难表达复杂物理系统的交互与动力学,而 PINN 用物理约束弥补纯数据驱动的短板。
它的杀手锏是:数据稀缺甚至昂贵时依然能工作——因为物理定律本身就是一种”免费”的先验知识。材料属性、系统动力学、设备行为这些先验都可以写进模型,提升可解释性和泛化能力。综述认为 PINN 特别适合 PdM 的异常检测和预测(prognostics)场景,而且能提供对故障底层原因的洞察,帮助制定更精准主动的维护计划。
基础模型(Foundation Models):时序版的 GPT 来了
基础模型(Foundation Model)指像 GPT(Generative Pre-trained Transformer)那样在海量数据上预训练、再针对具体应用微调的”通用底座”。时序领域的基础模型近年刚起步,综述介绍了四位代表:
- TimeGPT-1:第一个时序基础模型,用 GPT 架构生成准确的时序预测,能捕捉复杂的时间模式与依赖。
- MOMENT:开源的时序基础模型家族,提出大规模预训练用的”时序堆”(time-series pile)和低监督评估基准,几乎不用微调就有强劲表现。
- Lag-Llama 类模型:把滞后值(lags)当作协变量、用概率技术输出未来的一系列可能结果而非单一确定性预测,更好地刻画不确定性。
- Chronos:当前时序预测的最优基础模型,在新数据集上展现出强劲的**零样本(zero-shot)**能力——不用训练就能直接预测,大大简化了预测流水线。
不过综述也点出了要害:这些模型大多是单变量的(univariate),无法生成或理解多变量时序之间的关系——而多变量关系恰恰是 PdM 任务的核心(一台机器几十个传感器是常态)。这是时序基础模型在 PdM 落地前必须迈过的坎。
各架构都用在哪些行业?
综述统计了这些模型在真实应用里的分布,做成了一张树状图:

**图 6:PdM 应用行业的树状图。**颜色代表分组,层级通过嵌套矩形展示;矩形越大代表该行业占比越高,小矩形是子类或具体设备。
- 制造与生产(33.33%):最大板块,覆盖注塑机、铣削刀具、机械臂、3D 打印机、传送带系统、热轧机、感应炉、半导体制造等。
- 能源系统(20.00%):风电涡轮机、光伏板等可再生能源设备是增长亮点。
- 旋转机械(15.55%):轴承、感应电机、水泵、离心式压缩机等通用设备,也包括电机等专用设备。
- 电子与计算(13.33%):硬盘、电磁继电器等硬件维护,以及物联网工业系统。
- 交通运输(11.11%):车联网(Internet of Vehicles, IOV)、智能汽车、喷气发动机、铁路阀门。
- 建筑与重型设备(6.66%):重型机械和食品生产设备等。
学习范式:同样的模型,不同的教法
模型是”用什么网络”,范式是”怎么教这个网络”。同一个 LSTM,可以用监督的方式教,也可以无监督地教,效果天差地别。综述重点讨论了六种范式。

图 7:各学习范式在 PdM 领域的流行度统计——基于综述所引用的研究贡献。监督学习一枝独秀,无监督学习紧随其后。
监督学习(Supervised Learning):标签充足时的首选
用”输入-输出对”训练模型:喂给模型输入数据,同时给出期望的输出标签。数据充足时效果最稳,但代价是需要大量标注数据。对 PdM 来说,监督学习需要的标签包括:正常/异常标记、故障类型、RUL 值。
一个教科书式的例子:用 NASA 涡扇发动机数据集预测 RUL 的三段式模型——1D ConvNet 从信号中提特征,LSTM 学习特征间的时序依赖,最后的 MLP 综合输出 RUL。这是”ConvNet + RNN + MLP”全家桶的经典组合。
无监督模型也能”改行”做监督:比如先在无标签数据上训练 ConvNet 自编码器学潜在表示,训练收敛后把编码器的输出喂给一个 MLP,再用带标签的数据以监督方式训练这个 MLP 来分类异常及其类型。这种”无监督预训练 + 监督微调”的两段式打法很常见。
无监督学习(Unsupervised Learning):没有标签时的救命稻草
从无标签数据中自己发现模式、结构和隐藏关系。现实工业场景里标注数据极其稀缺(谁也没法给每一秒的振动信号打上”正常/异常”的标签),所以无监督学习对 PdM 尤其重要,主要用在异常检测阶段。
最常见的套路还是”重建 + 阈值”:模型学习重建正常信号,当原始信号与重建信号的重建损失超过设定阈值时,判定为异常。变体包括:用 ConvNet 提特征、AE 在潜在空间表示特征的无监督卷积 AE(不同阈值还能划分异常严重程度:良好、糟糕、致命);用 LSTM 捕捉时序关系、AE 学习潜在表示的 LSTM-AE 组合。
注意一个边界:无监督方法目前只能用于故障检测(AD 阶段)——它能告诉你”不对劲”,但说不出”哪里不对劲、还剩多久”。
强化学习(Reinforcement Learning):管”最后一步怎么决策”的
强化学习(Reinforcement Learning, RL)训练一个智能体(agent)根据输入采取动作(策略,policy),好策略获得奖励(reward),模型在马尔可夫决策过程(Markov Decision Process, MDP)框架下最大化累计奖励。真实工业系统的状态空间是高维的,传统 RL 算法力不从心,所以实际用的是深度强化学习(Deep Reinforcement Learning, DRL)。
RL 在 PdM 里的主战场是缓解(mitigation)阶段——学习最优维护决策策略。例子包括:基于 PPO-LSTM(Proximal Policy Optimization + LSTM)的资源管理决策框架;无模型的 DRL 制定设备维护策略;用 ConvNet 预测 RUL、再用 Soft-Actor-Critic(SAC)算法根据 RUL 决定维护时机;以及多智能体 RL——各智能体只部分观测机器状态,协同为不同技能水平的工人安排维护计划。
集成学习(Ensemble Learning):三个臭皮匠赛过诸葛亮
把多个模型的预测组合起来,取长补短、提升整体性能与鲁棒性。基本逻辑是:聚合多个模型的预测往往比任何单一模型泛化得更好。
PdM 里的实例:Random Forest + k-NN + SVM 三分类器投票决定故障退化状态;MLP 和 ConvNet 通过权重共享层融合后再接 MLP 分类;五个时序网络(ConvNet、ConvNet-RNN、ConvNet-GRU、ConvNet-LSTM、ConvNet-BiLSTM)多数投票做故障诊断;五个最先进的深度网络(BiLSTM、ConvNet-LSTM、DCNN、DLSTM、HDNN)通过数学优化求出各自最优权重,加权组合预测喷气发动机 RUL。
迁移学习(Transfer Learning):让知识跨机器复用
把在一个任务上训练好的模型,复用或微调到另一个相关任务上。当目标任务缺少标注数据时特别有用。
PdM 中的应用:用迁移学习版 GAN 先在多数类样本上训练、再微调到少数类,生成样本解决类别不平衡;ConvNet 在一台机器的数据上训练后迁移到工况不同的相似机器;可迁移的 AE 先在合成数据上训练、再用机器的真实小样本微调做故障检测;甚至有 AE 先在语音频谱图上训练、再微调做故障类型分类。直接借力计算机视觉预训练模型也很流行:用 Inception 或 ResNet-50 在数据频谱图上微调,就能做 AD、诊断和预后。
但综述也泼了盆冷水:由于机器运行方式、领域、特征的差异太大,迁移学习在 PdM 的直接效果有限——在车辆上训练的模型没法直接用在发电机上。不过随着生成式 AI 的兴起,“预训练模型如何迁移到 PdM 任务”仍是值得探索的方向。
联邦学习(Federated Learning, FL):数据不出门的协同训练
联邦学习是一种分布式机器学习方法:多个设备或服务器各自用本地数据训练,不共享原始数据,只把模型更新发给中央聚合器合成全局模型。这保住了数据隐私和安全,特别适合医疗、金融或数据分散在各组织间的场景。工业数据往往是企业的核心商业机密(涉及工艺、产能),企业不愿意公开分享——FL 正好解开这个死结。
综述里的案例:FedLabSync 用标签同步解决联邦场景下各参与方标签不一致的问题,用于飞机和生产线的 RUL 预测;1DCNN-BiLSTM 联邦框架应对制造业中分布式设备数据的分布漂移(用水泵数据验证);相似度匹配参数聚合算法只对功能相似的神经元做平均,保留各设备独有的局部特征,用于电池健康度和喷气发动机 RUL 估计;基于垂直联邦学习和同态加密的梯度提升树模型,让不同机构在互不暴露隐私数据的前提下协同诊断轴承故障;还有融合差分隐私的 Conv1D-BiLSTM-DAE-TF 方案压缩 SCADA 数据特征、检测风电异常;轻量级的 Trans-Lighter 只用 Transformer 编码器加线性层,配合贝叶斯优化调参,专做喷气发动机 RUL 的联邦预测。
公开数据集:练手的弹药库与它们的坑
数据是数据驱动模型的命脉。综述整理了 PdM 研究中最常用的公开数据集:
| 数据集 | 应用 | 特征数 | 特征示例 |
|---|---|---|---|
| SWaT | AD | 123 | 泵状态、流量、水位等 |
| WADI | AD | 52 | 泵状态、流量、水位等 |
| MSL | AD | 4185 | 温度、电压、机械应力等 |
| SMAP | AD | 1375 | 辐射、温度、功率等 |
| SMD | AD | 1064 | CPU 负载、网络用量、内存用量等 |
| NAB | AD | 16 | 温度、CPU 利用率、网络用量等 |
| 铣削磨损(Milling Wear) | RUL | 6 | 振动、声发射、温度 |
| IMS 轴承 | AD、FD、DP | 8 | 振动 |
| CWRU 轴承 | AD | 3 | 振动 |
| 时变转速轴承振动 | AD、FD | 2 | 振动与转速 |
| 滚动轴承声音 | AD、FD、DP | 1 | 声音 |
| NASA 涡扇发动机 | AD、FD、DP | 21 | 温度、压力、风扇转速 |
| CNC 加工 | AD、FD | 3 | 振动 |
| RoAD | AD | 86 | 振动、加速度、位置、方向等 |
| Exathlon | AD、FD | 2283 | 内存用量、磁盘用量、CPU 用量等 |
(表格目标:汇总综述中回顾的公开数据集。AD = 异常检测,FD = 故障诊断,DP = 退化预测。)
几个重点数据集展开说:
- WADI 与 SWaT:水处理系统的”网络安全 + 运维”双料数据集。WADI 是 16 天连续监测(14 天正常运行 + 2 天网络攻击),SWaT 是 11 天(7 天正常 + 4 天攻击),都带有正常/异常标签。
- SMAP 与 MSL:NASA 出品的异常检测基准。SMAP 含 55 台设备 25 项指标;MSL 来自好奇号火星车,在恶劣火星环境下监测温度、电压、电流、机械应力等(155 个传感器、27 台设备)。
- SMD 与 NAB:服务器机器数据集记录 CPU 负载、网络与内存用量等指标(28 个实体、每实体 38 项指标);Numenta 异常基准专为流式实时异常检测设计,覆盖 IoT 传感器、服务器和应用指标。这两类严格说不完全是工业设备数据,但很适合 PdM 早期阶段的基准测试。
- Exathlon:来自 10 个 Spark 流处理应用的标注时序数据,异常类型包括错误输入、资源争用、进程失败,且涵盖点级、上下文、集合三种异常形态。
- 物理故障类数据集:铣削磨损数据集(不同工况与退化状态下的振动、声发射、温度);IMS 轴承(试验台上四个轴承的加速度计振动信号);CWRU 轴承(内圈、外圈、滚动体缺陷,不同载荷与转速);时变转速轴承振动(60 组时序,正常 + 5 种故障 × 4 种转速);滚动轴承声音数据集(听诊器/非听诊器两种录音条件);NASA 涡扇发动机(C-MAPSS)——最经典的”从正常运行一路跑到故障”的 run-to-failure 数据集,21 个特征;CNC 加工(三台铣床、两年、三轴加速度计);RoAD(Kuka 机器人在真实产线上的 87 变量多变量时序,涵盖碰撞、重量、速度三类场景,测试集带标签,特别适合无监督异常检测)。
数据集质量:一片繁荣下的暗礁
综述毫不客气地指出:这些数据集大多是仿真或实验室产物,质量堪忧,甚至制造了”异常检测进展神速”的假象。六大问题:
- 异常太好检测——简单阈值就能抓出来,根本用不着复杂模型;
- 异常密度不真实——有的测试集一半以上区域都是异常,有的异常扎堆出现;
- 真值标签错误——大量假阳性和假阴性区域;
- 异常只出现在序列末尾——run-to-failure 数据的通病,设备开始磨损才有异常;
- 存在常数特征——训练测试集里混入毫无信息量的恒定值,徒增复杂度;
- 分布漂移——训练集和测试集的数据采集过程不一致导致分布不同。
对初学者的启示:在这些数据集上刷出 99% 的 F1 分数,不等于你的模型能在真实工厂里工作。理想的数据集应该贴近真实工业环境的复杂性、覆盖多样的运行工况、带有精确可靠的标签——而这恰恰是学界最缺的。
通关标准:能否独立设计一条 PdM 流水线?
读完这篇综述,你应该能回答以下问题作为”出师”检验:(1) 给定一个只有少量故障标签的场景,你会选监督还是无监督范式?为什么?(2) 振动信号做故障诊断,你会用 1D ConvNet 直接处理原始信号,还是先转成频谱图再用 2D ConvNet?各自的依据是什么?(3) 老板问”这套系统部署到产线上的硬件成本如何”,你会从哪些维度评估(参考综述的硬件章节:处理器、SRAM、Flash、模型参数量、FLOPS)?
评价指标:选错指标,白忙一场
模型好不好,得靠指标说话。PdM 不同阶段用不同的指标体系。
异常检测与诊断的指标
**准确率(Accuracy)**回答”所有预测里对了多少”:
直观好懂,但在不平衡数据上会骗人:正常样本占 99% 时,一个”永远预测正常”的模型准确率也有 99%。
**精确率(Precision)**回答”预测为正的里面真对多少”:
适合”误报代价高”的场景,缺点是不管漏报(false negatives)。
**召回率(Recall,真阳性率)**回答”该抓出来的抓住了多少”:
目标是尽量少漏掉真故障,代价是可能多误报。在不平衡数据上也可能被”全预测为负”虚高。
F1 分数调和精确率与召回率:
两者任何一个为零,F1 就是零——天然惩罚极端值。
AUC-ROC 是 ROC 曲线(真阳性率对假阳性率)下的面积;AUC-PR 是精确率-召回率曲线下的面积。两者都没有单一公式,通过扫不同阈值画出曲线再积分。
**马修斯相关系数(Matthews Correlation Coefficient, MCC)**是处理不平衡数据的利器,用上了混淆矩阵的全部四个元素:
预测(RUL)阶段的指标
这一阶段是回归问题,用误差类指标。平均绝对误差(MAE)——所有误差一视同仁:
均方误差(MSE)——对大错误平方惩罚,更看重”别错得离谱”,但对异常值敏感:
均方根误差(RMSE)——MSE 开根号,量纲与原数据一致,同样偏重大错误、敏感于离群值:
决定系数(R-squared)——模型解释了实际数据变异的百分比,直观易读,但默认线性关系,非线性场景不适用:
缓解(RL)阶段的指标
缓解阶段通常用 RL 学习最优维护决策策略,评价指标就是奖励(reward):奖励函数按问题定义,分正奖励(鼓励重复该行为)、负奖励(抑制)、中性奖励(维持现状)。常用统计量有平均回合奖励(average episodic reward)——智能体在特定时间窗口内的平均所得;以及累计奖励(cumulative rewards)——所有奖励之和,缺点是会让智能体的学习过程变得很慢。
指标使用中的一个大坑
时间序列异常检测(Time-Series Anomaly Detection, TAD)领域近年频频报告很高的 F1 分数,但其中很多水分来自一种叫点调整(point adjustment)的评估协议:只要在一个连续异常段中检测到至少一个异常点,就把整段都算作正确预测。这个协议理论上和实验上都被证明会严重高估性能——连随机生成的异常分数都能摇身一变成”SOTA 方法”。改进思路包括:引入时间延迟容忍窗口(允许检测时刻稍有偏差但仍公平)、或采用严格的逐点评估(每个时间戳独立评判),避免片段内的薄弱环节被整段”正确”掩盖。
硬件落地:把模型塞进微控制器
再好的模型跑不起来也白搭。PdM 算法最终要部署到边缘设备(edge devices)上实时运行,所以硬件选型是绕不开的一环。综述统计了文献中 PdM 算法的实际部署平台:
| 目标设备 | 处理器 | SRAM | Flash |
|---|---|---|---|
| 未指定平台 | ARM Cortex A72 | 4 GB | - |
| STM32H743 Nucleo | ARM Cortex M7 | - | - |
| Freematics ONE+(ESP32 基 Arduino) | Xtensa 32-bit LX6 | 520 KB | 448 KB |
| Arduino Nano 33 IoT | ARM Cortex-M0 | 32 KB | 256 KB |
| ESP32 微控制器 | Xtensa 32-bit LX6 | 520 KB | 448 KB |
| Arduino Nano 33 BLE Sense | ARM Cortex-M4F | 256 KB | 1 MB |
| Arduino Nano 33 BLE Sense | ARM Cortex-M4F | 256 KB | 1 MB |
| Arduino Nano 33 BLE | ARM Cortex-M4F | 256 KB | 1 MB |
(表格目标:汇总综述中 PdM 算法在硬件设备上的部署研究。可以看出主流平台是低成本微控制器——TinyML 路线。)
这些研究的共同趋势:在处理器和内存都极其有限的边缘设备上跑 ML/DL 模型,且主要针对 PdM 的异常检测阶段。几个代表工作:
- 极致压缩的卷积自编码器:参数量低至 686 个、模型小至 2.7 KB、算力需求仅 280 万 FLOPS,部署在 Intel Core i5 和 ARM Cortex A72 上,检测精度却媲美 400 万参数的大模型。这说明”小而精”的架构设计远比堆参数重要。
- Arduino Nano 33 BLE Sense 上的气候异常检测:经典 ML 和 DL 模型都能在微控制器上运行。
- 基于 TEDA(Typicality and Eccentricity of Data)的无监督路面异常检测,以及监测城市车辆温室气体排放的无监督 TinyML 软传感器。
- 自监督学习(Self-Supervised Learning, SSL)做 IoT 设备异常检测:多变量 LSTM 自编码器,用显著偏离已学分布的数据自我监督,增强对这类异常的检测能力。
- 微控制器上的洗衣机异常检测 AE:在 Arduino Nano 上实现高精度、高召回且功耗极低。
- TinyOL(TinyML with Online Learning):支持用流式数据在设备上增量训练——模型不是部署完就一劳永逸,还能边运行边学习。
- 可扩展的 ML 分类器集成系统:检测是否异常,集成规模可伸缩,内存占用和推理延迟的影响可预测。
选硬件的核心考量:模型能不能实时出结果?内存放不放得下?功耗多少?工业环境(高温、振动、粉尘)扛不扛得住?综述给出的答案是:TinyML 路线(微控制器 + 极简模型)已经是现实可用的选项,尤其适合异常检测这种相对轻量的任务。
挑战与未来方向
综述在结尾坦率列出了 PdM 领域的六大未解难题:
- 缺真实数据集:公开数据集基本都是实验室产物,与真实场景相去甚远;由于异常太好识别,几乎所有算法都能刷到接近满分;缓解阶段更是完全没有公开数据。
- 没有公认基准:算法之间无法公平比较,“谁是最先进的”成了悬案。
- 数据采集本身很难:IIoT 基础设施部署成本高昂,小公司玩不起;RUL 数据需要 run-to-failure 实验——把昂贵的设备故意用坏,既烧钱又危险;工业数据还涉及商业机密,企业普遍不愿公开。
- 数据标注难:海量数据人工标注不现实;需要领域专家盯着机器状态仔细标注,故障起止点必须精确标记,否则就会引入标签噪声;故障本身稀有,数据极度不平衡。
- 大数据处理:众多传感器产生的海量实时数据需要即时处理,对数据基础设施和算法效率都是考验,存储容量也是瓶颈。
- 工业机器的动态性:机器的工序、环境、部件都可能动态变化,数据分布随之漂移,模型和标签必须同步更新,否则误报漏报接踵而至。
未来方向上,综述点名了四条最有希望的路:
- 建一个贴近真实场景的稳健基准,让”比较算法”重新变得可能;
- 追求泛化能力:目前的模型基本都是”一机一模”,能跨行业、跨设备通用的模型是下一站;能适应动态工况和环境的模型同理;
- 押注无监督与半监督学习:真实世界标签永远是稀缺品;
- 补齐缓解阶段的研究:四个阶段中,缓解(怎么做维护决策)是文献最少的一环,未来应该补上。
最后回到应用全景:从综述的统计看,根本原因分析(RCA)是 PdM 最热门的应用,异常检测排第二,RUL 预测第三;此外还有锂离子电池容量衰减预测、最优维护策略生成、故障风险预测等应用。

图 8:PdM 各应用方向的热度分布——基于综述回顾的研究贡献统计。
自测题:检验一下你吸收了多少?
1. 预防式维护和预测式维护的本质区别是什么? 预防式维护按固定计划(时间/役龄)执行,不管设备实际状态如何,容易过度维护;预测式维护基于传感器数据和模型预测,只在数据显示退化迹象时行动,本质是数据驱动的按需维护,能同时降低非计划停机和过度维护的成本。
2. PdM 的四个阶段分别是什么?各回答什么问题? 异常检测(机器有没有不对劲?)→ 故障诊断(哪里出了问题?)→ 退化预测/RUL(还剩多少时间?)→ 缓解(现在该做什么维护决策?)。四个阶段可独立或组合使用。
3. 为什么自编码器(AE)在 PdM 中如此流行?它的异常检测原理是什么? 因为工业场景中故障标签极其稀缺,而 AE 是无监督的,不需要标签。原理:只用正常数据训练 AE 学习重建;推理时若某段数据的重建误差超过阈值,说明模型”没见过”这种模式,判定为异常。
4. ConvNets 处理传感器信号有哪两条路线? 路线一:1D 卷积直接作用于原始时间序列,提取频率成分、瞬态尖峰等特征,常与 RNN 组合使用;路线二:先把信号转换为图像(GAF、FFT、功率谱密度等),再用 2D ConvNet 处理,可复用计算机视觉的预训练模型。
5. 什么是点调整(point adjustment)协议?它为什么危险? 一种 TAD 评估协议:只要在连续异常段中检测到一个异常点,整段就记为预测正确。它系统性高估模型性能——研究表明连随机异常分数都能借此达到”SOTA”水平,导致方法排名失真。更严谨的做法是时间延迟容忍窗口或严格逐点评估。
延伸阅读建议:如果你对文中某个具体模型感兴趣,建议按综述原文的引用编号顺藤摸瓜读原论文;如果目标是动手实践,NASA 涡扇发动机数据集(C-MAPSS)和 CWRU 轴承数据集是公认的入门练手首选,数据规整、社区资料丰富。