Incorporating time dependence into a fault signature matrix to support root cause identification and fault propagation analysis

Abstraction

The complexity of systems is rapidly increasing to meet evolving global demands. These systems possess intricate architectures with numerous components that challenge fault diagnosis and failure prediction. A primary challenge is fault propagation, where failures cascade throughout interconnected components. Traditional reliability methods struggle to effectively address the propagation of failures and identify their root causes. Similarly, existing research is primarily based on the use of sensors and data-driven methodologies for system monitoring. Yet, the diagnostic process still relies heavily on available knowledge and operator experience. To address these challenges, this study introduces a fault diagnosis framework that enhances reliability and resilience in complex systems. The proposed approach extends the traditional static Fault Signature Matrix (FSM) to a time-dependent representation via a failure-sequence line that orders symptoms, integrating failure analysis (via Failure Modes and Effects Analysis, FMEA), interaction analysis (using Fault Tree Analysis, FTA), and a heuristic-based causal inference approach. This integration facilitates systematic knowledge retrieval, analyzes functional component relationships, and assesses how individual failures affect other components. The methodology is demonstrated on a solid oxide fuel cell system, an emerging technology. Results reveal that multiple failure modes can lead to identical stack-level failures, highlighting the importance of linking component failures to their actual root causes. The findings offer significant insights for the field, helping system operators to understand the underlying failure mechanisms and enabling timely preventive actions to mitigate risks.

摘要翻译:为了满足不断发展的全球需求,工程系统的复杂程度正在快速提高。这类系统通常具有复杂架构和大量相互连接的组件,因此故障诊断和失效预测都变得更加困难。其中一个主要挑战是故障传播,即某个组件中的失效会沿着组件之间的连接和功能依赖逐步传播到系统其他部分。传统可靠性方法在有效描述故障传播并识别真正根因方面仍存在不足。与此同时,当前研究大量依靠传感器以及数据驱动方法开展系统监测,但实际诊断过程仍然高度依赖已有系统知识和现场操作人员的经验。针对这些问题,本文提出一个面向复杂系统的故障诊断框架,以提高系统可靠性和韧性。该方法在传统静态Fault Signature Matrix(FSM)的基础上增加时间依赖信息,通过一条按照症状出现顺序组织的failure-sequence line,将Failure Modes and Effects Analysis(FMEA)失效分析、Fault Tree Analysis(FTA)交互关系分析以及启发式因果推理结合起来。通过这种方式,已有工程知识可以被系统化检索,组件之间的功能关系能够得到分析,并能够进一步判断某个局部故障会如何影响其他组件。论文以Solid Oxide Fuel Cell(SOFC)系统进行演示。结果表明,不同Failure Modes可能最终产生完全相同的Stack-level Failure表现,因此将最终故障与真正Root Cause重新关联非常重要。本文方法能够帮助操作人员理解潜在故障机理,并在最终严重后果出现以前采取及时的预防措施。

1. Introduction

现代工程系统的复杂性主要来自三个方面:规模不断扩大、系统中组件类型越来越多、组件之间的连接和依赖越来越密集。航空航天、汽车和工业系统都面临同样的问题:系统功能更强,但一个局部组件的异常也更容易通过接口和功能依赖影响其他组件,使可靠性、安全性和性能分析更加困难。

故障诊断尤其受到这种复杂性的影响。论文指出,复杂系统中Root Cause、Fault和Fault Symptom之间通常并不存在简单的一一对应关系。一个Root Cause可以引起多个Fault,一个Fault又可能产生多个Symptom;反过来,同一个Symptom也可能来自多个不同Fault,而同一个Fault也可能具有多个潜在Root Causes。因此,真正困难的并不是“有没有异常”,而是如何从已经观察到的症状重新恢复它们背后的因果关系。

目前Sensors和Data-driven Models已经被广泛用于Fault Diagnosis和Health Monitoring,但实际工业诊断仍然大量依靠专家和现场操作人员判断。Maintenance Logs、Fault Records以及其他历史文档中积累了很多有效知识,但这些知识通常以文本和表格的形式分散保存,缺少直观、系统和可重复的检索方式。本文因此并不试图完全以新的机器学习模型替代工程知识,而是希望把已有FMEA、FTA、故障记录和领域经验重新组织成一种透明的诊断结构。

Fault Signature Matrix(FSM)正是本文选择的基础工具。FSM能够以紧凑矩阵的形式建立Hypothesized Failure Modes和Measurable Symptoms之间的关系,但传统FSM通常是静态的:它只告诉分析人员“一个故障应该出现哪些症状”,没有记录这些症状何时出现、以什么顺序出现以及沿哪些组件传播。当多个故障共享同一组最终症状时,这种静态表示就很难继续向上游定位Root Cause。

传统FSM与本文扩展FSM的对比

1.1. Automated fault diagnosis in complex systems

复杂系统中一个常见的自动Fault Diagnosis思路是Residual-based Diagnosis,即把实际系统测量结果与模型预测值比较,形成Residual。当Residual超过设定Threshold时,就认为相关变量出现异常。

Residual也是构建Fault Signature的重要基础。已有工作利用Physics-based Knowledge提高Residual提取质量,也有研究将Residual进一步处理成二维Health Image并输入CNN,还有研究通过Bayesian Deep Learning表达Fault Signature的不确定性,或者通过Feature Filtering和Mapping提高实时诊断的特征可分性。

这些工作说明从Sensor Data中提取可靠Fault Signature非常重要,但本文进一步强调:Fault Signature本身仍然需要被解释。

实际传感器可能存在Noise、Missing Data或不完整测量。此时Domain Expertise仍然参与多个环节,包括:

  • 决定哪些Sensor Signals值得采集;
  • 确定采样频率;
  • 对Sensor Data进行Pre-processing;
  • 判断一个Observed Pattern是否具有故障意义;
  • 将数据模式重新关联到特定组件和Failure Mechanism。

因此,本文更关注Knowledge-based Approach。作者认为,在下一代Fault Diagnosis中,一个重要问题是如何把多个组件上的Monitoring Information和系统结构知识一起组织起来,使Raw Data能够转化为Actionable Information。

1.2. Fault signature matrix in residual-based approaches

传统FSM主要包含Faults和Symptoms两个核心元素。Symptoms通常来自Sensor Readings、Residuals或其他Monitored Variables。当Fault发生时,与该Fault相关的Symptom Entry被标记为1,否则为0。

论文使用一个简单矩阵说明FSM的Detection和Isolation能力:

  • f1 = [0,0,0,0,0]:没有任何关联症状,因此既不能检测,也不能隔离;
  • f2 = [1,0,1,0,0]
  • f3 = [1,0,1,0,0]

f2f3虽然可以检测,但因为它们具有完全相同的Symptom Vector,所以无法相互隔离;

  • f4 = [1,1,1,0,0]

f4具有Unique Symptom Vector,因此既可以Detection,也可以Isolation。

FSM曾经广泛应用于Fault Diagnosis,但随着系统复杂程度提高,其使用逐渐减少。作者认为主要原因有三点。

第一,Traditional FSM建立的是Static Fault-Symptom Relationship。它无法描述一个症状是在故障发生后立即产生,还是经过其他组件传播以后才产生。因此,它对Dynamic或Time-varying Behavior的表达能力有限。

第二,虽然FSM表中可以列出多个Faults,但推理往往仍然基于Single-fault Assumption。若两个Fault同时存在,Measured Symptom Vector可能不再与矩阵中的任何单独一行匹配,也可能与另一种Failure Signature混淆。

第三,即使某些FSM是在FTA之后建立,因此包含一定Interdependency Information,Traditional FSM通常也只把相关Symptoms放入同一行,而没有说明这些Symptoms之间的Causal Path。也就是说,它记录Correlation,但没有明确记录Propagation Direction和Temporal Sequence。

作者认为,FSM并不是没有价值,而是它没有充分利用前置Failure Analysis中已经形成的系统知识。如果能够把FMEA、FTA和维修经验中的因果信息重新映射到FSM中,它仍然可以成为Knowledge-based与Data-based方法之间的有效接口。

1.3. Contribution of this paper

本文提出一种Qualitative、Knowledge-driven的Traditional FSM Extension。

核心新增内容是failure-sequence line。它不再只把Symptoms放在一个无序集合中,而是根据它们在故障传播过程中的先后关系进行排列。这样,FSM从Static Association转化为带有Temporal Precedence的Representation。

这项工作建立在作者之前将FMEA与FTA结合构建FSM的研究基础上。此前的Phase 1和Phase 2分别负责:

  • FMEA:Failure Analysis;
  • FTA:Interaction Analysis。

本文进一步增加Phase 3:

  • Heuristic Causal Inference。

Phase 3对Symptoms分配不同Timing Labels,并明确区分Intermediate Symptoms和Consequence Symptoms,最终形成Failure-sequence Line。

作者使用三个Timing Labels:

  • X:Initial Effect;
  • 1:Immediate Effect;
  • 2:Delayed Effect。

另一个重要改进是保留Symptom Polarity。例如不再写“Temperature Abnormal”,而是写High Temperature或Low Temperature;不再只写“Flow Abnormal”,而是写Increase或Decrease。这样即使Sensor Family完全相同,也可能通过Directionality提高Fault Isolation能力。

论文主要贡献最终概括为两点:

  • 将Fault Signature Matrix扩展为Time-dependent Version;
  • 在SOFC系统中完整展示这种Fault Diagnosis Framework。

2. Development of extended FSM

本文首先给出Extended FSM的一般开发方法。目标是解决两个问题:一是如何系统提取已经存在于Maintenance Logs、Troubleshooting Manuals和专家经验中的Knowledge;二是如何描述某个组件性能退化后,通过功能依赖继续影响其他组件,最终降低系统总体性能。

扩展FSM方法的整体技术框架

Traditional FSM通常在Failure Analysis结束以后直接构造,而本文增加了一个完整的三阶段流程:

  1. FMEA完成Failure Analysis;
  2. FTA完成Interaction Analysis;
  3. Heuristic Causal Inference把症状按照传播顺序重新组织。

这种组织的意义在于:FMEA负责保证Failure Mode和Effect信息完整,FTA负责保证Interdependency显式进入模型,而Phase 3则把这些关系真正转换成可用于Diagnosis的Ordered Signature。

Extended FSM的三个Phase与具体步骤

2.1. Failure analysis

Phase 1使用FMEA,但作者强调这里关注的是System-level Failure Analysis,而不是只在Component Level逐项列故障。

Step 1.1: Select a component

首先列出分析范围中的Components和Subsystems,并明确每个组件的Purpose和Intended Function。随着系统规模扩大,直接分析全部组件会导致工作量迅速增长,因此作者建议必要时先使用Criticality Screening等成熟方法缩小候选集。

Step 1.2: Identify gradual degradation failures modes

识别每个组件可能发生的Gradual Degradation Failure Modes,即随着时间逐渐恶化并影响组件功能的失效机制。

Extended FSM最适合Wear、Corrosion、Fouling等具有连续发展过程的机制,因为这类Failure Mode通常会逐步产生一系列可以观测的症状,非常适合构造Fault Propagation Path。

Fatigue等Failure Mechanism则有所不同。由于其内部演化很难通过非破坏方式直接观察,在System Level上经常表现为Sudden、Irreversible Event。因此它虽然仍然可以进入Extended FSM,但通常对应一个近似零Propagation Window的Immediate或Consequence Event,最终表现和Classical FSM比较接近。

对于经验不足的分析人员,作者建议在这一阶段充分利用Maintenance Logs、Troubleshooting Manuals以及其他Documented Knowledge。

Step 1.3: Determine causes and effects of each failure mode

确定每个Failure Mode的Causes,并继续确定其Effects。这里的Effect不只局限于当前组件内部,还要明确这种异常是否会继续影响其他Subsystem Units。

Step 1.4: Determine observable system variables to detect each failure mode

确定可以用于识别该Failure Mode的Observable System Variables。这些Observable可以包括:

  • Sensor Measurements;
  • Inspection Findings;
  • Visual Observations;
  • Simple Computed Residuals。

这一步不是Traditional FMEA的标准列项,但对本文方法非常重要,因为Observable Symptom就是后续Failure Propagation Path的起点。

如果Failure Mode没有Direct Sensor,例如内部Catalyst Degradation,可以把它标记为Latent,并根据Physics或Simple Observer指定一个或多个Proxy Observables。

作者还特别强调实际部署时需要由Domain Experts确定Threshold和Directionality,例如:

  • High / Low;
  • Increasing / Decreasing;

相对于Nominal Condition的偏移。由于这些阈值高度依赖具体系统,论文没有统一给出。

2.2. Interaction analysis

Phase 2研究一个组件状态对其他组件的影响,也就是Functional Dependency。

组件越多,Dependency数量通常越大,而具有强Functional Tie的组件之间也更容易发生Fault Propagation。本文继续采用FTA显式表示这种Cause-effect Relationship。

作者并不是把FTA主要作为概率计算工具,而是把它作为组件传播关系的结构化表示工具

Step 2.1: Select the most critical component

首先选择Most Critical Component,并把其最不希望发生的状态设置为FTA Top Event。

论文假设关键组件已经知道;如果未知,建议先在Phase 1中执行FMECA,通过Criticality Assessment确定最关键对象。

Step 2.2: Identify first-level components

识别能够直接导致Top Event的组件。它们属于First-level Components,在FTA中表示Direct Events。

Step 2.3: Identify second-level components

针对每个First-level Component,继续寻找能够导致其Failure的其他Components。这些属于Second-level Components,是Indirect Events。

Step 2.4: Assign failure modes for each level

为FTA不同层级组件分配Phase 1中识别的Specific Failure Modes。

完成以后,FTA就不再只是“组件A和组件B与Top Event有关”,而是明确:

Component + Failure Mode → Downstream Component + Failure Mode → Top Event

由此得到后续Causal Inference能够使用的Propagation Skeleton。

2.3. Causal inference approach

Phase 3是本文在之前工作基础上的主要新增部分。

Fault Propagation被定义为由Initial Trigger开始、沿多个系统组件连续发展的Sequential Degradation Process。因此,仅知道FTA中谁依赖谁还不够,还需要把具体Symptoms放到传播路径上并确定它们的Temporal Order。

作者将Effects分成三类:

  • Initial Effect(X):离Failure Mode最近、最先能够测量到的Symptom;
  • Immediate Effect(1):通常发生在同一Component中,或者属于First-hop Consequence;
  • Delayed Effect(2):需要进一步沿System Dependency传播后才能出现,通常已经影响到下游Component。

这里的Expert Knowledge并不是完全自由发挥。FMEA已经限定了Failure Modes、Causes和Effects;FTA已经限定了Allowed Links。因此专家的任务主要是沿这些Documented Paths确定Directionality和Temporal Ordering。

作者认为,只要分析人员共享相似的System Knowledge,他们对主要传播方向和症状顺序应该能够形成较一致判断,即使不同专家最终给出的Sequence Granularity可能不同。

Step 3.1: Select a failure mode

针对每个Component,从Phase 1选取一个Failure Mode。

Step 3.2: Identify initial effect

把Step 1.4中确定的Observable Variable作为该Failure Mode的Initial Effect。

Step 3.3: Generate a failure scenario

从Initial Effect出发,根据Phase 2建立的Propagation Paths继续推理该故障对附近组件产生的Immediate或Delayed Effects。传播速度取决于Failure Mode性质:严重故障可能快速传播,而Gradual Degradation可能经过较长时间才影响下游组件。

Extended FSM中Initial、Immediate和Delayed Effect的构造方式

2.4. Example

作者使用一个由A、B、C、D、E五个组件组成的简单系统说明方法。

设Component C依赖A和B,Component E依赖C和D,且E是Critical Component。

如果A发生Failure,异常会先影响C,再进一步影响E。Traditional FSM能够告诉分析人员A的Failure对应sA、sC、sE等Symptoms,但这些Symptoms是无序的。

Extended FSM则把它表达为:

sA → sC → sE

因此,同样是Component E出现Failure,如果此前先出现sA,就可以把Root Cause追溯到A;若另一条路径来自B、C、D或E自身,则会形成不同的Failure-sequence Line。

论文强调,这种差异并不是简单地“把其他组件Symptoms增加到矩阵中”,而是显式加入Inter-component Dependencies和Sequential Emergence of Symptoms。

Traditional FSM通常提供Single-fault View,而Extended FSM可以表示多个Simultaneous或Competing Propagation Pathways,因而更适合复杂系统中的Simultaneous Fault Diagnosis。

3. Application and demonstration of extended FSM

作者选择Solid Oxide Fuel Cell(SOFC)作为Case Study。

SOFC具有典型复杂系统特征:

  • Component数量较多;
  • 同时包含Electrochemical Reaction、Heat Transfer和Mass Transport等Multi-scale Processes;
  • 一个Component的性能明显依赖其他Components,因此Interdependency很强。

这使SOFC非常适合展示Root Cause Identification和Fault Propagation Analysis。

3.1. Layout

SOFC系统结构与监测位置

案例使用一个Fuel Pre-reformed SOFC System。Stack周围的主要组件包括:

  • Air Blower;
  • Air Pre-heater;
  • Fuel Pre-reformer;
  • Post-burner。

Air Blower向Stack Cathode提供足够空气。空气除了参与Electrochemical Reaction,还用于Stack Cooling。

Air Pre-heater保证进入Stack的空气达到合适Operating Temperature。

Fuel Pre-reformer将输入燃料处理成Hydrogen-rich Fuel,并把Hydrogen送入Stack Anode。

Post-burner回收Exhaust Gas中的Heat,并将其重新提供给Pre-reformer和Air Pre-heater,也可以用于其他Cogeneration Applications。

Stack完成Chemical Energy到Electrical Energy的转换。

Fig. 8中的A~K表示后续用于Monitoring和Failure Analysis的具体位置。

3.2. Phase 1: failure analysis

作者基于已有SOFC FTA研究信息进一步构造FMEA。由于方法具有Design-oriented特点,其目标是在SOFC实际运行前识别可能导致Stack Failure的问题。

SOFC系统的FMEA结果

3.2.1. Step 1.1: select a component

本文分析四个主要组件:

  1. Air blower:向Stack提供所需Air Flow,同时承担Cooling功能。由于SOFC通常需要较高Volumetric Flow,Air Blower也是系统中Energy Consumption很高的设备。
  2. Air pre-heater:保证Stack工作在正确Temperature范围。
  3. Pre-reformer:将Fuel转换为Hydrogen-rich Gas,为SOFC Stack提供足够Hydrogen。
  4. Stack:通过Electrochemical Reactions把Chemical Energy转换为Electrical Energy。

3.2.2. Step 1.2: identify gradual degradation failures modes

主要Gradual Degradation Failure Modes记录在FMEA中。

Air Blower包含Fouled Air Filter、Air Flow Leakage、Surface Fouling等。

Air Pre-heater包含Piping Air Leakage、Cold Air Flow、Overheating和Surface Fouling。

Pre-reformer包含Fuel Leakage、Overheating、Surface Fouling。

Stack主要考虑Excessive Current Density和Electrolyte Degradation。

这些Failure Modes都能够通过Flow、Pressure、Temperature、Voltage或Power等变量产生可识别Effects。

3.2.3. Step 1.3: determine causes and effects of each failure mode

Air blower

Blocked/Restricted Air Intake是常见Failure。Filter随着运行积累Impurities,会增加Airflow Resistance并降低Filtration Effectiveness。环境中的污染物也会积累在部件表面。

Air Leakage可能由Loose Fittings、Seal Problems、Worn Valves等引起,从而显著降低Air Blower Efficiency。

Air pre-heater

Piping Air Leakage使Air Intake不足,会破坏Energy Conversion Process,增加System Temperature和Fuel Consumption。

Pre-reformer异常还可能以两种方式影响Pre-heater:

  • Cold Airflow使Pre-heater温度下降;
  • Overheating使Pre-heater Outlet Temperature异常升高。

长期运行形成的Fouling Deposit会阻碍Heat Transfer,降低Pre-heater Efficiency。

Pre-reformer

Fuel Flow Leakage会使Stack Anode获得的Fuel不足,并导致Fuel Consumption上升。

Post-burner Degradation可能造成Outlet Temperature过高,使Pre-reformer出现Overheating。

Surface Fouling会降低Pre-reformer Efficiency。

Stack

Excessive Current Density通常来自过高Power Demand或Operational Error,会增加Ohmic Loss和Local Heat Generation,并加速Degradation和Thermal Stress。

Electrolyte Damage/Degradation会降低Ionic Conductivity,使Electrochemical Reaction Rate下降、Ohmic Resistance上升,最终使Stack Temperature和Performance下降。

3.2.4. Step 1.4: determine observable system variables to detect each failure mode

FMEA最后为每个Failure Mode绑定可观测Symptoms。

论文共使用Flow(F)、Pressure(P)、Temperature(T)、Voltage(V)、Current(I)等Sensor Families。

例如:

  • Low Air Flow;
  • Decrease in Pressure;
  • High Temperature;
  • Low Temperature;
  • Decrease in Voltage;
  • Gradual Reduction in Power;
  • Sudden Drop in Power。

这些Symptoms不仅用于Detection,也会成为Phase 3中Failure-sequence Line的节点。

3.3. Phase 2: interaction analysis

这一阶段通过FTA识别SOFC组件之间最重要的Dependencies,并由此确定Failure Propagation Paths。

以SOFC Stack Failure为Top Event的FTA

3.3.1. Step 2.1: select the most critical component

Stack是Fuel Cell Power System的核心,因此被选为Most Critical Component,即FTA Top Event。

这意味着本文主要研究哪些Failure Paths最终能够导致Stack Failure。

3.3.2. Step 2.2: identify first-level components

除Stack本身外,系统还有Air Blower、Air Pre-heater、Pre-reformer和Post-burner等Relevant Components。

Post-burner会通过Heat Exchange同时影响Pre-reformer和Air Pre-heater,理论上可能形成Closed Loop。为了避免把分析扩展成无限循环,本文只在与其相关的Propagation Path中考虑Post-burner对Pre-reformer的影响。

因此,本Interaction Analysis主要保留四个组件:

  • Air Blower;
  • Air Pre-heater;
  • Pre-reformer;
  • Stack。

其中Air Pre-heater和Pre-reformer直接影响Stack,因此属于First-level Components / Direct Events。

3.3.3. Step 2.3: identify second-level components

Air Blower会影响Air Pre-heater,因此Air Blower属于Second-level Component。

Post-burner会影响Pre-reformer,因此它也位于Pre-reformer对应Propagation Branch的上游。

这些Second-level Events属于Indirect Events,因为它们不会立即作用到Stack,而是首先改变First-level Component,然后进一步传播。

3.3.4. Step 2.4: assign failure modes for each level

把FMEA中已经识别的Specific Failure Modes分配到FTA不同层级。

完成后,FTA可以同时告诉分析人员:

  • 哪个Component是Root Cause所在位置;
  • 它发生的是哪一种Failure Mode;
  • 它通过哪个Component继续向Stack传播。

因此Phase 2为Phase 3构造Causal Sequence提供明确拓扑基础。

3.4. Phase 3: causal inference approach

Phase 2已经说明不同组件之间的Dependency,但仍没有回答“应该监测什么Signal”和“这些Signal什么时候出现”。

Phase 3把System Variables和Failure States连接起来,使用Heuristic Causal Inference建立Propagation Paths。

论文给出两个前提。

第一,每个Failure Mode都可以作为一个Failure Scenario的起点。Stack本身可以由于Excessive Current Density或Electrolyte Degradation独立失效,也可以受到其他组件的Degradation影响。

第二,本文只分析最Relevant Failures,而不是试图穷尽SOFC中所有High-level Degradation Mechanisms。重点是说明Root Cause、Fault Type和Fault Symptoms之间的关系。

3.4.1. Step 3.1: select a failure mode; and Step 3.2: identify initial effect

从FMEA中逐个选择Failure Mode,并把Step 1.4确定的Detection Symptom作为Initial Effect。

例如:

  • Fouled Air Filter对应Low Air Flow;
  • Fuel Leakage对应Low Fuel Flow;
  • Stack Excessive Current Density对应Temperature Increase。

Initial Effect在Extended FSM中标记为X

3.4.2. Step 3.3: generate a failure scenario

以Initial Effect为起点,再根据FTA关系加入可能出现在其他Components中的Immediate和Delayed Effects。

论文最终定义24个Monitored Symptoms。

其中特别区分:

  • s23:Gradual Reduction in Power;
  • s24:Sudden Drop in Power。

二者虽然都是Power下降,但Failure Dynamics不同,因此对应不同Root Causes。

3.4.2.1. Air blower.

Air Blower属于Indirect Event,即它不会直接影响Stack,而是先影响Air Pre-heater,再进一步影响Stack。

对于Fouled Air Filter and Ducts(f1.1),Initial Symptom是System Air Intake降低,即s1

由于Air Intake不足,会立即产生:

  • Air Blower Pressure下降(s3);
  • Blower Outlet Air Flow降低(s4)。

根据FTA,Air Blower继续影响Air Pre-heater,因此Delayed Effect包括:

  • Pre-heater Outlet Air Flow降低(s13)。

低Air Flow进一步造成Stack Cooling不足和Non-uniform Temperature Distribution,从而出现:

  • Stack Temperature增加(s16、s17、s18);
  • Stack Voltage下降(s22);
  • Gradual Power Reduction(s23)。

Air Flow Reduction in Blower System(f1.2)具有相似传播后果,但Initial Observable不同:首先观测到的是Blower内部Flow Reduction(s2)。

Fouled Surfaces(f1.3)则首先表现为Air Blower Outlet High Temperature(s5),随后仍会沿热过程传递到Pre-heater和Stack,最终导致Thermal Fatigue、Voltage下降和Gradual Power Reduction。

3.4.2.2. Air pre-heater.

Air Pre-heater属于Direct Event,因此它的异常可以直接传播到Stack。

Piping Air Leak(f2.1)首先通过Pre-heater Inlet Flow下降(s12)被检测,随后立即表现为Cathode Inlet Low Air Flow(s13),再逐步导致Stack内部Temperature Distribution异常(s16、s17、s18)。

Cold Air Flow(f2.2)可以先通过Pre-reformer Outlet Low Temperature(s8)识别,随后使Pre-heater Temperature降低(s15),最终导致Stack Temperature降低(s19、s20、s21)以及Sudden Power Drop(s24)。

相反,Overheating(f2.3)首先表现为Pre-reformer Outlet Temperature过高(s9),随后使Pre-heater Outlet出现High Temperature(s14),进一步使Stack Temperature升高(s16、s17、s18),最终引起Voltage下降(s22)和Gradual Power Reduction(s23)。

Surface Fouling(f2.4)主要阻碍Heat Transfer,因此会降低Pre-heater以及Stack相关Temperature,最终形成一组Low-temperature Symptoms。

3.4.2.3. Pre-reformer.

Pre-reformer同样属于Direct Event。

Fuel Leak(f3.1)首先表现为Pre-reformer Inlet Fuel Flow降低(s7),随后Anode获得的Fuel不足,Stack出现Uneven Temperature Distribution(s19、s20、s21)并产生Sudden Power Drop(s24)。

Overheating的初始来源是Post-burner Outlet Excessive Temperature(s6)。其Delayed Effect是系统Temperature逐步上升(s11、s16、s17、s18),最终引起Thermal Fatigue,表现为Voltage Reduction(s22)和Gradual Power Reduction(s23)。

Surface Degradation due to Fouling(f3.3)首先表现为Anode Inlet Low Temperature(s10),随后降低Fuel Conversion Efficiency,使Stack Temperatures降低并导致明显Power Drop。

3.4.2.4. Stack.

Stack是Top Event,但它也可以Independent Failure。

Excessive Current Density会产生Excessive Heat,因此首先看到:

  • Stack Temperature Increase(s16);
  • High Cathode/Anode Outlet Temperature(s17、s18)。

随后表现为:

  • Stack Voltage下降(s22);
  • Gradual Power Reduction(s23)。

Electrolyte Degradation则降低Ionic Conductivity,使Electrochemical Reaction减弱,表现为:

  • Stack Temperature下降(s19);
  • Anode/Cathode Outlet Low Temperature(s20、s21);
  • Sudden Significant Power Drop(s24)。

这说明同样是Stack Power Loss,其上游Temperature Direction和前置Symptoms可能完全不同。

3.4.3. Implementation

Extended FSM实际实现时,首先建立一个包含Detection Symptoms、Immediate Effects和Delayed Effects的Table,然后把Failure Modes逐行放入矩阵,最后根据前述Failure Scenarios填入Timing Labels。

SOFC系统最终形成的Extended Fault Signature Matrix

最终工具包含:

  • 12个Failure Modes;
  • 24个System Variables;
  • 其中10个Failure Modes用于分析它们如何贡献到Stack Failure。

矩阵标注方式为:

  • X:Initial Effect;
  • 1:Immediate Effect;
  • 2:Delayed Effect。

作者同时说明,为了实际部署,仍然需要进一步确定什么程度的Deviation才能被判定为Fault Symptom。论文中的症状阈值只是结构性表示,没有进行具体数值Calibration。

4. Benefits and validation of extended FSM

Extended FSM中每一行都形成一个Fault Signature。

在本文案例中,所有完整Signature Vectors都不同,因此理论上12个Failure Modes都可以Unique Identification、Detection和Isolation。

论文用Fig. 11右侧的传统表示进行对照:如果不显式考虑Interdependencies,也不执行Phase 3 Causal Inference,得到的只是无序Symptom Vectors;左侧Extended FSM则把Intermediate Symptoms和Timing关系加入其中。

Immediate Effects通常发生在一个Component内部,而Delayed Effects往往发生在跨Component Propagation以后,这与实际工程中“局部变化先发生、系统后果后出现”的直觉一致。

最重要的现象是:Stack自身的两个Failure Modes具有不同Signature,但很多上游Failure Modes最终会重复产生类似Stack-level Consequence Symptoms。如果只看Final Stack Symptoms,就很难判断真正Root Cause。

因此Extended FSM的主要改进可以归纳为:

  1. 通过结构化和排序Symptoms提高Root Cause Identification;
  2. 通过Explicit Direct/Indirect Causalities表达Fault Propagation。

4.1. Higher-granularity root-cause isolation from the same sensor families

作者将本文方法与已有SOFC FSM研究进行比较。

Arsie et al.使用15个Variables监测5个Component Faults,但Failure定义较宽泛,例如只写Performance Degradation。

Yousfi Steiner et al.进一步区分了具体Component Failure Modes,例如把Air Blower Failure拆为Mechanical Loss Increase和Air Leakage。

本文则分析12个Failure Modes,并明确整合:

  • FMEA;
  • FTA;
  • Heuristic Causal Inference。

已有研究主要支持Detection和Isolation,而本文增加Identification,并把FSM从Fully Diagnostic Type扩展为同时具有Diagnostic和Predictive特征。

4.1.1. Comparison under same sensor families

为了验证Improvement不是单纯因为增加Sensor,作者只使用参考研究中已经存在的15组Residual Sets来测试本文12个Failure Modes。

相同Sensor Families下传统表示与Extended FSM的Confusion Matrix

主要区别是本文保留Polarity。

如果参考文献只把某一测点表示为“Temperature Abnormal”,本文则进一步区分:

  • High Temperature;
  • Low Temperature。

在完全使用相同Sensor Families的条件下,只保留这种Directionality Information,就能够明显减少Signature Collision。

Fig. 13a中一些Failure Modes仍然在Confusion Matrix中出现Off-diagonal Clusters,说明15个Residuals不足以完全Isolation全部12种Failure Modes。

当采用本文定义的High/Low Symptoms后,Fig. 13b出现更加清晰的Diagonal,说明不增加Instrumentation也可以提高Root Cause Granularity。

4.1.2. Progressive gains from stack consequences to upstream causes

论文进一步从Stack向Air Blower逐步增加Symptoms,观察Root Cause Isolation能力变化。

从Stack Consequence逐步加入上游Symptoms后的Isolation改善

Scenario A只使用Stack Sensors:

s16 ~ s24

Unique IDs为:

0 / 12

也就是说,只看Stack Consequence无法唯一识别任何Root Cause。

随后逐步加入上游Measurements:

  • Scenario B加入Location D Temperature;
  • Scenario C加入Location D Flow;
  • Scenario D加入Location C Flow;
  • Scenario E加入Location G Temperature;
  • Scenario F加入Location J Temperature;
  • Scenario G加入Location F Fuel Flow。

到Scenario G,已经能够:

10 / 12

唯一识别Root Causes。

继续加入s6、s5、s4、s3时Unique IDs仍保持10,说明这些Measurements虽然增加信息,但没有突破最后两个Ambiguities。

直到Scenario L加入Air Blower Flows2

12 / 12

全部Failure Modes得到Unique Isolation。

最后再增加s1也不再提高结果。

这个实验有两个工程意义。

第一,Extended FSM可以从Consequence Symptoms逐步向上游Root Cause反推,清楚展示哪些Measurements真正增加诊断信息。

第二,它可以直接支持Sensor Investment Decision:不是Sensor越多越好,而是应优先增加能够打破当前Ambiguity Plateau的Sensor Family。

4.1.3. Deterministic sensor removals

作者反向进行Grouped Sensor Removal。

移除所有Stack上游Flowmeters,包括s1、s2、s4、s7、s12、s13以后,Isolation能力有所下降,但仍有多个Failure Modes保持Unique。这说明Flow Measurements虽然重要,但在Temperature和Stack Variables仍存在时,部分信息可以被替代。

相反,如果移除所有Non-stack Temperature Measurements,包括s5、s6、s8~s11、s14、s15,Confusion Matrix会明显破碎成多个Two-way或Three-way Clusters,只剩4个Modes能够Unique Isolation。

因此在本案例中:

  • Temperature Evidence主要负责区分不同Failure Branch;
  • Flowmeter Evidence进一步细化同一Branch中的Fault Distinction。

这为SOFC Sensor Architecture提供了非常直接的设计依据。

4.1.4. Stochastic sensor removals

为了模拟真实系统中的Sensor Failure、Data Loss和Communication Dropout,作者进一步进行Monte Carlo Simulation。

随机Sensor Dropout下Traditional FSM与Extended FSM的诊断鲁棒性

每个Symptom Channel以Probability p独立被移除,以1-p概率保留。每个Dropout Level运行1000次Independent Realizations。

结果显示,随着Dropout增加,两种FSM的Root Cause Isolability都下降,但Extended FSM始终更高,而且差异会逐渐扩大。

当:

p = 0.30

Extended FSM平均仍能保持:

81.0%

Unique Root Causes,而Traditional FSM为:

73.7%

差异约:

+7.3 percentage points

当:

p = 0.40

Extended FSM为:

72.1%

Traditional FSM为:

63.7%

差异扩大到:

+8.4 percentage points

作者据此认为,Timing Information和Ordered Signature能够在Incomplete Sensing条件下减少Signature Collision,因此对不确定Instrumentation Condition更鲁棒。

4.2. From diagnosis to predictions

本文方法最大的进一步价值是同时支持Backward Diagnosis和Forward Prediction。

Traditional FSM主要执行Binary Matching:Measured Symptom Vector完整匹配某一行以后,才把它识别为对应Fault。

Extended FSM则可以只使用Sequence中已经出现的Early Symptoms判断当前处于哪一个Propagation Stage。

例如完整Observed Vector:

S1 = [s5, s14, s16, s17, s18, s22, s23]

表示Air Blower Surface Fouling(f1.3)最终传播成Stack Fault。此时Traditional FSM和Extended FSM都可以识别。

但如果目前只观测到:

S2 = [s5, s14]

Traditional FSM由于Signature尚不完整而难以匹配。

Extended FSM则可以判断:

  • Air Blower已经Degraded;
  • 当前影响已经传播到Air Pre-heater;
  • Stack-level Consequence尚未出现;
  • 如果不采取措施,下一阶段可能出现Stack Temperature、Voltage和Power异常。

同样,如果只出现Early Cue:

S3 = [s7]

Sequence Structure能够约束下一步合理的Branch Cue,例如s10,从而提示Operator在相应Time Window内重点检查相关变量。

因此Extended FSM不仅Detect Final Failure,还能识别Intermediate Stage并暴露Actionable Window。

带Timing Labels的Failure Signature与预防性干预窗口

论文进一步把Timing Labels与Operation/Maintenance Action建立对应:

  • X (initial):Informational Notice。增加Monitoring并寻找Second Independent Indicator;建立Watch Item,但暂时不创建正式Work Order。
  • 1 (immediate):Reduce Risk Now。采取Protective Trim/Derate、通知Shift Lead,并准备Work Order。
  • 2 (delayed):Plan Before Impact。在Safe Envelope内继续运行,同时生成Prognostic Alert,并在下一可用窗口安排On-condition Task。
  • Consequence:Mitigate/Stop。立即执行Corrective Action和Corrective Maintenance。

需要注意的是,这里的Time Dependence仍是Qualitative Timing Class,而不是定量的Seconds/Minutes/Hours。

作者明确说明,本研究的Validation仍然是Qualitative,Propagation Probability和具体Time Threshold留待Future Work。

4.3. Practical relevance

论文总结了三个直接工程价值。

第一,Root Cause定位更加具体。

当Fault已经被Detection以后,Ordered Symptoms可以帮助Operator从Final Consequence回溯Root Cause,采取针对性Component Replacement或Focused Intervention,而不是进行大范围Troubleshooting。

第二,支持Preventive Maintenance。

如果当前只出现Initial/Immediate Symptoms,但Failure-sequence Line已经表明后续可能影响Critical Component,就可以利用尚未发生Consequence的Window提前安排维护,减少Damage和Downtime。

第三,支持Sensor Architecture Design。

Progressive Sensor Addition和Sensor Removal结果可以说明哪些Measurements真正增加Fault Isolation Information。企业可以据此判断增加某一个Sensor是否值得,而不是盲目扩大Instrumentation。

作者认为该方法可以推广到其他具有复杂Component Relationships的系统。结构化的Step-by-step Process也有助于经验较少的分析人员构建FSM,而对Experienced Users而言,它则可以作为防止遗漏Critical Relationship的检查框架。

5. Conclusion

本文提出一种用于改善Complex System Root Cause Identification和Fault Propagation Tracing的方法。

Traditional FSM能够进行Fault Detection和Isolation,但对Root Cause的识别能力有限。本文通过:

FMEA + FTA + Heuristic Causal Inference

扩展FSM。

其中:

  • FMEA在System Level识别Failure Mode、Cause、Effect和Observable Variable;
  • FTA显式表示Inter-component Dependencies;
  • Phase 3把这些Dependency继续传递到Time-ordered FSM中,把Symptoms组织为Initial、Immediate和Delayed Effects,形成Failure-sequence Line。

由此,Extended FSM能够同时支持:

  • Fault Detection;
  • Fault Isolation;
  • Root Cause Identification;
  • Fault Propagation Analysis;
  • Early-stage Prediction。

SOFC案例说明Stack Failure通常不是独立事件。多个不同Upstream Failure Modes可以产生相同Stack-level Symptoms,因此只看Final Consequence不足以确定真正原因。Extended FSM通过Upstream Symptoms、Polarity和Sequential Ordering把这些路径区分开来。

在相同Sensor Families下,增加High/Low等Directionality已经能够提高Isolation;从Stack向上游逐步增加Symptoms后,12个Root Causes的Unique Isolation由0/12提高到12/12;在Random Sensor Dropout实验中,Extended FSM在30%和40% Dropout下仍分别保持81.0%和72.1%的平均Unique Isolability,均优于Traditional FSM。

作者同时指出Generalizability和Scalability问题。系统规模越大,Failure Modes、Dependencies和Candidate Symptoms数量越多,Knowledge Engineering工作量会明显增加。Online Diagnosis本身仍然较轻量,因为Signature Matching计算成本低,但离线枚举大量Propagation Path可能成为复杂系统中的瓶颈。因此推荐先使用Criticality Screening缩小分析范围。

未来还可以进一步和Prognostics融合。若多个Sensor能够沿已知Propagation Path观察Degradation Trend,那么System-level Remaining Useful Life(RUL)就可以考虑上游故障对下游组件寿命的影响,而不再把各组件独立估计。

最后,作者明确把当前研究定义为Qualitative and Structural。论文没有报告Isolation Time、False-positive Rate、Propagation Path Probability等定量指标,也没有使用真实SOFC Dataset。未来需要使用真实数据验证Interdependency和Timing Labels的收益,并把Extended FSM与Signal Processing或Model-based Features结合。

作者还提出一个值得注意的发展方向:Extended FSM可以直接映射到Causal Graphical Models,例如Bayesian Networks。FSM负责透明地组织Domain Knowledge和Temporal Precedence,而Bayesian Network则可以在未来获得Data或Prior以后完成Quantitative Inference。

论文评价

  • 推测的软件工具链: 论文没有明确披露一个专门的软件平台或编程语言,且Data Availability明确说明“No data was used for the research described in the article”。当前工作主要由FMEA表、FTA、Extended FSM、Failure-sequence Line、Confusion Matrix以及Monte Carlo Sensor Dropout实验组成,因此实际实现很可能采用表格工具维护FMEA/FSM、常规绘图工具建立FTA,再使用MATLAB或Python完成Confusion Matrix和Monte Carlo分析,但正文没有足够证据确认具体软件。当前方法的核心不是软件平台,而是如何把Failure Knowledge转化为结构化诊断模型。
  • 收录原因: 这篇文章的创新点并不是重新设计FMEA或FTA本身,而是解决Traditional FSM的一个具体缺口:传统矩阵只有Fault-Symptom静态关联,无法表达跨组件传播和症状先后顺序。作者使用FMEA保证Failure/Effect信息,使用FTA保证Interdependency进入模型,再通过Causal Inference形成Failure-sequence Line,使同一套Knowledge能够同时服务Root Cause Identification和Forward Prediction。更重要的是,文章没有只展示一个Extended Matrix,而是通过Same Sensor Families、Progressive Sensor Addition、Deterministic Sensor Removal和Stochastic Dropout等多组实验验证了结构性收益,因此具有较完整的方法验证链。
  • 值得借鉴: 最值得借鉴的是FMEA、FTA和FSM之间的信息流设计。FMEA负责“Failure Mode是什么、Effect是什么、哪些变量可以观测”,FTA负责“组件之间如何依赖、Fault可能沿哪条路径传播”,Extended FSM再进一步负责“Symptoms按照什么顺序出现”。这种组织把传统安全分析文档从彼此独立的结果表变成可以连续传递的信息链。另一个非常值得借鉴的点是Polarity-aware Symptoms:不额外增加Sensor,只把“abnormal temperature”细化为High/Low,就可以明显提升Isolation。Progressive Sensor Sets和Sensor Removal也非常适合用作安全监测系统的Sensor Selection实验。最后,X/1/2 Timing Label虽然简单,但把诊断结果直接连接到Monitoring、Protective Operation和Condition-based Maintenance,为Safety Analysis结果如何进入实际运维提供了很清晰的接口。
  • 可能不足: 论文标题中的“time dependence”需要谨慎理解:当前方法主要增加的是Temporal Precedence和Qualitative Timing Class,而不是严格的Quantitative Time Resolution。X/1/2只表示Initial、Immediate、Delayed,并没有具体Propagation Delay、Probability Distribution或State-dependent Trigger,因此还不能回答“故障经过多少秒传播到下一组件”。Phase 3仍依赖Expert Knowledge,FMEA和FTA虽然约束了可选节点和路径,但专家对Timing Label和Sequence Granularity的判断尚未通过真实实验数据验证。SOFC案例没有使用真实运行数据,因此Confusion Matrix主要验证的是Signature结构上的可分性,而不是噪声、工况变化和阈值误差条件下的Online Diagnosis Accuracy。论文也没有给出False Positive、False Negative、Isolation Time和Propagation Probability。随着系统规模增大,离线构建Propagation Path的Knowledge Engineering Cost可能迅速增加。因此,本文更适合作为一种透明、可追溯的Knowledge-based Fault Propagation Representation,后续如果与动态仿真、真实Sensor Data或Bayesian/Causal Model结合,才会进一步形成真正定量的时序故障传播分析框架。