笔记:Failure mode and effect analysis improvement: A systematic literature review and future research agenda
Abstraction
Failure mode and effects analysis (FMEA) is a reliability management technique commonly utilized in various industries to guarantee the security and reliability of systems, services and projects. Nonetheless, the classical risk priority number (RPN) method has been criticized for many inherent deficiencies in the literature. Over the last decades, plenty of models and approaches have been employed to enhance the inherent characteristics of FMEA, but few contributions are devoted to review and summarize the related researches on FMEA improvement. Therefore, this paper aims to conduct a systematic review of the journal articles on the topic during the years between 1998 and 2018. A metadata statistical analysis is undertaken to present an overview of publication distribution across time and journals. Besides, a bibliometric analysis is performed to identify the most influential authors, institutions and areas, reveal the research hotspots and give an insight into the theme evolution in this field. The results indicated that the annual publications on FMEA improvement are rising quickly in the past two decades, especially after 2013; Liu HC, Chang KH, Kumar D, Sharma RK and You JX are the most prolific researchers; and Asian especially China is the major contributor in this field. Moreover, “healthcare failure mode”, “risk ranking”, “extended FMEA”, “gray theory”, “risk evaluation”, and “fuzzy inference” are the research focuses in improving the traditional FMEA.
摘要翻译:故障模式与影响分析(FMEA)是一种广泛应用于多个行业的可靠性管理技术,用于保障系统、服务和项目的安全性与可靠性。然而,传统风险优先数(RPN)方法在已有研究中受到许多批评。过去几十年中,大量模型和方法被用于改进FMEA,但系统总结FMEA改进研究的工作相对有限。本文因此对1998—2018年间有关FMEA改进的期刊论文开展系统性文献综述。作者首先通过元数据统计分析梳理论文随时间和期刊的分布情况,随后使用文献计量方法识别主要作者、机构和研究区域,分析研究热点及主题演化。结果表明,FMEA改进研究在过去二十年快速增长,尤其是2013年以后增长明显;Liu HC、Chang KH、Kumar D、Sharma RK和You JX是发文较多的研究者;亚洲特别是中国是这一领域的重要贡献地区。“healthcare failure mode”“risk ranking”“extended FMEA”“gray theory”“risk evaluation”和“fuzzy inference”构成了传统FMEA改进研究中的主要主题。
Introduction
FMEA是一种典型的前馈式可靠性与安全分析方法,其核心不是在事故发生后追溯原因,而是在系统、产品或过程投入使用前识别已知或潜在故障模式,并采取预防和改进措施。当分析进一步包含Criticality Analysis时,通常称为FMECA。
论文把一个完整FMEA概括为四个主要步骤:
- 识别系统中已知或潜在的故障模式;
- 确认每个故障模式的原因和影响;
- 根据风险优先数(RPN)对故障模式进行排序;
- 对高风险故障采取纠正或缓解措施。
传统FMEA虽然直观、易用,并已广泛用于制造、航空航天、医疗等领域,但围绕经典RPN的风险评价方式长期存在争议。由此形成了一个规模很大的“FMEA improvement”研究方向,主要围绕故障模式风险评价、风险因子权重和风险排序机制进行扩展。
已有FMEA综述大多采用人工分类和定性总结。本文希望使用更可重复的系统性检索流程与文献计量方法,减少文献选择和主题归纳中的主观性,并回答三个问题:这个领域由哪些研究者和机构推动、主要研究热点是什么、这些热点在二十年间如何演化。
Research methodology

整套综述流程包括四个阶段:Keyword Definition、Data Collection and Identification、Metadata Statistical Analysis和Bibliometric Analysis。
Keyword definition
作者采用两级关键词结构进行检索。第一层以FMEA或FMECA限定研究对象,第二层再分别组合以下主题:
risk priority number/RPN;risk evaluation/risk assessment;risk prioritization/risk ranking;risk factor weight/weight of risk factor;reliability analysis/reliability management;criticality analysis。
这种结构实际上已经反映了论文对“FMEA改进”的界定:研究重点主要放在风险计算、风险评价和排序方法的改进,而不是简单收集FMEA应用案例。
Data collection and screening
检索数据来自Web of Science(WoS),时间范围为1998—2018年,只保留Journal Article。初始检索得到2148条记录,去重后剩1022篇;标题和摘要筛选后剩819篇,随后进行全文筛选,最终得到263篇正式进入分析的论文。
筛选标准也比较严格:
- 保留以克服传统FMEA缺陷、提出FMEA改进方法为目标的论文;
- 排除仅将FMEA应用到某个工程案例、但没有方法改进的论文;
- 将主要讨论FMEA自动化实现的文章视为与本综述主题无关;
- 两位作者独立完成筛选,并对不一致结果进行协商。
因此,本文得到的263篇论文不是“全部FMEA研究”,而是一个专门面向FMEA方法改进的子集。
Bibliometric analysis
文献计量部分主要使用CiteSpace。分析内容包括作者与机构合作网络、作者与参考文献共被引、关键词共现、关键词突现、关键词时间线和聚类分析。机构地理分布还结合Google Earth进行展示。
与只按主题人工归类相比,这种方法可以从发文、引用和关键词关系中识别研究群体与主题结构,但得到的是文献网络层面的“研究版图”,并不直接评价某一种FMEA方法在工程应用中的真实效果。
Publication landscape

1998—2018年间,FMEA改进研究总体呈持续增长趋势,2014年前后开始明显加速。最后五年共发表159篇,占全部263篇的60%;到2018年,年度论文数量已经达到44篇。这个趋势说明,传统RPN及其改进问题在2010年代后期仍然是可靠性研究中的活跃主题。

263篇论文分布在105种期刊中。发文数量最多的期刊包括:
- International Journal of Quality and Reliability Management:26篇;
- Quality and Reliability Engineering International:19篇;
- Expert Systems with Applications:14篇;
- Applied Soft Computing:13篇;
- Safety Science:12篇;
- Reliability Engineering & System Safety:10篇。
这个期刊分布也反映出FMEA改进研究具有明显的交叉特征:一部分属于传统可靠性与质量工程,另一部分则大量借用模糊理论、智能决策与多准则决策方法。
Authors and research groups
作者使用发文量、总被引和篇均被引三个指标衡量研究者贡献。按照发文量,Liu HC以26篇位居第一,其后为Chang KH(14篇)、Kumar D和Sharma RK(各13篇)、You JX(12篇)。按照总被引,Liu HC同样排名第一;而按照篇均被引,Wang YM、Chin KS和Yang JB位于前列。

合作网络中形成了7个较明显的研究群体,其中几类具有代表性:
- Liu HC / You JX研究群体:重点处理传统FMEA中的风险评价、风险因子权重和故障模式排序,使用过D numbers、灰色关联投影、模糊AHP、熵权、VIKOR、犹豫语言集、前景理论和QUALFLEX等方法;
- Sharma RK / Panchal D相关群体:一支更关注模糊规则库与模糊推理,另一支结合灰色关联分析和模糊决策方法处理工业系统风险分析;
- Chang KH研究群体:重点研究故障模式风险估计和排序机制,涉及直觉模糊集、TOPSIS以及指数型RPN等方法。
这些研究群体的共同特点是:多数改进并没有改变FMEA“识别故障模式—评价风险—排序”的基本流程,而是持续修改其中的评价信息表达、权重确定和排序算法。
Institutions and geographical distribution
从机构和国家分布看,论文认为亚洲是FMEA改进研究的主要贡献地区,研究活动在中国东南部尤其集中。发文最多的机构包括同济大学22篇、上海大学21篇、R.O.C. Military Academy 13篇和National Institute of Technology 12篇。
合作网络表明,中国与英国、美国、加拿大之间存在较多合作;同济大学与上海大学、R.O.C. Military Academy与National Chiao Tung University、University Malaysia Sarawak与Deakin University之间也形成了较明显的机构合作关系。
这里的结论本质上反映的是论文所选263篇文献中的作者和机构分布,因此更适合用于描述这一特定文献集合,而不是直接等价于全球全部FMEA研究的绝对格局。
Co-citation analysis and research hotspots
作者共被引分析显示,Bowles and Peláez、Liu HC、Wang YM、Pillay and Wang、Braglia等工作在FMEA改进研究中具有较强影响。早期经典工作已经开始使用模糊逻辑、灰色理论和AHP等方法处理传统FMEA中风险评价与排序的问题。

参考文献共被引分析最终形成6个主要主题簇:
Healthcare failure mode
医疗风险管理是最明显的应用主题之一。改进FMEA被用于麻醉过程、医院采购、输血、放疗等场景,目标通常是识别医疗流程中的潜在故障并提高患者安全。
Risk ranking
Risk ranking是持续时间最长的主题。传统RPN的风险排序受到大量质疑,因此研究者引入DEMATEL、模糊规则系统、语言加权几何算子和证据推理等方法,希望得到更加稳定和可信的故障模式优先级。
Extended FMEA
这一类工作直接扩展传统FMEA的评价框架,例如引入多专家—多准则决策、Utility Priority Number(UPN)以及面向成本的Priority-cost FMECA,使风险排序不仅依赖传统RPN。
Gray theory
灰色理论主要用于处理信息不完整条件下的风险评价。相关研究通常将灰色关联分析与模糊FMEA结合,用于产品、过程和复杂工业系统的故障风险排序。
Risk evaluation
Risk evaluation关注如何表达专家在Occurrence(O)、Severity(S)和Detection(D)上的不确定判断。模糊集、直觉模糊集、区间直觉模糊集和语言分布评价等方法在这一主题中大量出现。
Fuzzy inference
模糊推理通过if-then规则建立风险因子与故障风险等级之间的映射。相比直接计算O × S × D,这种方法允许使用语言变量和非线性规则描述专家经验,因此成为FMEA改进中的一条长期技术路线。
Keyword evolution
关键词共现结果中,FMEA、system、risk evaluation、criticality analysis、failure mode和prioritization处于网络中的重要位置。围绕不确定信息处理,常见方法包括fuzzy set、Pythagorean fuzzy set、evidential reasoning、Dempster-Shafer theory和D number;围绕故障模式排序,则大量出现AHP、TOPSIS、VIKOR、DEMATEL、DEA和fuzzy inference system。

作者把1998—2018年的研究演化划分为四个阶段:
- Nascency stage(1998—2008):相关论文数量较少,研究主题尚未形成密集网络;
- Growth stage(约2009以后):
failure mode、prioritization和risk priority number等关键词开始明显增长; - Explosion stage(2012—2015):fuzzy FMEA快速发展,fuzzy set、fuzzy logic、fuzzy inference system和fuzzy TOPSIS等方法集中出现;
- Lucubration stage(2016—2018):研究开始进一步使用Dempster-Shafer theory、Pythagorean fuzzy set、DEMATEL、Entropy和Z number等更复杂的不确定性与决策方法。
从这条时间线可以看出,FMEA改进研究长期围绕一个核心问题展开:如何把专家对O、S、D等风险因素的模糊、不确定或不一致判断,转化为更可信的故障模式风险排序。
Application fields

263篇论文中,制造业应用最多,共101篇,占38%。其后主要包括:
- Marine:21篇,8%;
- Aerospace:16篇,6%;
- Healthcare:15篇,6%;
- Electronic:14篇,5%;
- Construction:11篇,4%;
- Service:10篇,4%;
- Education:9篇,3%;
- Food:7篇,3%;
- Product design:6篇,约2%;
- Others:53篇,20%。
航空航天类案例包括航空发动机涡轮转子叶片、航空电子制造项目、机场空侧、飞机制动系统和起落架系统等。制造业、海洋工程和医疗领域则形成了更大的应用规模。
值得注意的是,本文的“应用领域分析”统计的是提出改进FMEA方法的论文所采用的验证场景,并不是对所有工业FMEA应用数量的统计。
Research gaps and future opportunities
论文根据文献计量和内容分析提出三类后续研究方向。
More robust failure-mode ranking
很多研究把FMEA风险排序建模为多准则决策问题,并分别使用TOPSIS、DEA、GRA、VIKOR等方法。但不同MCDM算法可能给出不一致的排序结果。作者因此建议进一步研究更加综合和稳健的排序机制,例如组合两种或多种决策方法。
More complete representation of the FMEA decision process
已有研究已经大量讨论风险评价、风险因素权重和故障模式排序,但FMEA实际决策过程中还有其他关系没有得到充分处理,例如不同FMEA团队成员本身的权重、不同故障模式之间的内部关系,以及故障模式与纠正措施之间的联系。
Better usability for practitioners
许多改进FMEA方法在论文中需要较复杂的模糊计算、证据推理或MCDM过程,普通工程人员直接使用的成本较高。作者因此建议开发相应的原型软件系统,把复杂计算封装起来,使这些方法真正能够进入工程流程。
这一点非常关键:FMEA改进研究在算法上越来越复杂,但方法是否能够被安全工程师稳定、持续地使用,本身也成为研究问题。
Conclusion
本文对1998—2018年间263篇FMEA改进论文进行了系统性综述和文献计量分析。结果表明,这一研究方向在2013年以后明显加速,形成了一批稳定的研究群体和期刊阵地;研究主题长期集中在传统RPN的替代、风险评价信息的不确定性处理、风险因子权重和故障模式排序,并大量采用模糊理论、灰色理论、证据推理和多准则决策方法。
从主题结构看,healthcare failure mode、risk ranking、extended FMEA、gray theory、risk evaluation和fuzzy inference构成六个主要聚类;从应用看,制造业占比最高,海洋、航空航天、医疗和电子领域也具有较多案例。论文最终把未来研究重点放在更稳健的风险排序、更完整的FMEA决策关系表达以及面向工程人员的原型工具开发上。
这篇文章更像一张“传统FMEA改进研究的知识地图”。从本文纳入文献的关键词、聚类和研究群体可以看出,1998—2018年间最密集的工作集中于怎样评价和排序已有故障模式。系统行为仿真、动态故障传播和故障影响自动量化并没有成为本文识别出的主要热点。对于后续研究,这种版图本身可以帮助判断一个新的FMEA方法究竟是在继续改进RPN,还是在改变FMEA获取故障证据和形成安全结论的方式。
论文评价
- 推测的软件工具链: 论文明确使用Web of Science完成文献检索,使用CiteSpace开展作者合作、机构合作、共被引、关键词共现、关键词突现、时间线和聚类分析,并结合Google Earth展示机构地理分布。文献筛选由两位作者独立完成。论文没有披露专门的编程语言或数据处理脚本,因此不宜进一步推断为MATLAB、Python或R等具体实现。
- 收录原因: 这是一篇很适合作为FMEA研究入口的RESS综述。它不是再次介绍FMEA流程,而是用263篇论文把1998—2018年的“FMEA improvement”拆解为研究者、机构、核心文献、关键词、主题演化和应用领域几个层次,可以快速判断传统FMEA改进研究真正把精力集中在什么问题上。尤其是risk ranking、risk evaluation、fuzzy inference等主题的长期占优,为理解RPN改进路线提供了较完整的历史背景。
- 值得借鉴: 四阶段文献筛选流程清楚,可直接复用于一个方法学子领域的系统综述;作者没有只统计发文量,而是把合作网络、共被引、关键词突现、时间线和应用分布组合起来,能够同时观察“谁在研究、研究什么、什么时候兴起、在哪些行业验证”。对FMEA方法研究而言,论文还清楚揭示了一个重要现象:大量工作实际上是在改造O/S/D评价和风险排序算法,因此研究新的FMEA框架时,应明确自己改变的是风险排序机制、证据获取机制,还是故障影响分析过程本身。
- 可能不足: 数据只来自WoS,并限定为1998—2018年的期刊论文,同时主动排除了单纯应用类文章和FMEA自动化研究,因此得到的是“FMEA改进算法研究”的知识图谱,而不是完整FMEA研究版图;引用次数和关键词网络能够反映影响力与关注度,却不能直接说明某种改进方法的工程有效性。论文对未来方向的讨论仍主要围绕MCDM排序、团队权重和原型工具;就本文的关键词与聚类结果而言,模型化FMEA、动态故障传播和仿真驱动影响量化并未形成主要研究主题。由于数据截止到2018年,这篇综述也无法反映2019年以后的研究演进。






