A novel event tree analysis-graphical evaluation and review technique network model for comprehensive fault analysis in rocket hydrogen-oxygen refueling

Abstraction

Rocket hydrogen-oxygen refueling is a safety-critical pre-launch process with multiple tightly coupled subsystems under extreme cryogenic and high-pressure conditions. Traditional event tree analysis (ETA) has four key limitations: decoupled probability-time modeling, topological redundancy from rigid linear branching, inability to model maintenance feedback cycles, and purely probability-based unidimensional critical node identification. To overcome these limitations, we propose a novel event tree analysis-graphical evaluation and review technique (ETA-GERT) network model integrating ETA’s structured cause-consequence fault logic with GERT’s dynamic network modeling capabilities. Three systematic transformation rules map sequential events, parallel branches and maintenance cycles to GERT topologies, eliminating structural redundancy and enabling closed-loop maintenance modeling. Transfer functions from Mason’s signal flow graph theory and moment-generating functions enable closed-form calculation of fault probabilities and time distribution parameters. A fault mode risk index (FMRI) quantifies each fault mode’s comprehensive risk by integrating probability, average fault time and time standard deviation. A probability-time integrated sensitivity model (PTISM) yields a comprehensive sensitivity index (CSI) for each subsystem, enabling dual-dimensional critical subsystem identification. Applied to a six-subsystem refueling process, results show the injecting arm quick-disconnect system has the highest fault probability (1 × 10–7 times/h) and top FMRI ranking; PTISM identifies it (CSI=1.088) and the storage tank system (CSI=1.013) as critical subsystems above the identification threshold. Comparative analysis confirms the model outperforms traditional ETA and Monte Carlo simulation in modeling completeness, computational efficiency and multi-dimensional risk output, providing a validated analytical framework for dynamic risk assessment of complex safety-critical systems.

摘要翻译:火箭氢氧加注是发射前典型的安全关键过程,需要多个子系统在超低温、高压和强耦合条件下协同工作。传统事件树分析(ETA)存在四个主要局限:概率与时间参数彼此分离;刚性的线性分支结构容易造成拓扑冗余;无法描述维修后的故障—修复—再故障闭环;关键节点识别主要依赖故障概率,缺少时间维度。本文提出ETA-GERT网络模型,将ETA清晰的原因—后果逻辑与Graphical Evaluation and Review Technique(GERT)的动态网络建模能力结合起来。作者建立顺序事件、并行事件和维修循环三类ETA→GERT转换规则,并利用Mason信号流图公式和矩母函数求得故障概率及时间分布参数。进一步提出Fault Mode Risk Index(FMRI),综合故障概率、平均故障时间和时间标准差评价故障模式风险;提出Probability-Time Integrated Sensitivity Model(PTISM),以Comprehensive Sensitivity Index(CSI)同时衡量概率敏感性和时间敏感性。六子系统火箭氢氧加注案例表明,加注臂快速断开系统具有最高故障概率和FMRI,同时PTISM识别出快速断开系统与储箱系统为关键子系统。与传统ETA和Monte Carlo Simulation相比,ETA-GERT能够在保留闭环维修和多种时间分布的情况下,以解析方式得到多维动态风险结果。

Introduction

火箭氢氧加注包含储箱、低温管路、主加注阀、涡轮泵、加注臂快速断开装置和传感器组等多个子系统。液氢、液氧具有极低温特性,加注过程又涉及高压输送、密封连接、快速切换和严格的操作顺序,因此任何局部异常都可能沿流程继续传播,造成加注中止、设备破坏甚至更严重的事故后果。

传统可靠性分析方法各自可以处理一部分动态问题:

  • Dynamic Fault Tree能够描述顺序依赖,但仍以单一顶事件为中心;
  • Markov Chain适合维修和状态转移,但状态数量增大后容易出现状态空间爆炸,而且通常依赖指数分布;
  • Stochastic Petri Net可以处理并发和循环,但模型解释和故障因果追踪相对困难;
  • GERT本身能够表达反馈、概率分支和随机时间,却缺少ETA那样清楚的原因—后果故障逻辑。

本文因此把ETA和GERT组合起来,希望同时保留“故障如何沿系统向后发展”的工程可解释性和“故障什么时候发生、维修后是否再次出现”的动态定量能力。

作者把传统ETA的主要问题总结为四类:

  1. Probability-time decoupling:事件树通常只有分支概率,无法直接描述故障演化时间;
  2. Topological redundancy:并行事件被强制写成Yes/No的伪顺序分支,系统规模增大后结构迅速膨胀;
  3. Maintenance cycle missing:故障—维修—再次故障的闭环无法在树结构中自然表示;
  4. One-dimensional criticality:关键节点通常只按概率判断,无法体现某些概率较低但演化极快、响应窗口很窄的故障。

ETA-GERT framework

ETA-GERT综合故障分析框架

本文的方法流程可以概括为六个阶段:

  1. 确定系统边界,并识别故障模式和维修模式;
  2. 建立传统ETA,梳理原因—后果关系;
  3. 按转换规则建立ETA-GERT网络;
  4. 通过矩母函数和等效传递函数计算故障概率及时间参数;
  5. 使用FMRI和PTISM识别高风险故障模式与关键子系统;
  6. 进行模型验证、参数敏感性分析和方法对比。

它的关键不是简单把ETA图换成GERT图,而是把原来事件树中的每条事件转换为同时携带概率p时间t的网络活动弧。系统中的顺序、并行和维修闭环随后都可以在同一个网络结构和同一套数学求解框架下处理。

Traditional ETA for hydrogen-oxygen refueling

氢氧加注流程的传统顺序事件树

作者首先用传统ETA表示完整加注流程。六个主要子系统按照实际操作顺序依次接受安全检查:

  1. Storage tank system;
  2. Low-temperature pipeline system;
  3. Main filling valve system;
  4. Turbopump system;
  5. Injecting arm quick-disconnect system;
  6. Sensor cluster。

在最简单的二状态事件树中,只要任何一个子系统检查失败,就进入Refueling Failure;只有六个系统全部成功,最终结果才是Success。

这种表示在系统层面比较直观,但当继续展开到具体故障模式时,问题马上出现。例如储箱系统本身就包含冷脆断裂、安全阀失效导致超压爆炸、保温层破坏导致冷损过大等多种故障,其中部分故障还可以维修。若继续用传统事件树表示每种故障、维修成功、维修失败和再次故障,树会迅速出现大量层级和终端分支。

更重要的是,事件树仍然不能自然表达两个现实特征:每一种故障都有自己的发生和演化时间;维修成功以后仍然存在极低概率的再次故障,因此系统存在真实的闭环动态。

ETA-GERT definition

ETA-GERT把ETA中的事件逻辑转换为有向网络。

网络中的节点表示系统状态,有向弧表示状态之间的活动或转移。每条弧都同时包含两个核心参数:

(p(i,j), t(i,j))

其中p(i,j)表示从状态i转移到状态j的概率,t(i,j)表示完成这次状态转移所需要的时间。时间既可以是确定值,也可以服从Normal、Exponential等概率分布。

这种表达使一个故障路径同时具有两类信息:

  • 它发生的可能性有多大;
  • 它从当前状态演化到下一个状态需要多长时间,以及时间存在多大不确定性。

Rule 1: Sequential events

顺序事件的ETA-GERT转换规则

顺序事件是指必须按照严格时间顺序执行的事件。例如加注过程必须先经过储箱,再进入低温管路,然后依次经过主加注阀、涡轮泵和快速断开装置。

在ETA中,这种关系通过连续的Yes/No分支表示。转换为GERT后,各事件被串接为线性有向网络:

Start → A1 → A2 → A3 → ... → An → Result

每条弧都具有概率和时间参数。这样不仅保留“A2必须等A1完成后才能开始”的时序约束,还能直接计算从Start演化到任意后续状态的累计概率与时间分布。

Rule 2: Parallel events

并行事件的ETA-GERT转换规则

并行事件之间没有严格先后顺序,可以独立发生或相互重叠。

传统事件树仍然必须把它们强行拆成连续Yes/No分支,因此会产生大量只是为了保持树结构而引入的“伪顺序”。随着并行事件数量增加,这种结构会造成明显的拓扑膨胀。

ETA-GERT采用径向网络:从同一个Start节点直接连接到B1、B2、B3等并行事件,再分别通向对应结果。这样事件之间的异步独立关系可以直接体现在网络结构中,无需人为确定一个并不存在的执行顺序。

Rule 3: Maintenance feedback loop

维修事件及故障再发生的闭环转换规则

第三条规则是全文最有特点的部分。

假设故障X发生后,系统可能直接进入Failure,也可能进入维修R。维修完成后又存在两种结果:

  • 维修成功,系统回到Safe或正常状态;
  • 维修失败或故障再次发生,系统重新回到X。

因此,真实系统实际上形成:

Fault X → Repair R → Fault X

的反馈回路。

传统ETA只能继续向右展开“第一次维修成功/失败、第二次维修成功/失败……”这些分支,无法真正表示循环;GERT则直接使用self-loop或feedback topology描述这个闭环。

作者特别说明,网络中存在循环并不意味着实际发射场允许无限维修。模型只是在拓扑上保留所有逻辑可能路径,真实运行约束由参数体现。论文中的维修成功概率普遍高于99.99%,故障再次发生概率极低,因此等效期望维修次数仍然接近1,闭环不会造成不现实的概率累积。

Unified transfer-function calculation

ETA-GERT使用Moment Generating Function(MGF)和Mason信号流图理论统一计算不同拓扑。

对于活动(i,j),设转移概率为p(i,j),时间分布的矩母函数为M(i,j)(s),则定义活动传递函数:

W(i,j)(s) = p(i,j) × M(i,j)(s)

这样,概率和时间信息被封装到同一个函数中。

网络中三类基本结构分别采用:

  • Series:等效传递函数为各段传递函数相乘;
  • Parallel:等效传递函数为各并行路径传递函数相加;
  • Self-loop:使用Mason公式将反馈环解析化,例如W = Wb / (1 - Wa)

这三种结构使用同一个代数化网络约简思想,因此顺序/并行拓扑精简与维修闭环计算不需要两套独立求解算法。

Dynamic reliability indicators

对某一个目标故障节点求得从Start到该节点的等效传递函数Weq(s)后,可以直接得到故障概率:

pF = Weq(0)

再把等效传递函数除以故障概率得到对应时间分布的MGF:

Meq(s) = Weq(s) / pF

随后利用MGF在s = 0处的一阶和二阶导数得到:

  • Expected fault propagation time E(T)
  • Time variance D(T)
  • Time standard deviation S(T)

因此,一个故障模式最终不再只是传统ETA中的单个概率,而是形成:

{pF, E(T), D(T), S(T)}

这一组动态风险结果。

Fault Mode Risk Index

为了进一步把多个指标合并为一个故障模式排序量,作者提出Fault Mode Risk Index(FMRI)。

其核心形式为:

FMRI_m = p_m × (ω_t × t̃_m + ω_σ × σ̃_m)

其中:

  • p_m为故障模式发生概率;
  • t̃_m为归一化平均故障时间;
  • σ̃_m为归一化故障时间标准差;
  • ω_t = 0.6
  • ω_σ = 0.4

论文中的权重由5名具有15年以上经验的领域专家参与确定,同时作者认为火箭低温推进剂加注对时间响应尤其敏感,因此平均故障时间获得更高权重。

FMRI试图回答传统概率指标无法直接回答的问题:两个故障概率接近时,如果一个故障发展非常快、留给工程人员的处置窗口极短,它应该具有更高的风险关注优先级。

Probability-Time Integrated Sensitivity Model

仅对单个故障模式排序还不够,论文进一步提出PTISM用于识别系统层面的关键子系统。

Probability sensitivity factor

概率敏感因子定义为:

Sp_k = Psub,k / Psys

表示子系统k的故障概率相对于系统整体故障概率的贡献程度。数值越大,说明该子系统在系统总体概率风险中越重要。

子系统故障概率不是简单把内部各故障模式相加,而是先通过从子系统Start到End的等效传递函数计算正常完成概率,再使用补事件:

Psub,k = 1 - Rk

这样可以避免具有传播依赖的多个故障模式被直接相加后造成概率重复计算。

Time sensitivity factor

时间敏感因子使用子系统内各故障模式的变异系数平均值:

St_k = mean(S_i / E_i)

它反映故障发生时间的相对离散程度。St越大,说明该子系统中的故障时间越难预测,安全处置和维护计划越难提前安排。

Comprehensive Sensitivity Index

最后,对SpSt分别归一化,得到综合敏感指数:

CSI_k = sqrt(Sp̃_k² + St̃_k²)

Critical subsystem阈值定义为:

β_th = median(CSI) + 0.5 × std(CSI)

CSI高于阈值的系统被识别为关键子系统。

这种方法使“概率贡献很高”和“概率一般但时间行为非常敏感”两类风险都可能被识别出来。

Case study: rocket hydrogen-oxygen refueling

案例把完整加注过程分成六个子系统,并为每个系统建立多个具体故障模式。

例如:

  • Storage tank:冷脆断裂、安全阀失效导致超压爆炸、保温层破坏;
  • Low-temperature pipeline:软管氢脆裂纹、接头密封失效、低温连接松动;
  • Main filling valve:冻结卡涩、阀芯卡滞、动作延迟;
  • Turbopump:轴承润滑失效、叶轮破裂、密封环磨损泄漏;
  • Quick-disconnect:误触发、释放机构卡滞、分离后密封失效;
  • Sensor cluster:错误低温信号、温度传感器失效、压力传感器漂移。

其中不可维修的灾难性故障直接进入终端失效;可维修故障则进入“fault-maintenance-recurrence”闭环。

储箱子系统与完整加注过程的ETA-GERT网络

完整系统最终包含82条activity arcs和14个maintenance feedback loops。作者先分别求解每个子系统的等效传递函数,再按照加注流程把六个子系统串接起来形成系统级模型。

模型参数主要来自三类来源:项目中的低温部件试验数据、中国运载火箭技术研究院提供的历史加注故障与运行数据,以及现场长期监测数据。由于航天工程数据具有保密性,论文没有公开原始数据,最终参数还结合5名资深专家进行校准。

Fault probability and fault time

各故障模式的发生概率、平均故障时间和FMRI结果

从单个故障模式看,Quick disconnect false triggering(故障5)的发生概率最高,达到1 × 10^-7 times/h

论文认为快速断开装置需要在复杂振动和电磁环境下完成高精度连接与释放,其触发信号更容易受到振动和电磁干扰,因此这一故障具有较高风险。

各故障模式的平均发生时间则总体随着加注流程向后推进而增加,这与六个子系统按照时间顺序依次运行的实际过程一致。

FMRI排名前五的故障模式依次为:

  1. Quick disconnect false triggering(5);
  2. Pressure sensor drift(6b);
  3. Quick disconnect release mechanism jamming(5a);
  4. Ignition/tank rupture(F5);
  5. Turbopump seal ring leakage(4b)。

其中前三名中的两个故障、前五名中的三个故障都来自Injecting arm quick-disconnect system,因此该子系统成为明显的高风险区域。

Comparison with traditional ETA for one fault

作者以Storage tank cold brittle fracture(Fault 1)说明传统ETA和ETA-GERT的差异。

传统ETA无法表达维修后再次发生故障,因此只能假设最多维修一次,并忽略后续recurrence。得到故障概率:

pETA = 5.9 × 10^-10 times/h

ETA-GERT保留维修闭环后得到:

pETA-GERT = 5 × 10^-9 times/h

同时还可以给出:

  • E(T) ≈ 0.53 h
  • S(T) ≈ 0.065 h
  • FMRI。

作者据此认为,传统ETA由于截断“故障—维修—再故障”路径而明显低估了这一故障的长期风险,而ETA-GERT能够同时反映概率与故障发展速度。

Critical subsystem identification

六个子系统的概率敏感度、时间敏感度和CSI

整个加注系统的故障概率计算为:

Psys = 3.85 × 10^-8

六个子系统中,概率敏感度最高的是Injecting arm quick-disconnect system:

Sp = 0.51984

而时间敏感度最高的是Storage tank system:

St = 0.54866

最终CSI结果为:

  • Storage tank system:1.01271
  • Low-temperature pipeline system:0.28027
  • Main filling valve system:0.29856
  • Turbopump system:0.67654
  • Injecting arm quick-disconnect system:1.08757
  • Sensor cluster:0.47099

根据论文定义的阈值,Injecting arm quick-disconnect system和Storage tank system被识别为两个关键子系统。

这个结果很能体现PTISM的设计目的:快速断开系统主要因为故障概率贡献最高而被识别;储箱系统则主要因为故障时间敏感性最高而进入关键集合。若只按传统故障概率排序,储箱系统的重要性可能没有这么突出。

Parameter sensitivity analysis

参数变化对CSI与关键子系统识别结果的影响

论文进一步让三类输入参数分别在-40% ~ +40%范围内变化:

  • activity transition probability;
  • mean transition time;
  • transition time variance。

结果显示,故障概率变化对CSI影响最大,平均时间和时间方差的影响相对较小。

更重要的是,在全部参数扰动情况下,六个子系统的相对CSI排名没有发生变化。Injecting arm quick-disconnect system和Storage tank system始终位于前两位,并持续高于重新计算得到的关键阈值。

因此,作者认为核心结论对中等程度的参数波动具有一定稳健性,能够缓解航天加注这种“高价值、低样本”系统中参数来源有限的问题。

Comparison with ETA and Monte Carlo simulation

论文最后分别在单个储箱子系统和完整六子系统模型上比较Traditional ETA、Monte Carlo Simulation(MCS)和ETA-GERT。

Storage tank subsystem

传统ETA计算时间小于1 s,但只能给出静态故障概率,而且维修闭环必须被截断。

Monte Carlo能够模拟维修循环和不同时间分布,但对于10^-9 ~ 10^-7量级的稀有故障,要获得较稳定结果通常需要10^6 ~ 10^7次仿真,论文估计单个子系统需要30~80 min。

ETA-GERT通过Mason公式解析求解维修闭环,在5 s以内得到结果,并同时输出故障概率、E(T)D(T)和FMRI。

Complete six-subsystem system

完整模型包含82条弧和14个维修反馈环。

传统ETA虽然单次概率计算快,但树结构会出现明显层级爆炸,并且无法保留14个闭环。

MCS理论上可以完整模拟,但论文估计要达到稀有事件精度需要10^7 ~ 10^8次运行,对完整系统约需10~50 h。

ETA-GERT则先模块化求解六个子系统,再组合等效传递函数。作者报告每个子系统求解低于5 s,完整系统低于1 min,并且还能够继续执行PTISM敏感性分析。

因此,这篇文章真正强调的优势不是“GERT计算一定比所有仿真快”,而是在当前这类具有明确网络结构、稀有事件和维修反馈的问题中,解析等效化可以避免为了估计极小概率而进行数量巨大的随机采样。

Conclusion

本文提出ETA-GERT,把事件树的原因—后果逻辑转换为带有概率—时间双参数的GERT网络,并建立顺序、并行和维修闭环三类系统化转换规则。

在求解层面,所有网络活动统一表示为W(s)=pM(s),然后利用Mason公式对串联、并联和反馈回路进行代数约简。这样可以从同一个等效传递函数中得到故障概率、平均故障时间和时间方差,并进一步形成FMRI和PTISM。

六子系统火箭氢氧加注案例表明,快速断开系统在概率风险上最突出,储箱系统则具有更强的时间敏感性;二者最终都通过CSI被识别为关键子系统。参数在±40%范围变化时,关键子系统识别结果保持稳定。

论文也给出了三项主要限制:当前维修效果被假设为常量;Mason公式面对更大规模和更复杂拓扑时仍可能遇到计算效率问题;现有转换规则主要在顺序主导的加注流程上验证,对于高度并行耦合和多源突发故障仍需要进一步检验。

论文评价

  • 推测的软件工具链: 论文没有明确披露具体编程语言或商业软件。核心计算由GERT网络、Moment Generating Function、Mason信号流图公式、传递函数代数约简、FMRI和PTISM组成,因此完全可以通过MATLAB、Mathematica、Maple或Python/SymPy实现;图中的事件树与GERT网络可能由Visio、draw.io或科研绘图软件制作,但正文没有给出证据,不能进一步确定。相比依赖专用仿真平台的研究,这篇文章更接近“数学建模 + 网络拓扑 + 解析计算 + 工程数据标定”的工具链。
  • 收录原因: 文章针对传统ETA的几个具体工程缺口提出了一套结构完整的方法:先定义ETA→GERT转换规则,再建立统一解析求解,再构造FMRI和PTISM,最后用火箭氢氧加注这一高风险航天场景验证。方法创新、数学计算和工程应用之间的对应关系比较清楚,尤其是把维修闭环、概率和时间同时放入事件传播网络,使结果从传统静态事故概率扩展到动态风险指标,符合RESS对复杂系统动态可靠性与安全分析的关注。
  • 值得借鉴: “先保留传统安全分析中的原因—后果逻辑,再转换到更适合计算的网络模型”这一思路很有价值;顺序、并行、维修循环三类转换规则使模型构建过程具有明确模板;把每条活动统一表示为概率 × 时间MGF,再由同一传递函数求概率与时间指标,数学结构比较整洁;FMRI把故障发生概率和故障演化速度组合起来,PTISM又把概率敏感度与时间敏感度组合到子系统层级,形成了“故障模式—子系统”两级风险筛选;参数敏感性分析和ETA/MCS对比也让方法验证比单纯给一个案例结果更加完整。
  • 可能不足: ETA-GERT仍然需要分析人员提前识别故障模式、维修模式和主要传播路径,本质上属于“对已知故障逻辑进行更完整的动态量化”,并不能自动发现模型外的新故障。大量关键参数来自保密历史数据和专家校准,原始数据无法公开,使外部复现和独立验证受限。FMRI中的0.6/0.4权重以及CSI阈值中的0.5 × std都包含明显的专家设定成分,虽然论文给出工程解释,但跨系统迁移时仍需要重新论证。时间敏感度使用各故障模式变异系数的简单平均,也没有区分不同故障模式的严重性和发生概率。最后,作者将解析结果描述为“exact”,实际上结果仍然严格依赖网络拓扑、分布假设和参数标定是否正确;对于强多物理场耦合、状态依赖概率或故障行为会反过来改变系统动力学的场景,这种网络解析模型仍然需要与高保真仿真或实测数据结合验证。