Guided simulation for dynamic probabilistic risk assessment of complex systems: Concept, method, and application

Abstraction

Probabilistic risk assessment (PRA) is a systematic process of examining how engineered systems work to ensure safety. With the growth of the size of dynamic systems and the complexity of the interactions between hardware, software, and humans, it is extremely difficult to enumerate risky scenarios by the traditional PRA methods. In this study, a new dynamic probabilistic risk assessment methodology is proposed that employs a new exploration strategy to generate risky scenarios. The proposed methodology consists of three main modules, including simulation, planner, and scheduler. In this methodology, the engineering knowledge of the system is explicitly used to guide the simulation module to achieve higher efficiency and accuracy. The engineering knowledge is reflected in the planner module which is responsible for generating plans as a high-level map to guide the simulation. The scheduler module is responsible for guiding the simulation by controlling the timing and occurrence of the random events. In this paper, modules of the proposed methodology, and their interactions are explained in detail. The developed methodology is used to perform risk assessment of a Space Shuttle ascent phase, and results show the effectiveness of the proposed platform.

摘要翻译:概率风险评估(PRA)是通过系统考察工程系统的工作方式来保障安全的一套过程。随着动态系统规模扩大,以及硬件、软件和人员之间的交互日益复杂,传统PRA方法已经很难枚举全部风险场景。本文提出一种采用新型探索策略生成风险场景的动态概率风险评估方法。该方法主要由仿真器、计划器和调度器三个模块组成:计划器把系统工程知识表示为用于引导仿真的高层计划;调度器通过控制随机事件发生的时机和结果来引导仿真;仿真器则执行包含硬件、软件和人员交互的动态模型。作者详细说明了各模块及其交互方式,并将该方法用于航天飞机上升段风险评估,结果验证了平台的有效性。

Introduction

传统PRA中的故障树和事件树适合表达已经识别出的事故逻辑,但是复杂动态系统具有明显的时间依赖性:控制和保护装置会在过程变量越过阈值时动作,硬件故障与人员响应依赖系统当时的动态状态,硬件、软件和人员的交互还可能改变后续演化路径。DPRA的作用不是替代传统PRA,而是利用动态仿真补充传统方法难以处理的时间和交互问题。

作者把DPRA理解为对事件序列空间的探索。这里存在两个相反的困难:

  • 离散动态事件树(DDET)系统地展开分支,较容易保持覆盖性,但分支数量会随事件和时间步组合迅速增长;
  • 连续事件树(CET)或普通蒙特卡洛按照自然概率抽样,能够避免完全展开,却可能需要大量样本才能遇到低概率、高后果场景。

因此,一个实用的探索策略既要把计算资源集中到有信息价值的风险场景,又不能完全锁定在已有认知中;既要让重要场景得到充分探索,也要保证计划之外的场景仍有被发现的机会。本文提出的SIMPRA(Simulation Based Probabilistic Risk Assessment)正是针对这个矛盾设计的DDET与CET混合方法。

Guided simulation based probabilistic risk assessment

SIMPRA模型化DPRA平台的总体框架

SIMPRA把动态风险评估划分为计划器、调度器、仿真器和输出分析四个相互反馈的部分:

  • 计划器(Planner)把设计知识、故障树/事件树、相似系统经验、险情记录和专家判断整理成高层场景计划;
  • 调度器(Scheduler)保存仿真状态、重启事件序列,在分支点选择下一事件,并使计算量在不同场景间合理分配;
  • 仿真器(Simulator)执行硬件、软件、人员及环境相互作用的动态模型,输出详细事件序列;
  • 输出分析(Output analysis)统计终态概率和场景覆盖情况,并根据新发现修正计划。

这里的“计划”不是预先写好的完整事故序列,而是对风险场景的一张高层地图。计划可以不完整,甚至可以包含不准确或物理上不可实现的场景。随机探索负责保留发现计划外场景的可能性,仿真结果则反过来暴露计划中的空白和错误。

Simulation model

仿真器包含硬件、软件和人员三个相互耦合的模型。硬件采用连续时间动力学与离散事件结合的混合模型:连续模型计算系统轨迹,离散事件表示组件从正常向失效或降级状态的瞬时转移。软件模型由确定性的可执行行为和随机的软件失效模式组成,后者在仿真中被表示为受调度器控制的随机事件。人员模型可使用贝叶斯信念网络,把绩效影响因子作为输入并预测操作者响应。

作者强调,SIMPRA并不强迫设计人员为风险分析重新建立一套专用模型,而是尽可能直接使用系统设计阶段已有的仿真模型。模型也可以逐步细化:在系统认识不足时使用抽象模型,获得新数据后再替换为更详细的组件、人员或软件模型。

Guidance algorithm

Planner

计划器根据已有知识生成一组值得关注的场景。例如,“发动机失效后实施中止”可以作为一个高层场景,而不必预先给出导致发动机失效的每个底层组件组合。调度器加载计划时,再通过场景数据库或故障树把“发动机失效”翻译为仿真模型能够执行的详细事件序列。

计划会随着探索而更新。作者给出三类更新方式:

  • 如果某些计划场景长期探索不足,计划器自动提高其重要度;
  • 如果计划与仿真结果不一致,由分析人员判断是仿真模型失真、计划本身不准确,还是场景受物理约束而不可达;
  • 如果抽样分布过度偏斜,就调整分支点生成规则,使所有可能事件仍保有非零抽样机会。

Scheduler

SIMPRA调度器的执行流程

每条事件序列从初始化和连续时间仿真开始。当系统到达随机事件可能发生的条件时,仿真器生成分支点,把所有可行转移提交给调度器。调度器结合当前系统状态、计划、场景重要度和既有仿真结果选择一个分支,更新模型状态和下一分支条件,再继续仿真。到达吸收终态后,如果样本量不足,就从保存状态开始下一条事件序列。

计划在调度器中表示为树,每条树枝对应一类场景,节点可以表达必需事件、事件否定、带时间条件的事件或多个事件的组合。节点状态包括arrived atoccurrednegated,并在每条新事件序列开始时重置。

计划树中分支节点状态随仿真演化的示例

这种表示允许多个场景共享前缀。例如两个场景都要求事件A发生,它们可以共享同一个A节点,只有后续条件不同时才继续分叉。调度器由此判断当前事件序列已经覆盖了计划的哪些部分,以及哪些分支在当前状态下已经不可能继续。

Branch point generation

论文设计了三类随机事件分支点:

  • 概率型分支点用于具有强度函数h(t,x)的事件。作者把时间划分成若干区间,使事件尚未发生条件下,每个区间内的条件发生概率均为ΔP,然后在区间内生成分支点;
  • 时间型分支点用于预先知道关键时间窗的事件。在每个关键时间窗内随机生成一个分支时刻,可避免很短但风险敏感的时间窗被自然抽样漏掉;
  • 需求型分支点用于备用设备启动、按需动作或忽略响应延迟时的人员行为。事件时刻由需求确定,而动作成功、失败或其他多种结果在该时刻形成随机分支。

概率型抽样容易偏向高概率路径,时间型抽样则更有利于覆盖短暂的低概率、高后果窗口。SIMPRA允许根据事件性质混合使用这些规则。

Value-based scheduling

调度器把分支价值定义为“希望继续模拟该分支的程度”,主要考虑三个因素:预期能够获得的信息量、工程知识指定的重要度,以及该分支使事件序列接近终态的程度。

信息价值用Shannon熵的变化衡量。如果某类场景反复得到同一终态,其不确定性已经较低,继续模拟的边际信息价值就会下降;如果场景终态仍然分散或了解不足,它会得到更高优先级。这样,调度器会自动把计算资源转移到尚未被充分理解的场景。

调度器并不总是选择价值最高的分支,而是先把全部分支价值归一化,再按价值比例随机选择,类似Russian Roulette算法。这个随机性很重要:计划只是粗略引导,如果永远选择最高价值分支,探索会被锁定在计划内,计划之外的新风险场景将失去出现机会。

Event sequence quantification

引导抽样改变了分支被访问的频率,因此不能直接用样本占比估计终态概率。假设某分支的自然发生概率为ΔP,调度器选择它的概率为Q,事件序列的统计权重需要乘以w = ΔP / Q。一条序列经过多个分支点后累积各分支权重,最终再使用加权样本估计不同终态的概率。

这一处理与重要抽样相似:调度器可以频繁访问自然概率很低的风险分支,同时利用权重校正由主动引导造成的估计偏差。因此,SIMPRA把“怎样高效发现事故序列”和“怎样无偏估计事故概率”分成了两个问题处理。

Application: Space Shuttle ascent phase

SIMPRA在航天飞机上升段风险评估中的实现

案例研究对象是航天飞机上升段。飞行器依靠三台航天飞机主发动机(SSME)和两台固体火箭助推器(SRB)提供推力,约120秒后分离SRB,SSME继续工作至接近入轨。制导、导航和控制软件协调发动机、助推器和其他硬件;当故障导致任务无法继续时,机组需要选择中止模式。

模型包含SSME、SRB、生命保障系统(LSS)和系统路由器四个主要模块,并考虑控制系统与操作者。论文明确说明各模块在MATLAB环境下使用Simulink建立组件级模型。

航天飞机上升段的完整中止模式与关键时间窗

上升段有四种完整中止模式:

  • ATO(Abort to Orbit):进入低于计划高度的临时轨道;
  • AOA(Abort Once Around):绕地球一周后正常再入和着陆;
  • TAL(Transatlantic Landing):在大西洋另一侧机场着陆;
  • RTLS(Return to Launch Site):消耗部分推进剂后转向,返回发射场附近着陆。

中止方式由故障原因和发生时间共同决定。单纯推力损失时通常按ATO、AOA、TAL、RTLS的顺序选择仍可完成的最安全方式;生命保障等支持系统故障则可能要求尽快结束任务,使TAL或RTLS优先于ATO和AOA。这种“同一故障在不同时刻导致不同终态”的特征正是DPRA需要显式处理时间的原因。

Results

Planned exploration model

计划器为案例生成14类探索计划,覆盖灾难性故障、不同时间窗内的SSME或LSS失效、软件事件、中止动作和计划之外的其他场景。高层计划中的SSME表示主发动机良性停机,调度器通过数据库查询故障树割集,把它展开为具体发动机子组件故障组合。

论文给出两条典型事件序列:

  • SSME3的两个子组件先后在93秒和146秒失效,引起发动机停机;机组在149.1秒正确选择RTLS,系统进入成功中止终态,序列统计权重为2.6E-4
  • SSME2和SSME3的局部故障尚未破坏冗余,但LSS在120秒失效,机组在124.3秒错误选择ATO,最终造成飞行器和机组损失(LOVC),序列权重为4.1E-4

这两个例子说明,终态不仅取决于硬件是否故障,还取决于故障顺序、发生时间、系统冗余状态和机组响应。

End-state probability estimation

作者把三种探索结果进行比较。作为“理论值”的普通蒙特卡洛使用10000条事件序列,得到LOVC概率6.12E-3、成功中止概率6.55E-3和任务成功概率0.987。计划引导的500个样本给出6.30E-36.46E-30.987;无计划的500个样本给出5.40E-37.10E-30.988

计划引导探索中的任务成功概率收敛过程

按论文文字说明,普通随机探索约在10000条序列后达到收敛条件,使用计划和基于熵的场景引导后约600条序列即可收敛。虽然两者不是严格相同计算预算下的完整统计比较,但结果表明,引导策略能减少大量重复的无故障成功序列,把样本分配到更有信息价值的风险场景。

Allocation of event sequences

计划与无计划方法对500条事件序列的分配对比

计划探索对大部分目标场景分配了相对均衡的样本,同时很少重复模拟结果确定的灾难性SSME故障。原因是这类场景几乎总是直接进入LOVC,新增样本带来的信息增益很低。无计划探索则把大量样本用在计划外场景,并完全遗漏计划10、11和12。这个结果表明,熵价值不只是按“已经模拟多少次”平均分配,而是同时考虑场景终态是否已经稳定。

Discussion

与事件树/故障树相比,SIMPRA不要求分析人员事先列出完整事故序列。传统模型仍然有用,但主要作为高层计划和先验知识,而不是直接求解全部事故逻辑。与采用固定时间步展开的DYLAM等方法相比,SIMPRA将离散事件与自适应步长连续模型耦合,能够在系统平稳阶段快速前进,在故障后快速变化阶段提高时间分辨率。

作者认为,计划—仿真—更新的反馈能够使风险模型逐步成熟:未预见但被仿真发现的场景可以加入计划,计划中长期不可达的场景可以被识别和修正。进一步的发展方向包括估计终态概率的可信区间、根据风险而不只是信息熵确定分支价值、自动切换不同保真度模型,以及改进复杂人因和软件行为的概率模型。

Conclusion

本文提出一种受人类推理和学习过程启发的引导式DPRA方法。计划器利用传统PRA和工程经验形成高层场景地图,调度器在分支点综合场景重要度和预期信息增益随机选择路径,仿真器生成硬件、软件和人员交互下的详细事件序列,输出结果再用于修正计划。统计权重用于校正引导抽样造成的偏差,使低概率风险场景能够被更频繁地探索而不直接牺牲终态概率估计。

航天飞机上升段案例表明,计划引导可以把样本集中在多个目标风险场景,减少对无信息成功序列的重复计算,并以更少的事件序列得到接近普通蒙特卡洛的终态概率。方法的核心价值不是证明先验计划已经完整,而是在先验知识、随机探索和自适应更新之间建立一个可迭代的动态风险分析流程。

论文评价

  • 推测的软件工具链: 论文明确使用MATLAB/Simulink建立航天飞机组件级模型;调度、计划解析、随机分支、熵计算和加权估计很可能由MATLAB脚本或自定义Simulink模块实现,高层计划以文本文件保存,抽象场景与底层故障序列通过数据库映射。人员模型预留了贝叶斯信念网络接口,但案例是否完整实现该模块并不清楚。
  • 收录原因: 文章把工程先验、动态仿真、基于熵的信息价值调度和重要抽样权重统一到一个DPRA框架中,正面回应了DDET状态爆炸与CET遗漏稀有风险之间的矛盾;航天飞机案例同时包含硬件、软件、人员和时间窗,主题与RESS对复杂系统动态风险和可计算方法的关注高度吻合,计划/无计划对比也给出了直观有效性证据。
  • 值得借鉴: 计划器—调度器—仿真器的职责划分很清楚;高层事故知识与详细物理序列通过数据库解耦,便于逐步提高模型保真度;按信息增益分配样本、保留计划外随机探索,再用ΔP/Q修正抽样偏差,是兼顾场景发现和概率量化的一套完整思路;计划探索与无计划探索的对照也适合作为方法验证范式。
  • 可能不足: 航天飞机模型经过明显简化,故障率、人员行为和软件失效模型的验证证据有限;“理论值”只是10000次蒙特卡洛结果,论文未报告置信区间、重复试验和计算时间,收敛判据也较宽松;表4的任务成功概率与图10曲线终值看起来并不一致。方法仍依赖专家计划和抽象—详细场景映射,随机探索只能提供发现未知场景的机会,尚不能严格证明场景完整性;随着模型规模扩大,计划维护、状态保存和多分支权重退化仍可能成为新的瓶颈。