Gestione degli incidenti massivi

Gestione degli incidenti che interessano molti Asset — correlazione automatica, ciclo di vita dell'incidente, dashboard operativa e riesame post-incidente.

Un Massive Incident è un insieme di Operational Issues correlati fra loro, riconducibili a una causa comune.

Questo consente di analizzare gli eventi di esercizio di grande portata come un unico oggetto di gestione.

Correlazione degli incidenti

OHM raggruppa automaticamente gli Operational Issues in un Massive Incident quando coincidono più fattori:

  • il momento di insorgenza;
  • la regione;
  • la Root Cause;
  • l’infrastruttura di comunicazione;
  • la versione del software;
  • un evento esterno.

Ciclo di vita del Massive Incident

flowchart TD
    A["Rilevamento"] --> B["Correlazione"]
    B --> C["Massive Incident creato"]
    C --> D["Indagine"]
    D --> E["Mitigazione"]
    E --> F["Ripristino"]
    F --> G["Verifica"]
    G --> H["Riesame post-incidente"]
    H --> I["Chiusura"]
Cronologia dell'incidente massivo: l'incidente attraversa le fasi del proprio ciclo di vita, dal rilevamento all'analisi post-incidente. Cronologia dell'incidente massivo: l'incidente attraversa le fasi del proprio ciclo di vita, dal rilevamento all'analisi post-incidente.
Incidente massivo con un ciclo di vita proprio: Detected → Confirmed → Investigation → Mitigation → Resolved → Post-Analysis

Dashboard operativa

Per ogni Massive Incident il sistema mostra:

  • il numero di Operational Issues collegati;
  • il numero di Asset;
  • le regioni interessate;
  • la presunta Root Cause;
  • lo stato dell’indagine;
  • l’SLA;
  • l’impatto sul business;
  • l’avanzamento attuale del ripristino.
Scheda dell'incidente con un grafo delle dipendenze che collega decine di Issues sintomatici, distribuiti su più Asset, a un unico nodo di causa radice. Scheda dell'incidente con un grafo delle dipendenze che collega decine di Issues sintomatici, distribuiti su più Asset, a un unico nodo di causa radice.
Scheda dell'incidente: grafo delle dipendenze — decine di sintomi, un'unica causa

Riesame post-incidente (Post Incident Review)

Dopo la chiusura, l’incidente viene sottoposto ad analisi.

Il report comprende:

  • la cronologia;
  • la Root Cause confermata;
  • l’efficacia della risposta;
  • il rispetto degli SLA;
  • le lezioni apprese (Lessons Learned);
  • le raccomandazioni per prevenire il ripetersi dell’evento.

Tutte le conclusioni possono essere convertite automaticamente in articoli della Knowledge Base.

Argomenti correlati

Ultimo aggiornamento il

Questa pagina è stata utile?