Řízení hromadných incidentů
Řízení incidentů, které zasahují mnoho aktiv — automatická korelace, životní cyklus incidentu, provozní dashboard a rozbor po incidentu.
Massive Incident (hromadný incident) je soubor vzájemně souvisejících Operational Issues, které spojuje společná příčina vzniku.
Rozsáhlé provozní události tak lze analyzovat jako jediný objekt řízení.
Korelace incidentů
OHM automaticky sdružuje Operational Issues do jednoho Massive Incident, shoduje-li se několik faktorů:
- čas vzniku;
- region;
- Root Cause;
- komunikační infrastruktura;
- verze softwaru;
- externí událost.
Životní cyklus Massive Incident
flowchart TD
A["Detekce"] --> B["Korelace"]
B --> C["Massive Incident vytvořen"]
C --> D["Šetření"]
D --> E["Zmírnění dopadů"]
E --> F["Obnovení"]
F --> G["Ověření"]
G --> H["Rozbor po incidentu"]
H --> I["Uzavření"]
Provozní dashboard
Pro každý Massive Incident systém zobrazuje:
- počet souvisejících Operational Issues;
- počet aktiv;
- zasažené regiony;
- předpokládanou Root Cause;
- stav šetření;
- SLA;
- obchodní dopad;
- aktuální postup obnovy.
Rozbor po incidentu (Post Incident Review)
Po uzavření se incident podrobí rozboru.
Zpráva obsahuje:
- časovou osu;
- potvrzenou Root Cause;
- účinnost reakce;
- dodržení SLA;
- získaná ponaučení (Lessons Learned);
- doporučení k zamezení opakování.
Všechny závěry lze automaticky převést na články Knowledge Base.
Související témata
Byla tato stránka užitečná?
Děkujeme za vaši zpětnou vazbu!