Riadenie hromadných incidentov
Riadenie incidentov, ktoré zasahujú množstvo aktív — automatická korelácia, životný cyklus incidentu, prevádzkový dashboard a rozbor po incidente.
Hromadný incident (Massive Incident) je súbor navzájom súvisiacich Operational Issues, ktoré spája spoločná príčina vzniku.
Umožňuje to analyzovať rozsiahle prevádzkové udalosti ako jediný objekt riadenia.
Korelácia incidentov
OHM automaticky zoskupuje Operational Issues do jedného Massive Incident, keď sa zhoduje viacero faktorov:
- čas vzniku;
- región;
- Root Cause;
- komunikačná infraštruktúra;
- verzia softvéru;
- vonkajšia udalosť.
Životný cyklus Massive Incident
flowchart TD
A["Zistenie"] --> B["Korelácia"]
B --> C["Vytvorenie Massive Incident"]
C --> D["Vyšetrovanie"]
D --> E["Zmiernenie dopadu"]
E --> F["Obnova"]
F --> G["Overenie"]
G --> H["Rozbor po incidente"]
H --> I["Uzavretie"]
Prevádzkový dashboard
Pre každý Massive Incident systém zobrazuje:
- počet súvisiacich Operational Issues;
- počet aktív;
- zasiahnuté regióny;
- predpokladanú Root Cause;
- stav vyšetrovania;
- SLA;
- obchodný dopad;
- aktuálny priebeh obnovy.
Rozbor po incidente
Po uzavretí sa incident podrobí analýze.
Správa obsahuje:
- časovú os;
- potvrdenú Root Cause;
- účinnosť reakcie;
- dodržanie SLA;
- získané poznatky (Lessons Learned);
- odporúčania na predchádzanie opakovaniu.
Všetky závery možno automaticky previesť na články Knowledge Base.
Súvisiace témy
Bola táto stránka užitočná?
Ďakujeme za vašu spätnú väzbu!