Gestion des incidents massifs
Gestion des incidents couvrant de nombreux Assets — corrélation automatique, cycle de vie de l'incident, tableau de bord opérationnel et analyse post-incident.
Un Massive Incident est un ensemble d’Operational Issues interdépendantes réunies par une cause commune.
Cela permet d’analyser des événements d’exploitation de grande ampleur comme un objet de gestion unique.
Corrélation des incidents
OHM regroupe automatiquement les Operational Issues au sein d’un Massive Incident lorsque plusieurs facteurs concordent :
- le moment d’apparition ;
- la région ;
- la Root Cause ;
- l’infrastructure de communication ;
- la version du logiciel ;
- un événement externe.
Cycle de vie d’un Massive Incident
flowchart TD
A["Détection"] --> B["Corrélation"]
B --> C["Massive Incident créé"]
C --> D["Investigation"]
D --> E["Atténuation de l'impact"]
E --> F["Rétablissement"]
F --> G["Vérification"]
G --> H["Analyse post-incident"]
H --> I["Clôture"]
Tableau de bord opérationnel
Pour chaque Massive Incident, le système affiche :
- le nombre d’Operational Issues associées ;
- le nombre d’Assets ;
- les régions touchées ;
- la Root Cause présumée ;
- l’état de l’investigation ;
- le SLA ;
- l’impact métier (Business Impact) ;
- l’avancement actuel du rétablissement.
Analyse post-incident (Post Incident Review)
Après la clôture, l’incident fait l’objet d’une analyse.
Le rapport comprend :
- la chronologie ;
- la Root Cause confirmée ;
- l’efficacité de la réponse ;
- le respect du SLA ;
- les enseignements tirés (Lessons Learned) ;
- les recommandations visant à prévenir toute récurrence.
Toutes les conclusions peuvent être automatiquement converties en articles de la Knowledge Base.
Sujets connexes
Cette page vous a-t-elle été utile ?
Merci pour votre retour !