Gestion des incidents massifs

Gestion des incidents couvrant de nombreux Assets — corrélation automatique, cycle de vie de l'incident, tableau de bord opérationnel et analyse post-incident.

Un Massive Incident est un ensemble d’Operational Issues interdépendantes réunies par une cause commune.

Cela permet d’analyser des événements d’exploitation de grande ampleur comme un objet de gestion unique.

Corrélation des incidents

OHM regroupe automatiquement les Operational Issues au sein d’un Massive Incident lorsque plusieurs facteurs concordent :

  • le moment d’apparition ;
  • la région ;
  • la Root Cause ;
  • l’infrastructure de communication ;
  • la version du logiciel ;
  • un événement externe.

Cycle de vie d’un Massive Incident

flowchart TD
    A["Détection"] --> B["Corrélation"]
    B --> C["Massive Incident créé"]
    C --> D["Investigation"]
    D --> E["Atténuation de l'impact"]
    E --> F["Rétablissement"]
    F --> G["Vérification"]
    G --> H["Analyse post-incident"]
    H --> I["Clôture"]
Vue Timeline d'un incident massif montrant sa progression au fil des étapes de son cycle de vie, de la détection à l'analyse post-incident. Vue Timeline d'un incident massif montrant sa progression au fil des étapes de son cycle de vie, de la détection à l'analyse post-incident.
Incident massif doté de son propre cycle de vie : Detected → Confirmed → Investigation → Mitigation → Resolved → Post-Analysis

Tableau de bord opérationnel

Pour chaque Massive Incident, le système affiche :

  • le nombre d’Operational Issues associées ;
  • le nombre d’Assets ;
  • les régions touchées ;
  • la Root Cause présumée ;
  • l’état de l’investigation ;
  • le SLA ;
  • l’impact métier (Business Impact) ;
  • l’avancement actuel du rétablissement.
Fiche d'incident avec un graphe de dépendances reliant des dizaines d'Issues symptomatiques réparties sur plusieurs Assets à un unique nœud de Root Cause. Fiche d'incident avec un graphe de dépendances reliant des dizaines d'Issues symptomatiques réparties sur plusieurs Assets à un unique nœud de Root Cause.
Fiche d'incident : graphe de dépendances — des dizaines de symptômes, une seule cause

Analyse post-incident (Post Incident Review)

Après la clôture, l’incident fait l’objet d’une analyse.

Le rapport comprend :

  • la chronologie ;
  • la Root Cause confirmée ;
  • l’efficacité de la réponse ;
  • le respect du SLA ;
  • les enseignements tirés (Lessons Learned) ;
  • les recommandations visant à prévenir toute récurrence.

Toutes les conclusions peuvent être automatiquement converties en articles de la Knowledge Base.

Sujets connexes

Dernière mise à jour le

Cette page vous a-t-elle été utile ?