Gestión de incidentes masivos

Gestión de incidentes que abarcan múltiples activos — correlación automática, ciclo de vida del incidente, panel operativo y revisión posincidente.

Un Massive Incident es un conjunto de Operational Issues interrelacionados que comparten una causa común.

Esto permite analizar los eventos operativos de gran escala como un único objeto de gestión.

Correlación de incidentes

OHM agrupa automáticamente los Operational Issues en un Massive Incident cuando coinciden varios factores:

  • el momento de aparición;
  • la región;
  • la Root Cause;
  • la infraestructura de comunicaciones;
  • la versión del software;
  • un evento externo.

Ciclo de vida del Massive Incident

flowchart TD
    A["Detección"] --> B["Correlación"]
    B --> C["Massive Incident creado"]
    C --> D["Investigación"]
    D --> E["Mitigación"]
    E --> F["Recuperación"]
    F --> G["Verificación"]
    G --> H["Revisión posincidente"]
    H --> I["Cierre"]
Vista de cronología de un incidente masivo: el incidente avanza por las etapas de su ciclo de vida, desde la detección hasta el análisis posincidente. Vista de cronología de un incidente masivo: el incidente avanza por las etapas de su ciclo de vida, desde la detección hasta el análisis posincidente.
Incidente masivo con su propio ciclo de vida: Detected → Confirmed → Investigation → Mitigation → Resolved → Post-Analysis

Panel operativo

Para cada Massive Incident, el sistema muestra:

  • el número de Operational Issues relacionados;
  • el número de activos;
  • las regiones afectadas;
  • la presunta Root Cause;
  • el estado de la investigación;
  • el SLA;
  • el impacto en el negocio;
  • el progreso actual de la recuperación.
Tarjeta de incidente con un grafo de dependencias que vincula decenas de Issues sintomáticos de distintos activos con un único nodo de causa raíz. Tarjeta de incidente con un grafo de dependencias que vincula decenas de Issues sintomáticos de distintos activos con un único nodo de causa raíz.
Tarjeta de incidente: grafo de dependencias — decenas de síntomas, una sola causa

Revisión posincidente

Tras el cierre, el incidente se somete a un análisis.

El informe incluye:

  • la cronología;
  • la Root Cause confirmada;
  • la eficacia de la respuesta;
  • el cumplimiento del SLA;
  • las lecciones aprendidas (Lessons Learned);
  • las recomendaciones para evitar que se repita.

Todas las conclusiones pueden convertirse automáticamente en artículos de la Knowledge Base.

Temas relacionados

Última actualización el

¿Te resultó útil esta página?