Gestión de incidentes masivos
Gestión de incidentes que abarcan múltiples activos — correlación automática, ciclo de vida del incidente, panel operativo y revisión posincidente.
Un Massive Incident es un conjunto de Operational Issues interrelacionados que comparten una causa común.
Esto permite analizar los eventos operativos de gran escala como un único objeto de gestión.
Correlación de incidentes
OHM agrupa automáticamente los Operational Issues en un Massive Incident cuando coinciden varios factores:
- el momento de aparición;
- la región;
- la Root Cause;
- la infraestructura de comunicaciones;
- la versión del software;
- un evento externo.
Ciclo de vida del Massive Incident
flowchart TD
A["Detección"] --> B["Correlación"]
B --> C["Massive Incident creado"]
C --> D["Investigación"]
D --> E["Mitigación"]
E --> F["Recuperación"]
F --> G["Verificación"]
G --> H["Revisión posincidente"]
H --> I["Cierre"]
Panel operativo
Para cada Massive Incident, el sistema muestra:
- el número de Operational Issues relacionados;
- el número de activos;
- las regiones afectadas;
- la presunta Root Cause;
- el estado de la investigación;
- el SLA;
- el impacto en el negocio;
- el progreso actual de la recuperación.
Revisión posincidente
Tras el cierre, el incidente se somete a un análisis.
El informe incluye:
- la cronología;
- la Root Cause confirmada;
- la eficacia de la respuesta;
- el cumplimiento del SLA;
- las lecciones aprendidas (Lessons Learned);
- las recomendaciones para evitar que se repita.
Todas las conclusiones pueden convertirse automáticamente en artículos de la Knowledge Base.
Temas relacionados
¿Te resultó útil esta página?
¡Gracias por tus comentarios!