Управление массовыми инцидентами
Управление инцидентами, охватывающими множество активов — автоматическая корреляция, жизненный цикл инцидента, операционный дашборд и постинцидентный разбор.
Massive Incident представляет собой совокупность взаимосвязанных Operational Issues, объединённых общей причиной возникновения.
Это позволяет анализировать крупные эксплуатационные события как единый объект управления.
Корреляция инцидентов
OHM автоматически объединяет Operational Issues в Massive Incident при совпадении нескольких факторов:
- времени возникновения;
- региона;
- Root Cause;
- коммуникационной инфраструктуры;
- версии программного обеспечения;
- внешнего события.
Жизненный цикл Massive Incident
flowchart TD
A["Обнаружение"] --> B["Корреляция"]
B --> C["Massive Incident создан"]
C --> D["Расследование"]
D --> E["Снижение воздействия"]
E --> F["Восстановление"]
F --> G["Проверка"]
G --> H["Постинцидентный разбор"]
H --> I["Закрытие"]
Операционный дашборд
Для каждого Massive Incident система отображает:
- количество связанных Operational Issues;
- количество активов;
- затронутые регионы;
- предполагаемую Root Cause;
- статус расследования;
- SLA;
- влияние на бизнес;
- текущий прогресс восстановления.
Постинцидентный разбор
После закрытия проводится анализ происшествия.
Отчёт включает:
- хронологию;
- подтверждённую Root Cause;
- эффективность реагирования;
- соблюдение SLA;
- Lessons Learned;
- рекомендации по предотвращению повторения.
Все выводы могут быть автоматически преобразованы в статьи Knowledge Base.
Связанные темы
Эта страница была полезной?
Спасибо за ваш отзыв!