Управление массовыми инцидентами

Управление инцидентами, охватывающими множество активов — автоматическая корреляция, жизненный цикл инцидента, операционный дашборд и постинцидентный разбор.

Massive Incident представляет собой совокупность взаимосвязанных Operational Issues, объединённых общей причиной возникновения.

Это позволяет анализировать крупные эксплуатационные события как единый объект управления.

Корреляция инцидентов

OHM автоматически объединяет Operational Issues в Massive Incident при совпадении нескольких факторов:

  • времени возникновения;
  • региона;
  • Root Cause;
  • коммуникационной инфраструктуры;
  • версии программного обеспечения;
  • внешнего события.

Жизненный цикл Massive Incident

flowchart TD
    A["Обнаружение"] --> B["Корреляция"]
    B --> C["Massive Incident создан"]
    C --> D["Расследование"]
    D --> E["Снижение воздействия"]
    E --> F["Восстановление"]
    F --> G["Проверка"]
    G --> H["Постинцидентный разбор"]
    H --> I["Закрытие"]
Хронология массового инцидента: инцидент проходит стадии жизненного цикла от обнаружения до постинцидентного анализа. Хронология массового инцидента: инцидент проходит стадии жизненного цикла от обнаружения до постинцидентного анализа.
Массовый инцидент с собственным жизненным циклом: Detected → Confirmed → Investigation → Mitigation → Resolved → Post-Analysis

Операционный дашборд

Для каждого Massive Incident система отображает:

  • количество связанных Operational Issues;
  • количество активов;
  • затронутые регионы;
  • предполагаемую Root Cause;
  • статус расследования;
  • SLA;
  • влияние на бизнес;
  • текущий прогресс восстановления.
Карточка инцидента с графом зависимостей, связывающим десятки симптомных Issues по разным активам с единым узлом первопричины. Карточка инцидента с графом зависимостей, связывающим десятки симптомных Issues по разным активам с единым узлом первопричины.
Карточка инцидента: граф зависимостей — десятки симптомов, одна причина

Постинцидентный разбор

После закрытия проводится анализ происшествия.

Отчёт включает:

  • хронологию;
  • подтверждённую Root Cause;
  • эффективность реагирования;
  • соблюдение SLA;
  • Lessons Learned;
  • рекомендации по предотвращению повторения.

Все выводы могут быть автоматически преобразованы в статьи Knowledge Base.

Связанные темы

Последнее обновление

Эта страница была полезной?