Управління масовими інцидентами

Управління інцидентами, що охоплюють багато активів — автоматична кореляція, життєвий цикл інциденту, операційний дашборд і постінцидентний розбір.

Massive Incident — це сукупність взаємопов’язаних Operational Issues, об’єднаних спільною причиною виникнення.

Це дає змогу аналізувати великі експлуатаційні події як єдиний об’єкт управління.

Кореляція інцидентів

OHM автоматично об’єднує Operational Issues у Massive Incident за збігу кількох чинників:

  • часу виникнення;
  • регіону;
  • Root Cause;
  • комунікаційної інфраструктури;
  • версії програмного забезпечення;
  • зовнішньої події.

Життєвий цикл Massive Incident

flowchart TD
    A["Виявлення"] --> B["Кореляція"]
    B --> C["Massive Incident створено"]
    C --> D["Розслідування"]
    D --> E["Зниження впливу"]
    E --> F["Відновлення"]
    F --> G["Перевірка"]
    G --> H["Постінцидентний розбір"]
    H --> I["Закриття"]
Хронологія масового інциденту: інцидент проходить стадії життєвого циклу від виявлення до постінцидентного аналізу. Хронологія масового інциденту: інцидент проходить стадії життєвого циклу від виявлення до постінцидентного аналізу.
Масовий інцидент із власним життєвим циклом: Detected → Confirmed → Investigation → Mitigation → Resolved → Post-Analysis

Операційний дашборд

Для кожного Massive Incident система відображає:

  • кількість пов’язаних Operational Issues;
  • кількість активів;
  • уражені регіони;
  • імовірну Root Cause;
  • статус розслідування;
  • SLA;
  • вплив на бізнес;
  • поточний прогрес відновлення.
Картка інциденту з графом залежностей, який пов’язує десятки симптомних Issues на різних активах з єдиним вузлом першопричини. Картка інциденту з графом залежностей, який пов’язує десятки симптомних Issues на різних активах з єдиним вузлом першопричини.
Картка інциденту: граф залежностей — десятки симптомів, одна причина

Постінцидентний розбір

Після закриття інцидент аналізують.

Звіт містить:

  • хронологію;
  • підтверджену Root Cause;
  • ефективність реагування;
  • дотримання SLA;
  • здобуті уроки (Lessons Learned);
  • рекомендації щодо запобігання повторенню.

Усі висновки можна автоматично перетворити на статті Knowledge Base.

Пов'язані теми

Останнє оновлення

Чи була ця сторінка корисною?