Управління масовими інцидентами
Управління інцидентами, що охоплюють багато активів — автоматична кореляція, життєвий цикл інциденту, операційний дашборд і постінцидентний розбір.
Massive Incident — це сукупність взаємопов’язаних Operational Issues, об’єднаних спільною причиною виникнення.
Це дає змогу аналізувати великі експлуатаційні події як єдиний об’єкт управління.
Кореляція інцидентів
OHM автоматично об’єднує Operational Issues у Massive Incident за збігу кількох чинників:
- часу виникнення;
- регіону;
- Root Cause;
- комунікаційної інфраструктури;
- версії програмного забезпечення;
- зовнішньої події.
Життєвий цикл Massive Incident
flowchart TD
A["Виявлення"] --> B["Кореляція"]
B --> C["Massive Incident створено"]
C --> D["Розслідування"]
D --> E["Зниження впливу"]
E --> F["Відновлення"]
F --> G["Перевірка"]
G --> H["Постінцидентний розбір"]
H --> I["Закриття"]
Операційний дашборд
Для кожного Massive Incident система відображає:
- кількість пов’язаних Operational Issues;
- кількість активів;
- уражені регіони;
- імовірну Root Cause;
- статус розслідування;
- SLA;
- вплив на бізнес;
- поточний прогрес відновлення.
Постінцидентний розбір
Після закриття інцидент аналізують.
Звіт містить:
- хронологію;
- підтверджену Root Cause;
- ефективність реагування;
- дотримання SLA;
- здобуті уроки (Lessons Learned);
- рекомендації щодо запобігання повторенню.
Усі висновки можна автоматично перетворити на статті Knowledge Base.
Пов'язані теми
Останнє оновлення
Чи була ця сторінка корисною?
Дякуємо за відгук!
AI Operations Intelligence
Назад
Інтеграція, безпека та відповідність стандартам
Далі