Жаппай инциденттерді басқару
Көптеген активтерді қамтитын инциденттерді басқару — автоматты корреляция, инциденттің өмірлік циклі, операциялық дашборд және инциденттен кейінгі талдау.
Massive Incident — ортақ себептен туындаған, өзара байланысты Operational Issues жиынтығы.
Бұл ірі пайдалану оқиғаларын бірыңғай басқару объектісі ретінде талдауға мүмкіндік береді.
Инциденттер корреляциясы
OHM бірнеше фактор сәйкес келгенде Operational Issues-ті Massive Incident-ке автоматты түрде біріктіреді:
- туындау уақыты;
- өңір;
- Root Cause;
- байланыс инфрақұрылымы;
- бағдарламалық жасақтама нұсқасы;
- сыртқы оқиға.
Massive Incident өмірлік циклі
flowchart TD
A["Анықтау"] --> B["Корреляция"]
B --> C["Massive Incident жасалды"]
C --> D["Тергеп-тексеру"]
D --> E["Әсерді азайту"]
E --> F["Қалпына келтіру"]
F --> G["Тексеру"]
G --> H["Инциденттен кейінгі талдау"]
H --> I["Жабу"]
Операциялық дашборд
Әрбір Massive Incident үшін жүйе мыналарды көрсетеді:
- байланысты Operational Issues санын;
- активтер санын;
- қамтылған өңірлерді;
- болжамды Root Cause-ды;
- тергеп-тексеру статусын;
- SLA-ны;
- бизнеске әсерін;
- қалпына келтірудің ағымдағы барысын.
Инциденттен кейінгі талдау
Жабылғаннан кейін инцидент бойынша талдау жүргізіледі.
Есеп мыналарды қамтиды:
- хронологияны;
- расталған Root Cause-ды;
- ден қоюдың тиімділігін;
- SLA сақталуын;
- алынған сабақтарды (Lessons Learned);
- қайталануын болдырмау бойынша ұсынымдарды.
Барлық тұжырымдарды Knowledge Base мақалаларына автоматты түрде айналдыруға болады.
Қатысты тақырыптар
Бұл бет пайдалы болды ма?
Пікіріңіз үшін рақмет!