إدارة الحوادث الجماعية
إدارة الحوادث التي تمتدّ إلى أصول كثيرة — الارتباط التلقائي، ودورة حياة الحادثة، ولوحة المعلومات التشغيلية، والمراجعة بعد الحادثة.
الحادثة الجماعية (Massive Incident) مجموعة من الـ Operational Issues المترابطة التي يجمعها سبب مشترك.
ويتيح ذلك تحليل الأحداث التشغيلية الكبرى بوصفها كائن إدارة واحداً.
ارتباط الحوادث
يجمع OHM الـ Operational Issues تلقائياً في Massive Incident عند تطابق عدّة عوامل:
- وقت الحدوث؛
- الإقليم؛
- Root Cause؛
- البنية التحتية للاتصالات؛
- إصدار البرمجيات؛
- حدث خارجي.
دورة حياة الـ Massive Incident
flowchart TD
A["الاكتشاف"] --> B["الارتباط"]
B --> C["إنشاء Massive Incident"]
C --> D["التحقيق"]
D --> E["تخفيف الأثر"]
E --> F["التعافي"]
F --> G["التحقّق"]
G --> H["المراجعة بعد الحادثة"]
H --> I["الإغلاق"]
لوحة المعلومات التشغيلية
يعرض النظام لكل Massive Incident:
- عدد الـ Operational Issues المرتبطة؛
- عدد الأصول؛
- الأقاليم المتأثّرة؛
- الـ Root Cause المفترض؛
- حالة التحقيق؛
- الـ SLA؛
- الأثر على الأعمال (Business Impact)؛
- التقدّم الحالي في التعافي.
المراجعة بعد الحادثة (Post Incident Review)
بعد الإغلاق، تخضع الحادثة للتحليل.
ويتضمّن التقرير:
- التسلسل الزمني؛
- الـ Root Cause المؤكَّد؛
- فعالية الاستجابة؛
- مدى الالتزام بالـ SLA؛
- الدروس المستفادة (Lessons Learned)؛
- توصيات لمنع تكرار الحادثة.
ويمكن تحويل جميع الاستنتاجات تلقائياً إلى مقالات في Knowledge Base.
مواضيع ذات صلة
آخر تحديث في
هل كانت هذه الصفحة مفيدة؟
شكرًا على ملاحظاتك!
AI Operations Intelligence
السابق
التكامل والأمن والامتثال
التالي