اولویت‌ها، SLA و تشدید (Escalation)

ارزیابی Severity، اولویت و اثر کسب‌وکاری، سیاست‌های SLA به‌همراه تقویم‌ها، تایمرها و قواعد توقف موقت، و مکانیزم خودکار تشدید.

اولویت، Severity و اثر کسب‌وکاری

شدت (Severity)

‏Severity بیانگر شدت فنی وضعیت جاری است.

سطحمعنا
Criticalریسک فوری از دست رفتن کنترل، اندازه‌گیری، ایمنی یا خرابی گسترده
Highاختلال چشمگیر در عملکرد
Mediumافت کارکرد بدون پیامد بحرانی فوری
Lowانحراف موضعی یا کمبود داده
Informationalمشاهده‌ای که نیاز به اقدام فوری ندارد

اولویت (Priority)

‏Priority بیانگر ترتیب انجام کارهاست.

اولویتمهلت متعارف
P1واکنش فوری، رفع ظرف 24 ساعت
P2رفع برنامه‌ریزی‌شده ظرف 5 روز
P3رفع ظرف 20 روز
P4بهبود یا اصلاح کم‌اولویت

‏Severity و Priority یکی نیستند.

برای نمونه، یک Issue می‌تواند هم‌زمان Severity = High و Priority = P3 داشته باشد.

چنین حالتی زمانی ممکن است که مشکل از نظر فنی جدی باشد، اما یک Asset رزرو را درگیر کند که در حال حاضر تأثیری بر بهره‌برداری ندارد.

امتیاز تجمیعی (Impact Score)

برای رتبه‌بندی می‌توان از یک امتیاز تجمیعی استفاده کرد:

I=wsS+wbB+waA+wrR+wdDI = w_s S + w_b B + w_a A + w_r R + w_d D

که در آن:

  • SS — شدت؛
  • BB — اثر کسب‌وکاری؛
  • AA — شمار یا بحرانی‌بودن Assetهای درگیر؛
  • RR — ریسک ایمنی یا مقرراتی؛
  • DD — مدت زمان.

اثر کسب‌وکاری (Business Impact)

‏OHM از فیلدهای ساختارمند اثر پشتیبانی می‌کند:

  • شمار دستگاه‌های درگیر؛
  • شمار مصرف‌کنندگان یا مکان‌ها؛
  • حجم گاز در معرض ریسک؛
  • مدت افت کارکرد؛
  • از دست رفتن احتمالی داده؛
  • ریسک اندازه‌گیری تجاری نادرست؛
  • ریسک اعزام گروه میدانی؛
  • ریسک نقض SLA؛
  • ریسک امنیت اطلاعات؛
  • هزینهٔ توقف کار؛
  • سطح اثر بر اعتبار سازمان.

مدیریت سطح سرویس (SLA)

‏OHM یک مدل تمام‌عیار برای مدیریت SLA پیاده می‌کند.

نظارت نه‌تنها بر رفع مشکل، بلکه بر تمام چرخهٔ رسیدگی به آن اعمال می‌شود.

flowchart TD
  A["Issue ایجاد شد"] --> B["Response SLA"]
  B --> C["Acknowledgement SLA"]
  C --> D["Resolution SLA"]
  D --> E["Verification SLA"]
  E --> F["Closure SLA"]

هر مرحله قواعد محاسبهٔ ویژهٔ خود را دارد.

سیاست SLA

سیاست SLA موارد زیر را تعریف می‌کند:

  • زمان مجاز واکنش؛
  • مهلت تأیید دریافت؛
  • مهلت رفع؛
  • مهلت راستی‌آزمایی؛
  • قواعد تشدید؛
  • تقویم کاری؛
  • استثناها.

‏SLA به‌صورت خودکار و بر پایهٔ Canon، بحرانی‌بودن و ردهٔ شیء اختصاص می‌یابد.

تقویم‌های کاری

سامانه از موارد زیر پشتیبانی می‌کند:

  • 24×7؛
  • 12×7؛
  • روزهای کاری؛
  • تقویم‌های منطقه‌ای؛
  • روزهای تعطیل رسمی؛
  • برنامه‌های زمانی اختصاصی هر واحد.

زمان خارج از تقویم کاری به حساب نمی‌آید، مگر آنکه سیاست SLA واکنش شبانه‌روزی را الزامی کند.

تایمرهای SLA

برای هر Issue، سامانه هم‌زمان چند تایمر مستقل را محاسبه می‌کند.

برای نمونه:

  • ‏Time To Response؛
  • ‏Time To Acknowledge؛
  • ‏Time To Resolve؛
  • ‏Time To Verify؛
  • ‏Time To Close.

هر تایمر می‌تواند قواعد توقف ویژهٔ خود را داشته باشد.

شرایط توقف موقت

شمارش SLA را می‌توان موقتاً متوقف کرد.

برای نمونه:

  • انتظار برای تأمین‌کننده؛
  • انتظار برای دسترسی؛
  • انتظار برای مجوز؛
  • محدودیت‌های فصلی؛
  • فورس‌ماژور.

دلیل توقف موقت باید حتماً ثبت شود.

نقض SLA

هنگام نقض SLA، سامانه به‌صورت خودکار:

  • وضعیت را تغییر می‌دهد؛
  • سطح ریسک را بالا می‌برد؛
  • ‏Escalation Engine را به کار می‌اندازد؛
  • یک رکورد ممیزی می‌سازد؛
  • نقض را در KPIها بازتاب می‌دهد.

مکانیزم تشدید (Escalation Engine)

‏Escalation Engine هنگام نقض شرایط تعیین‌شده، مشکل را به‌صورت خودکار به سطح بالاتری از مسئولیت منتقل می‌کند.

تشدید به اقدامات کاربر وابسته نیست و به‌صورت خودکار انجام می‌شود.

سطوح تشدید

یک سناریوی متعارف:

flowchart TD
  P1["P1"] -->|"15 دقیقه"| L1["سرپرست شیفت"]
  L1 -->|"1 ساعت"| L2["مدیر منطقه"]
  L2 -->|"4 ساعت"| L3["مدیر بهره‌برداری"]

بازه‌های دقیق را سیاست سازمان تعیین می‌کند.

محرک‌های تشدید

موارد زیر می‌توانند تشدید را فعال کنند:

  • نقض Response SLA؛
  • نقض Resolution SLA؛
  • نبود مسئول؛
  • نبود تأیید دریافت؛
  • بازگشایی دوباره؛
  • گستردگی مشکل؛
  • ‏Business Impact بالا.

اقدام‌های تشدید

با برآورده‌شدن یک شرط، سامانه می‌تواند:

  • به مدیر اطلاع دهد؛
  • مالک را تغییر دهد؛
  • ‏Priority را بالا ببرد؛
  • یک Massive Incident ایجاد کند؛
  • یک تیکت بیرونی ایجاد کند؛
  • به مدیریت ارشد اطلاع دهد؛
  • تحلیل تکمیلی را آغاز کند.

همهٔ اقدام‌ها به‌طور کامل ثبت می‌شوند.

تاریخچهٔ تشدیدها

کارت Issue شامل یک لاگ کامل است:

زمانرویداد
09:10‏Issue ایجاد شد
09:25هشدار Response SLA
09:40تشدید، سطح 1
10:30تشدید، سطح 2
13:00تشدید، سطح 3
13:10واگذاری به مدیر

این تاریخچه هرگز حذف نمی‌شود و در محاسبهٔ KPIهای بهره‌برداری به کار می‌رود.

موضوعات مرتبط

آیا این صفحه مفید بود؟