Evidence e correlazione

Il modello Evidence immutabile con valutazione della qualità e il motore di correlazione che collega i sintomi affini a una probabile Root Cause con un livello di confidenza esplicito.

Modello Evidence

Che cos’è Evidence

Evidence è una prova strutturata sulla base della quale il sistema crea, aggiorna o verifica un Issue.

Evidence può essere:

  • calcolata automaticamente;
  • ricevuta da un dispositivo;
  • importata da un sistema esterno;
  • aggiunta da un utente;
  • generata da un report specializzato;
  • allegata sotto forma di documento, fotografia o commento.

Struttura di Evidence

Tipi di Evidence

TipoEsempio
detector_findingrisultato di un Detector
telemetry_sampleframmento di telemetria
archive_windowsintesi di un periodo di archivio
event_logregistro eventi del dispositivo
configuration_snapshotSnapshot della configurazione
operator_commentcommento del dispatcher
field_reportrapporto o verbale della squadra sul campo
photofotografia dell’apparecchiatura
external_ticketcollegamento a un ticket esterno
verification_resultconferma dell’avvenuta risoluzione
root_cause_confirmationconferma della Root Cause
knowledge_applicationapplicazione di un articolo della Knowledge Base

Qualità dell’Evidence

Per ogni Evidence viene calcolata la qualità:

Qevidence=wcC+wfF+wsS+wtTQ_{evidence} = w_c C + w_f F + w_s S + w_t T

dove:

  • CC — completezza;
  • FF — attualità;
  • SS — coerenza;
  • TT — fiducia nella fonte;
  • wc+wf+ws+wt=1w_c + w_f + w_s + w_t = 1.

Pesi di base consigliati:

ComponentePeso
wcw_c — completezza0.30
wfw_f — attualità0.25
wsw_s — coerenza0.25
wtw_t — fiducia nella fonte0.20

Il risultato è normalizzato nell’intervallo da 0 a 1.

Immutabilità dell’Evidence

L’Evidence originaria non viene mai modificata retroattivamente. Una correzione crea una nuova versione oppure un’Evidence correttiva separata.

Questo garantisce:

  • l’auditabilità;
  • la riproducibilità;
  • la protezione dello storico;
  • il corretto riesame dei casi controversi;
  • la possibilità di ricalcolo.

Correlazione degli eventi e Root Cause

Compito della correlazione

La correlazione impedisce la creazione di molti Issue indipendenti per una stessa causa tecnica.

Il sistema analizza:

  • la corrispondenza dell’Asset;
  • la prossimità temporale;
  • la dipendenza topologica;
  • il firmware comune;
  • il gateway comune;
  • l’operatore di telecomunicazioni comune;
  • la regione comune;
  • la coda comune sul server;
  • la sequenza dei sintomi;
  • i legami storici;
  • le Root Cause confermate di casi passati.

Livelli di correlazione

All’interno di un singolo Asset

Più sintomi vengono consolidati attorno a un Canon principale.

flowchart TD
  A["stale_communication"] --> C{"Correlazione all'interno dell'Asset"}
  B["no_hourly_archive"] --> C
  D["battery_unknown"] --> C
  C --> R["Issue principale stale_communication"]
  C --> S1["Segnale secondario no_hourly_archive"]
  C --> S2["Segnale secondario battery_unknown"]

Tra Asset diversi

Problemi simili vengono raggruppati in un Massive Incident.

flowchart TD
  A["38 dispositivi"] --> G{"Raggruppamento"}
  B["Una sola versione firmware"] --> G
  C["Una sola finestra temporale"] --> G
  D["Un solo tipo di guasto"] --> G
  G --> M["Massive Incident firmware_regression"]

Per dipendenza

I problemi dei dispositivi figli vengono collegati al guasto di un componente comune.

flowchart TD
  A["Gateway-17 non raggiungibile"] --> B["12 correttori senza comunicazione"]
  B --> C["12 archivi non consegnati"]
  C --> D["Un unico incidente di dipendenza"]

Punteggio di correlazione (Correlation Score)

Per valutare la forza di un legame viene utilizzato un modello spiegabile:

Scorr=waA+wtT+wpP+wcC+whHS_{corr} = w_a A + w_t T + w_p P + w_c C + w_h H

dove:

  • AA — corrispondenza di Asset o dipendenza;
  • TT — prossimità temporale;
  • PP — corrispondenza del pattern;
  • CC — contesto comune;
  • HH — conferma storica del legame.

Esempio di pesi:

FattorePeso
AA — corrispondenza di Asset o dipendenza0.30
TT — prossimità temporale0.20
PP — somiglianza del pattern0.20
CC — contesto comune0.15
HH — conferma storica0.15

La soglia di unificazione è definita per classe di problema. Per i segnali critici di Security è ammessa una soglia più conservativa.

Classi di Root Cause

OHM utilizza un catalogo gestito delle Root Cause:

ClasseEsempi
Powerbatteria, alimentazione, convertitore
Communicationrete, SIM, segnale, operatore
Firmwareregressione, incompatibilità
Configurationparametro errato
Registryduplicato, voce fantasma, associazione errata
Sensorguasto, deriva, letture bloccate
Meteringproblema metrologico
Infrastructureserver, coda, gateway
IntegrationAPI, formato, mappatura
Humanerrore in un’azione o in un processo
Environmenttemperatura, umidità, sollecitazioni esterne
Securityviolazione dell’integrità o degli accessi
Externalsistema o fornitore di terze parti
Unknowndati insufficienti

Stati della Root Cause

StatoSignificato
hypothesisipotesi proposta automaticamente
under_investigationl’ipotesi è in fase di verifica
probableconfermata da più indicatori indipendenti
confirmedconfermata da un utente autorizzato e da Evidence
rejectedl’ipotesi è stata respinta
unknownla Root Cause non è stata individuata

Confidenza nella Root Cause

La confidenza in un’ipotesi viene calcolata in base all’insieme delle Evidence:

Croot=i=1nriqiaii=1nriKindependenceC_{root} = \frac{ \sum_{i=1}^{n} r_i q_i a_i }{ \sum_{i=1}^{n} r_i } \cdot K_{independence}

dove:

  • rir_i — affidabilità del Detector o della fonte;
  • qiq_i — qualità dell’Evidence;
  • aia_i — coerenza dell’Evidence con l’ipotesi;
  • KindependenceK_{independence} — coefficiente di indipendenza delle fonti.

Se più Evidence provengono dallo stesso insieme di dati di origine, non sono considerate pienamente indipendenti.

Confidenza operativa (Operational Confidence)

Operational Confidence indica quanto il sistema sia certo che un Issue sia un problema reale e correttamente classificato.

Cissue=wdD+weE+wrR+whHwxXC_{issue} = w_d D + w_e E + w_r R + w_h H - w_x X

dove:

  • DD — affidabilità dei Detector;
  • EE — qualità delle Evidence;
  • RR — coerenza della correlazione;
  • HH — tasso di conferma storica;
  • XX — penalità per contraddizioni e dati insufficienti.

Interpretazione:

ConfidenceLivelloAzione
≥ 0.85altocreazione automatica di un Issue actionable
0.65–0.85sufficientecreazione dell’Issue con triage standard
0.40–0.65limitatoè richiesto un riesame
< 0.40bassosegnale analitico, azioni automatiche vietate

Argomenti correlati

Questa pagina è stata utile?