Modèle Evidence et corrélation

Le modèle Evidence immuable, assorti d'une notation de la qualité, et le moteur de corrélation qui relie les symptômes apparentés à une Root Cause probable avec un niveau de confiance explicite.

Modèle Evidence

Qu’est-ce qu’une Evidence

Evidence est une preuve structurée sur la base de laquelle le système crée, met à jour ou vérifie une Issue.

Une Evidence peut être :

  • calculée automatiquement ;
  • reçue d’un équipement ;
  • importée depuis un système externe ;
  • ajoutée par un utilisateur ;
  • produite par un rapport spécialisé ;
  • jointe sous forme de document, de photo ou de commentaire.

Structure d’une Evidence

Types d’Evidence

TypeExemple
detector_findingrésultat d’un détecteur
telemetry_samplefragment de télémétrie
archive_windowsynthèse d’une période d’archive
event_logjournal des événements de l’équipement
configuration_snapshotinstantané de la configuration
operator_commentcommentaire du dispatcheur
field_reportrapport ou procès-verbal d’une équipe de terrain
photophotographie de l’équipement
external_ticketlien vers un ticket externe
verification_resultconfirmation de la remise en état
root_cause_confirmationconfirmation de la Root Cause
knowledge_applicationapplication d’un article de la base de connaissances

Qualité des Evidence

La qualité est calculée pour chaque Evidence :

Qevidence=wcC+wfF+wsS+wtTQ_{evidence} = w_c C + w_f F + w_s S + w_t T

où :

  • CC — completeness, exhaustivité ;
  • FF — freshness, fraîcheur ;
  • SS — consistency, cohérence ;
  • TT — trust, confiance dans la source ;
  • wc+wf+ws+wt=1w_c + w_f + w_s + w_t = 1.

Pondération de base recommandée :

ComposantePoids
wcw_c — exhaustivité0.30
wfw_f — fraîcheur0.25
wsw_s — cohérence0.25
wtw_t — confiance dans la source0.20

Le résultat est normalisé dans l’intervalle de 0 à 1.

Immuabilité des Evidence

L’Evidence d’origine n’est jamais modifiée rétroactivement. Une correction crée une nouvelle version ou une Evidence corrective distincte.

Cela garantit :

  • l’auditabilité ;
  • la reproductibilité ;
  • la protection de l’historique ;
  • l’analyse correcte des cas litigieux ;
  • la possibilité de recalculer.

Corrélation des événements et Root Cause

L’objectif de la corrélation

La corrélation évite la création de nombreuses Issues indépendantes pour une même cause technique.

Le système analyse :

  • la correspondance de l’actif ;
  • la proximité temporelle ;
  • la dépendance topologique ;
  • le firmware commun ;
  • la passerelle commune ;
  • l’opérateur télécom commun ;
  • la région commune ;
  • la file d’attente serveur commune ;
  • la séquence des symptômes ;
  • les liens historiques ;
  • les Root Causes confirmées de cas passés.

Niveaux de corrélation

Au sein d’un même actif

Plusieurs symptômes sont regroupés autour d’un canon principal.

flowchart TD
  A["stale_communication"] --> C{"Corrélation au sein de l'actif"}
  B["no_hourly_archive"] --> C
  D["battery_unknown"] --> C
  C --> R["Issue principale stale_communication"]
  C --> S1["Signal secondaire no_hourly_archive"]
  C --> S2["Signal secondaire battery_unknown"]

Entre actifs

Les problèmes similaires sont regroupés en un incident massif.

flowchart TD
  A["38 équipements"] --> G{"Regroupement"}
  B["Une même version de firmware"] --> G
  C["Une même fenêtre temporelle"] --> G
  D["Un même type de défaillance"] --> G
  G --> M["Massive Incident firmware_regression"]

Par dépendance

Les problèmes des équipements enfants sont rattachés à la défaillance d’un composant commun.

flowchart TD
  A["Gateway-17 indisponible"] --> B["12 correcteurs sans communication"]
  B --> C["12 archives non livrées"]
  C --> D["Un incident de dépendance"]

Score de corrélation (Correlation Score)

Un modèle explicable sert à évaluer la force du lien :

Scorr=waA+wtT+wpP+wcC+whHS_{corr} = w_a A + w_t T + w_p P + w_c C + w_h H

où :

  • AA — correspondance d’actif ou de dépendance ;
  • TT — proximité temporelle ;
  • PP — correspondance de motif ;
  • CC — contexte commun ;
  • HH — confirmation historique du lien.

Exemple de pondération :

FacteurPoids
AA — correspondance d’actif ou de dépendance0.30
TT — proximité temporelle0.20
PP — similarité de motif0.20
CC — contexte commun0.15
HH — confirmation historique0.15

Le seuil de fusion est défini par classe de problème. Un seuil plus conservateur est admis pour les signaux de sécurité critiques.

Classes de Root Cause

OHM utilise un référentiel géré des causes racines :

ClasseExemples
Powerbatterie, alimentation, convertisseur
Communicationréseau, SIM, signal, opérateur
Firmwarerégression, incompatibilité
Configurationparamètre erroné
Registrydoublon, objet fantôme, rattachement incorrect
Sensordéfaillance, dérive, valeurs figées
Meteringproblème métrologique
Infrastructureserveur, file d’attente, passerelle
IntegrationAPI, format, mappage
Humanerreur d’action ou de processus
Environmenttempérature, humidité, influence extérieure
Securityatteinte à l’intégrité ou aux droits d’accès
Externalsystème tiers ou fournisseur
Unknowndonnées insuffisantes

Statuts de Root Cause

StatutSignification
hypothesishypothèse proposée automatiquement
under_investigationl’hypothèse est en cours de vérification
probableconfirmée par plusieurs indices indépendants
confirmedconfirmée par un utilisateur habilité et des Evidence
rejectedl’hypothèse a été écartée
unknownla cause racine n’a pas été établie

Confiance dans la Root Cause

La confiance dans une hypothèse est calculée à partir de l’ensemble des preuves :

Croot=i=1nriqiaii=1nriKindependenceC_{root} = \frac{ \sum_{i=1}^{n} r_i q_i a_i }{ \sum_{i=1}^{n} r_i } \cdot K_{independence}

où :

  • rir_i — fiabilité du détecteur ou de la source ;
  • qiq_i — qualité de l’Evidence ;
  • aia_i — cohérence de l’Evidence avec l’hypothèse ;
  • KindependenceK_{independence} — coefficient d’indépendance des sources.

Si plusieurs Evidence proviennent du même jeu de données source, elles ne sont pas considérées comme pleinement indépendantes.

Confiance opérationnelle (Operational Confidence)

Operational Confidence indique à quel point le système est certain qu’une Issue constitue un problème réel et correctement classé.

Cissue=wdD+weE+wrR+whHwxXC_{issue} = w_d D + w_e E + w_r R + w_h H - w_x X

où :

  • DD — fiabilité des détecteurs ;
  • EE — qualité des Evidence ;
  • RR — cohérence de la corrélation ;
  • HH — taux de confirmation historique ;
  • XX — pénalité pour contradictions et données manquantes.

Interprétation :

ConfidenceNiveauAction
≥ 0.85élevécréation automatique d’une Issue actionable
0.65–0.85suffisantcréation d’une Issue avec triage standard
0.40–0.65limitéexamen requis
< 0.40faiblesignal analytique, actions automatiques interdites

Sujets connexes

Cette page vous a-t-elle été utile ?