Evidence y correlación

El modelo inmutable de Evidence con evaluación de la calidad y el motor de correlación que asocia los síntomas relacionados entre sí a una causa raíz probable, con un nivel de confianza explícito.

Modelo Evidence

Qué es Evidence

Evidence es una prueba estructurada sobre cuya base el sistema crea, actualiza o verifica un Issue.

Evidence puede ser:

  • calculada automáticamente;
  • recibida de un dispositivo;
  • importada de un sistema externo;
  • añadida por un usuario;
  • generada por un informe especializado;
  • adjuntada en forma de documento, fotografía o comentario.

Estructura de Evidence

Tipos de Evidence

TipoEjemplo
detector_findingresultado de un detector
telemetry_samplefragmento de telemetría
archive_windowresumen de un periodo de archivo
event_logregistro de eventos del dispositivo
configuration_snapshotsnapshot de la configuración
operator_commentcomentario del despachador
field_reportacta o informe de una brigada de campo
photofotografía del equipo
external_ticketenlace a un ticket externo
verification_resultconfirmación de la resolución
root_cause_confirmationconfirmación de la causa raíz
knowledge_applicationaplicación de un artículo de la base de conocimiento

Calidad de Evidence

Para cada Evidence se calcula su calidad:

Qevidence=wcC+wfF+wsS+wtTQ_{evidence} = w_c C + w_f F + w_s S + w_t T

donde:

  • CC — completitud;
  • FF — actualidad;
  • SS — coherencia;
  • TT — confianza en la fuente;
  • wc+wf+ws+wt=1w_c + w_f + w_s + w_t = 1.

Pesos base recomendados:

ComponentePeso
wcw_c — completitud0.30
wfw_f — actualidad0.25
wsw_s — coherencia0.25
wtw_t — confianza en la fuente0.20

El resultado se normaliza al rango de 0 a 1.

Inmutabilidad de Evidence

La Evidence original nunca se edita retroactivamente. Una corrección crea una nueva versión o una Evidence correctiva independiente.

Esto garantiza:

  • la auditabilidad;
  • la reproducibilidad;
  • la protección del historial;
  • el análisis correcto de los casos controvertidos;
  • la posibilidad de recalcular.

Correlación de eventos y Root Cause

Objetivo de la correlación

La correlación evita que se creen numerosos Issues independientes para una misma causa técnica.

El sistema analiza:

  • la coincidencia del activo (Asset);
  • la proximidad temporal;
  • la dependencia topológica;
  • el firmware compartido;
  • el gateway compartido;
  • el operador de comunicaciones compartido;
  • la región compartida;
  • la cola de servidor compartida;
  • la secuencia de síntomas;
  • los vínculos históricos;
  • las Root Cause confirmadas de casos anteriores.

Niveles de correlación

Dentro de un mismo activo

Varios síntomas se consolidan en torno a un canon principal.

flowchart TD
  A["stale_communication"] --> C{"Correlación dentro del activo"}
  B["no_hourly_archive"] --> C
  D["battery_unknown"] --> C
  C --> R["Issue principal stale_communication"]
  C --> S1["Señal secundaria no_hourly_archive"]
  C --> S2["Señal secundaria battery_unknown"]

Entre activos

Los problemas similares se agrupan en un incidente masivo.

flowchart TD
  A["38 dispositivos"] --> G{"Agrupación"}
  B["Una versión de firmware"] --> G
  C["Un intervalo de tiempo"] --> G
  D["Un tipo de fallo"] --> G
  G --> M["Massive Incident firmware_regression"]

Por dependencia

Los problemas de los dispositivos dependientes se vinculan al fallo de un componente compartido.

flowchart TD
  A["Gateway-17 no disponible"] --> B["12 correctores sin comunicación"]
  B --> C["12 archivos no entregados"]
  C --> D["Un incidente de dependencia"]

Puntuación del vínculo (Correlation Score)

Para evaluar la fuerza de un vínculo se emplea un modelo explicable:

Scorr=waA+wtT+wpP+wcC+whHS_{corr} = w_a A + w_t T + w_p P + w_c C + w_h H

donde:

  • AA — coincidencia de activo o dependencia;
  • TT — proximidad temporal;
  • PP — coincidencia de patrón;
  • CC — contexto compartido;
  • HH — confirmación histórica del vínculo.

Ejemplo de pesos:

FactorPeso
AA — coincidencia de activo o dependencia0.30
TT — proximidad temporal0.20
PP — similitud de patrón0.20
CC — contexto compartido0.15
HH — confirmación histórica0.15

El umbral de fusión se define por clase de problema. Para las señales críticas de seguridad se admite un umbral más conservador.

Clases de Root Cause

OHM utiliza un catálogo gestionado de causas raíz:

ClaseEjemplos
Powerbatería, alimentación, convertidor
Communicationred, SIM, señal, operador
Firmwareregresión, incompatibilidad
Configurationparámetro erróneo
Registryduplicado, ghost, vinculación incorrecta
Sensorfallo, deriva, lecturas congeladas
Meteringproblema metrológico
Infrastructureservidor, cola, gateway
IntegrationAPI, formato, mapping
Humanerror en una acción o en un proceso
Environmenttemperatura, humedad, impacto externo
Securityvulneración de la integridad o del acceso
Externalsistema o proveedor externo
Unknowndatos insuficientes

Estados de Root Cause

EstadoSignificado
hypothesishipótesis propuesta automáticamente
under_investigationla hipótesis se está verificando
probableconfirmada por varios indicios independientes
confirmedconfirmada por un usuario autorizado y por Evidence
rejectedla hipótesis se ha rechazado
unknownla causa raíz no se ha establecido

Confianza en la Root Cause

La confianza en una hipótesis se calcula a partir del conjunto de pruebas:

Croot=i=1nriqiaii=1nriKindependenceC_{root} = \frac{ \sum_{i=1}^{n} r_i q_i a_i }{ \sum_{i=1}^{n} r_i } \cdot K_{independence}

donde:

  • rir_i — fiabilidad del detector o de la fuente;
  • qiq_i — calidad de la Evidence;
  • aia_i — coherencia de la Evidence con la hipótesis;
  • KindependenceK_{independence} — coeficiente de independencia de las fuentes.

Si varias Evidence proceden del mismo conjunto de datos de origen, no se consideran plenamente independientes.

Confianza operativa (Operational Confidence)

Operational Confidence indica hasta qué punto el sistema está seguro de que un Issue es un problema real y correctamente clasificado.

Cissue=wdD+weE+wrR+whHwxXC_{issue} = w_d D + w_e E + w_r R + w_h H - w_x X

donde:

  • DD — fiabilidad de los detectores;
  • EE — calidad de la Evidence;
  • RR — coherencia de la correlación;
  • HH — tasa de confirmación histórica;
  • XX — penalización por contradicciones y falta de datos.

Interpretación:

ConfidenceNivelAcción
≥ 0.85altocreación automática de un Issue accionable
0.65–0.85suficientecreación del Issue con triaje estándar
0.40–0.65limitadose requiere revisión
< 0.40bajoseñal analítica, acciones automáticas prohibidas

Temas relacionados

¿Te resultó útil esta página?