Linkage quality

Data Cutoff: July 10, 2026Results generated: 2026-07-14 00:41 UTC
Candidate pairs before threshold

42,919

Candidate pairs after threshold

382

Cluster size distribution

Links per heuristic

Borderline matches

Index 1Index 2ScoreFields matched

No data

Cómo funciona el enlace de registros (Record Linkage)

1. Depuración y Categorización de InstitucionesAntes de enlazar, se estandarizan los nombres de las instituciones y se asignan a uno de los tres listados principales:
  • Instituciones de Alta Complejidad: Hospital Pablo Tobón Uribe, Hospital Alma Mater, Hospital San Vicente de Paúl.
  • Instituciones Públicas: Hospital General de Medellín, Metrosalud, Hospital Manuel Uribe Ángel, Hospital Marco Fidel Suárez.
  • Clínicas Especializadas: Neurum, ABC, Clid.
2. Fase 1: Enlace Determinista (Reglas Heurísticas)Se aplican reglas lógicas estrictas de manera secuencial para identificar pacientes idénticos:
  • Coincidencia de Documento (Prioridad 10): Enlace automático si el tipo y número de documento de identidad son exactamente iguales.
  • Coincidencia de Contacto (Prioridad 20): Enlace si coinciden en número de teléfono y año de nacimiento (evitando agrupar familiares).
  • Regla Demográfica Colombiana (Prioridad 30): Coincidencia del primer nombre, primer apellido y año de nacimiento. Si el municipio está disponible, deben coincidir exactamente o no estar definidos.
  • Coincidencia Difusa (Prioridad 40): Captura errores tipográficos calculando similitud textual (SequenceMatcher ≥ 85%) sobre el nombre completo dentro del mismo año de nacimiento.
3. Fase 2: Enlace Probabilístico (Fellegi-Sunter)Para registros que no coinciden bajo reglas deterministas, se estima la probabilidad de que pertenezcan a la misma persona. Se calcula un puntaje de coincidencia ponderado basado en:
  • Nombres y apellidos completos (comparación de Jaro-Winkler).
  • Año de nacimiento y sexo biológico.
  • Municipio de residencia.
Si el puntaje supera el umbral probabilístico preestablecido, los registros se enlazan en un mismo clúster de paciente. Esto minimiza el riesgo de doble contabilidad y permite estimar el subregistro real de casos de diabetes.