Definición
Método para identificar y enlazar registros de dos o más conjuntos de datos que se refieren a la misma entidad del mundo real mediante la comparación de identificadores persistentes, combinaciones de atributos o puntuaciones de similitud; se implementa de forma determinista cuando existen identificadores únicos autorizados y de forma probabilística cuando las coincidencias se infieren de atributos ruidosos o incompletos.

Principio

Principio
Las decisiones de enlace se derivan de la evidencia de identidad: la igualdad exacta de un identificador produce coincidencias de alta confianza, mientras que la similitud de atributos y reglas contextuales generan coincidencias probabilísticas que equilibran falsos positivos y falsos negativos.

Demostración

Demostración
Escenario ilustrativo → Dos catálogos institucionales registran a 'J. Smith' con fechas de nacimiento coincidentes y uno contiene un identificador institucional. Reconocimiento → La coincidencia de identificador enlaza registros de forma determinista; el par nombre+fecha recibe una puntuación y se marca para revisión. Acción → Los enlaces deterministas se fusionan automáticamente; los enlaces probabilísticos se concilian tras revisión clerical. Consecuencia → Se obtiene una vista consolidada de las pertenencias del individuo mientras los enlaces inciertos quedan documentados y auditables.

Aplicación incorrecta

Aplicación incorrecta
Tratar un único atributo compartido (por ejemplo, un nombre común) como prueba de identidad. Esto confunde igualdad de atributos con identidad de entidad e incrementa los enlaces falsos positivos.

Consecuencia

Consecuencia
La reconciliación correcta permite servicios integrados, análisis consolidados y procedencia fiable entre sistemas; los enlaces incorrectos propagan agregaciones erróneas, atribuyen recursos indebidamente y reducen la confianza en los servicios derivados.

Inversión

Inversión
Cuando existe y se puede acceder a un identificador único persistente de alta calidad (por ejemplo, un identificador nacional o un ORCID verificado), la reconciliación se reduce a un emparejamiento determinista; en cambio, la legislación, el hashing o una pseudonimización fuerte pueden impedir la reconciliación o exigir técnicas de enlace preservadoras de la privacidad.

Límite

Límite
Claramente dentro: enlazar registros de personas entre repositorios institucionales usando ORCID o identificadores multivariantes. Caso fronterizo: emparejar registros con nombres y fechas similares cuando convenciones culturales o fechas incompletas crean ambigüedad. Claramente fuera: reconocimiento de entidades dentro de texto (NER) sin enlace entre conjuntos de datos; o agrupamientos por similitud que no producen enlaces interconjuntos.

Tensión semántica

Tensión semántica
Privacidad ↔ Utilidad — el enlace aumenta el valor operativo y analítico pero incrementa los riesgos para la privacidad y requiere controles de gobernanza.

Síntesis

Síntesis
La reconciliación de entidades es un proceso guiado por evidencia cuya fiabilidad depende de la calidad de los identificadores, la riqueza de atributos y umbrales explícitos; por ello los sistemas prácticos combinan coincidencias deterministas, puntuación probabilística, revisión humana y registro de procedencia para equilibrar escala y precisión.