Definición
Métodos y procesos para distinguir y enlazar correctamente entidades reales distintas (habitualmente personas, organizaciones u obras) que comparten nombres idénticos o similares en distintos conjuntos de datos, usando atributos contextuales, identificadores persistentes, agrupamiento y emparejamientos basados en reglas o probabilísticos para evitar fusiones o divisiones erróneas.
Principio
Principio
La desambiguación asigna registros a identidades de entidad combinando identificadores únicos (cuando existen), atributos contextuales (afiliación, fecha, co‑ocurrencia) y algoritmos de similitud o clustering; debe registrarse la confianza y la procedencia de cada resolución.
Demostración
Demostración
Escenario ilustrativo → Un índice académico contiene publicaciones firmadas por 'J. Smith'. Reconocimiento → el sistema agrupa registros por coautores, afiliaciones, revistas y años, y detecta dos clusters coherentes con dos investigadores distintos. Acción → el sistema asigna registros a dos identificadores de autor (p. ej. AuthorID#1, AuthorID#2) y registra evidencias y nivel de confianza. Consecuencia → los perfiles de autor, los recuentos de citas y los resultados de búsqueda reflejan personas distintas en lugar de una identidad fusionada.
Aplicación incorrecta
Aplicación incorrecta
Confiar únicamente en similitud de cadenas o heurísticas superficiales (p. ej. mismo nombre = misma persona) conduce a fusiones erróneas; por el contrario, reglas excesivamente estrictas (exigir coincidencia exacta de identificador) producen divisiones erróneas y enlaces perdidos.
Consecuencia
Consecuencia
La desambiguación precisa mejora la atribución, la precisión en recuperación y las métricas; los errores se propagan a servicios derivados (perfiles, métricas, recomendaciones), causando atribuciones erróneas, análisis engañosos y pérdida de confianza del usuario.
Inversión
Inversión
La desambiguación puede ser inviable o estar legalmente restringida cuando faltan atributos contextuales, se suprimen por privacidad o las entidades ocultan intencionadamente su identidad (seudónimos); en tales casos conviene indicar procedencia, etiquetas de incertidumbre o negarse a resolver.
Límite
Límite
Claramente dentro: resolución de identidad de personas u organizaciones entre conjuntos bibliográficos o administrativos usando atributos y algoritmos. Caso límite: distinguir obras con idénticos títulos (requiere metadatos bibliográficos más que desambiguación de nombre). Claramente fuera: simple normalización (minúsculas, eliminación de diacríticos) que no realiza resolución de identidad.
Tensión semántica
Tensión semántica
Precisión frente a recall/privacidad — el enlace agresivo aumenta recall pero eleva el riesgo de fusiones falsas y vulneraciones de privacidad; el enlace conservador reduce falsos positivos pero no unifica duplicados legítimos.
Síntesis
Síntesis
La desambiguación de nombres convierte la resolución de identidad en un proceso probabilístico basado en evidencias, que debe registrar confianza y procedencia; los identificadores persistentes, cuando están disponibles, reducen la ambigüedad y son el mecanismo de resolución preferible.