Définition
Méthodes et processus pour distinguer et relier correctement des entités réelles distinctes (souvent personnes, organisations ou œuvres) qui partagent des noms identiques ou similaires dans plusieurs jeux de données, en utilisant attributs contextuels, identifiants persistants, regroupements et appariements fondés sur règles ou probabilistes afin d'éviter des fusions ou divisions erronées.
Principe
Principe
La désambiguïsation affecte des enregistrements à des identités d'entité en combinant identifiants uniques (si disponibles), attributs contextuels (affiliation, date, cooccurrence) et algorithmes de similarité ou de clustering ; la confiance et la provenance doivent être consignées pour chaque résolution.
Démonstration
Démonstration
Scénario illustratif → Un index scientifique contient des publications signées 'J. Smith'. Reconnaissance → le système groupe les notices par coauteurs, affiliations, revues et années, et identifie deux amas cohérents avec deux chercheurs distincts. Action → le système assigne les notices à deux identifiants d'auteur (p. ex. AuthorID#1, AuthorID#2) et enregistre preuves et niveau de confiance. Conséquence → profils d'auteur, comptages de citations et résultats de recherche reflètent des personnes distinctes plutôt qu'une identité confondue.
Mauvaise application
Mauvaise application
Se fier uniquement à la similarité de chaîne ou à des heuristiques superficielles (p. ex. nom identique = même personne) conduit à des fusions erronées ; inversement, des règles trop strictes (exiger une correspondance d'identifiant exacte) entraînent des divisions erronées et des rapprochements manqués.
Conséquence
Conséquence
Une désambiguïsation précise améliore l'attribution, la précision de la recherche et les métriques ; les erreurs se propagent dans les services dérivés (profils, métriques, recommandations), provoquant des fautes d'attribution, des analyses trompeuses et une perte de confiance des utilisateurs.
Inversion
Inversion
La désambiguïsation peut être impossible ou légalement restreinte lorsque les attributs contextuels font défaut, sont supprimés pour des raisons de confidentialité, ou quand les entités dissimulent volontairement leur identité (pseudonymes) ; dans ces cas, il convient d'indiquer la provenance, les incertitudes ou de refuser la résolution.
Limite
Limite
Clairement inclus : résolution d'identité de personnes ou d'organisations entre jeux bibliographiques ou administratifs en s'appuyant sur attributs et algorithmes. Cas limite : distinguer des œuvres portant le même titre (requiert métadonnées bibliographiques plutôt que désambiguïsation de nom). Clairement exclu : simple normalisation (mise en minuscules, suppression de diacritiques) qui n'effectue pas de résolution d'identité.
Tension sémantique
Tension sémantique
Précision vs rappel/confidentialité — un rapprochement agressif augmente le rappel mais risque des fusions erronées et des atteintes à la vie privée ; un rapprochement conservateur réduit les faux positifs mais n'unifie pas des doublons légitimes.
Synthèse
Synthèse
La désambiguïsation de noms traite la résolution d'identité comme un processus probabiliste fondé sur des preuves, devant enregistrer confiance et provenance ; les identifiants persistants, lorsqu'ils existent, réduisent l'ambiguïté et constituent le mécanisme de résolution privilégié.