Définition
Une métrique de classement sensible à la position qui additionne les gains de pertinence graduée selon les positions en appliquant un facteur d'actualisation logarithmique (classiquement 1 / log2(rang+1)), produisant le DCG (Discounted Cumulative Gain), puis normalise le DCG par le DCG idéal (IDCG) de la requête pour obtenir nDCG dans [0,1]. Elle prend en charge des jugements de pertinence à plusieurs niveaux.
Principe
Principe
nDCG équilibre pertinence graduée et atténuation par la position : les documents de plus forte pertinence contribuent davantage au gain, mais ces contributions sont réduites par une actualisation monotone reflétant la décroissance de l'attention utilisateur ; la normalisation permet de comparer des requêtes aux gains idéaux différents.
Démonstration
Démonstration
Scénario illustratif → Degrés de pertinence pour les 3 premiers résultats : 3, 2, 1. DCG = 3 + 2 / log2(3) + 1 / log2(4) ≈ 3 + 2/1,585 + 1/2 ≈ 4,762. IDCG (classement idéal pour ces degrés) est identique ici, donc nDCG ≈ 1,0. Si l'ordre était 2,3,1, le DCG chuterait et nDCG < 1.
Mauvaise application
Mauvaise application
Utiliser le DCG sans normalisation pour des requêtes ayant des nombres ou distributions de documents pertinents différents, ou appliquer nDCG sans faire correspondre la fonction de gain à l'utilité utilisateur (par exemple, traiter une pertinence binaire comme graduée sans justification). De même, supposer que la décroissance logarithmique est la seule valable est incorrecte — l'actualisation reflète un modèle d'attention et peut être adapté.
Conséquence
Conséquence
nDCG encourage à placer tôt les documents de pertinence graduée élevée, reflétant les différences de valeur pour l'utilisateur ; la normalisation permet des comparaisons plus équitables entre requêtes hétérogènes.
Inversion
Inversion
Si les jugements de pertinence sont binaires et que l'évaluation porte sur le premier résultat pertinent uniquement, des métriques plus simples (MRR) peuvent être préférables ; si l'utilité utilisateur ne décroît pas comme supposé par la fonction d'actualisation choisie, celle‑ci peut mal représenter l'efficacité.
Limite
Limite
Clairement dans : évaluations à pertinence graduée et nombre/qualité de pertinents variables où la position et le degré importent. Cas limite : coupures très courtes où la normalisation dépend d'éléments non jugés. Clairement hors : tâches où seule compte la présence d'un résultat pertinent ou objectifs dominés par diversité/nouveauté.
Tension sémantique
Tension sémantique
Pertinence graduée ↔ Métriques binaires — nDCG impose un arbitrage entre magnitude de la pertinence et position, ce qui peut entrer en conflit avec métriques traitant la pertinence comme binaire ou favorisant une unique meilleure réponse.
Synthèse
Synthèse
nDCG est la méthode standard pour évaluer des listes classées quand la pertinence est graduée et que la position importe : elle explicite la valeur d'un résultat et la décroissance d'attention, tandis que la normalisation autorise la comparaison entre requêtes hétérogènes.