Définition
Approche de recherche qui représente chaque document par une distribution de probabilité sur les termes (un modèle de langage) et classe les documents selon la probabilité que le modèle ait généré la requête, typiquement P(requête | modèle_du_document), avec un lissage pour gérer les termes non observés.

Principe

Principe
Classer par la probabilité que la requête observée soit produite par le modèle de chaque document ; le lissage compense entre l'évidence du document et les statistiques de la collection pour éviter des vraisemblances nulles.

Démonstration

Démonstration
Scénario illustratif → Requête courte de deux termes. Reconnaissance → Construire une distribution de termes lissée pour chaque document. Action → Calculer P(requête | modèle_du_document) comme produit ou somme logarithmique des probabilités de termes et classer. Conséquence → Les documents qui 'génèrent' mieux la requête remontent, à condition que le lissage empêche l'annulation pour les mots non vus.

Mauvaise application

Mauvaise application
Supposer que les scores de vraisemblance de requête sont égaux à P(pertinent | document). L'erreur paraît plausible car les deux sont formulations probabilistes ; l'erreur est de ne pas distinguer une vraisemblance générative (à quel point un document explique la requête) d'une probabilité a posteriori de pertinence.

Conséquence

Conséquence
Offre une interprétation générative cohérente, permet un lissage et l'incorporation de priors au niveau de la collection, et constitue souvent une ligne de base performante ; la qualité dépend du lissage et de la capacité du modèle de génération de termes à capturer des signaux de pertinence au-delà du chevauchement lexical.

Inversion

Inversion
Lorsque la pertinence dépend de structures non capturées par la génération de termes (syntaxe, sémantique, discours) ou pour des requêtes longues et intentions complexes, le classement par vraisemblance peut être inadapté ; des méthodes discriminantes ou neurales peuvent alors améliorer les résultats.

Limite

Limite
Clairement dans : scoring 'document comme générateur' par P(requête | modèle_document) avec lissage explicite. Cas limite : utiliser la divergence KL entre modèles de requête et de document, équivalente au classement par vraisemblance sous certaines hypothèses. Clairement hors : pondération TF–IDF pure sans interprétation générative.

Tension sémantique

Tension sémantique
Tension entre approches génératives (P(requête|document)) et discriminantes (modélisation directe de P(pertinent|caractéristiques)) ; chacune présente des compromis en interprétabilité et optimisation empirique.

Synthèse

Synthèse
Prendre le document comme générateur clarifie l'usage du lissage et des priors de collection ; néanmoins, le succès dépend de l'adéquation du modèle de génération de termes à la notion de pertinence recherchée par l'utilisateur.