Definición
Enfoque de recuperación que representa cada documento como una distribución de probabilidad sobre términos (un modelo de lenguaje) y ordena documentos por la probabilidad de que el modelo generase la consulta, normalmente P(consulta | modelo_del_documento), con liso (smoothing) para tratar términos no vistos.

Principio

Principio
Ordenar documentos por cuán probable es que la consulta observada fuera generada por el modelo de cada documento; el liso compensa la evidencia del documento con estadísticas de la colección para evitar probabilidades cero.

Demostración

Demostración
Escenario ilustrativo → Consulta corta de dos términos. Reconocimiento → Construir una distribución de términos suavizada para cada documento. Acción → Calcular P(consulta | modelo_del_documento) como producto o suma logarítmica de probabilidades por término y ordenar. Consecuencia → Los documentos que mejor 'generan' la consulta ascienden, siempre que el liso evite anularse por palabras no vistas.

Aplicación incorrecta

Aplicación incorrecta
Suponer que las puntuaciones de probabilidad de la consulta equivalen a P(relevante | documento). El error es plausible porque ambas son formulaciones probabilísticas; la equivocación es no distinguir una verosimilitud generativa (qué bien explica un documento la consulta) de una probabilidad posterior de relevancia.

Consecuencia

Consecuencia
Ofrece una interpretación generativa coherente, posibilita liso y la inclusión de priors de colección, y suele ser una línea base competitiva; la calidad de la recuperación depende de la elección del liso y de hasta qué punto el modelo de generación de términos captura señales de relevancia más allá del solapamiento léxico.

Inversión

Inversión
Cuando la relevancia depende de patrones no capturados por la generación de términos (frases, semántica, discurso) o en consultas largas con intenciones complejas, el orden por verosimilitud puede fallar; métodos discriminativos o neuronales que modelan la relevancia directamente pueden mejorar los resultados.

Límite

Límite
Claramente dentro: puntuación 'documento como generador' por P(consulta | modelo_documento) con liso explícito. Caso límite: usar divergencia KL entre modelos de consulta y documento, equivalente a verosimilitud bajo ciertas suposiciones. Claramente fuera: puntuación TF–IDF pura sin interpretación generativa.

Tensión semántica

Tensión semántica
Tensión entre perspectivas generativas (P(consulta|documento)) y discriminativas (modelar directamente P(relevante|características)); cada una con distintos compromisos en interpretabilidad y optimización empírica.

Síntesis

Síntesis
Tratar los documentos como generadores clarifica liso y priors de colección; no obstante, el éxito depende de si la generación de términos captura adecuadamente la noción de relevancia para la necesidad informativa del usuario.