Definición
Principio estadístico que selecciona valores de parámetros (o hipótesis) que maximizan la función de verosimilitud — la probabilidad (o densidad) de los datos observados dada la ley paramétrica — es decir, θ̂ = argmax_θ L(θ; datos). Requiere un modelo probabilístico explícito y trata la verosimilitud como función objetivo para estimación puntual.

Principio

Principio
Dado un modelo paramétrico especificado, se elige el valor del parámetro que hace que los datos observados sean más probables según ese modelo; bajo condiciones de regularidad y con muestras grandes, los estimadores de máxima verosimilitud son consistentes y asintóticamente eficientes, pero estas propiedades dependen de la corrección del modelo y de supuestos técnicos.

Demostración

Demostración
Escenario ilustrativo: observaciones x1,...,xn iid gaussianas con media desconocida μ y varianza conocida σ^2. La verosimilitud se maximiza en μ̂ = (1/n)∑xi, por lo que la media muestral es el estimador de máxima verosimilitud para μ; el cálculo se obtiene diferenciando la log‑verosimilitud.

Aplicación incorrecta

Aplicación incorrecta
Interpretar el máximo de verosimilitud como la probabilidad de que un valor de parámetro sea verdadero (confundir verosimilitud con probabilidad a posteriori) o considerar el estimador ML fiable independientemente de la mala especificación del modelo o del tamaño muestral pequeño son errores comunes; el fallo semántico es confundir plausibilidad condicionada al modelo con probabilidad absoluta del parámetro.

Consecuencia

Consecuencia
ML produce estimadores puntuales que frecuentemente tienen buenas propiedades en grandes muestras y fundamenta pruebas e intervalos de confianza (mediante la información de Fisher), pero los estimadores pueden estar sesgados, tener gran varianza, ser multimodales o indefinidos bajo mala especificación del modelo o muestras finitas, y requieren optimización numérica en modelos complejos.

Inversión

Inversión
Cuando los modelos están mal especificados, los parámetros no son identificables, los datos son escasos o la verosimilitud es plana/multimodal, ML puede rendir mal; en tales casos, los estimadores regularizados, penalizados o bayesianos (incorporando priors o restricciones) suelen ser preferibles.

Límite

Límite
Se aplica a problemas inferenciales con una verosimilitud paramétrica bien definida y parámetros identificables; no provee por sí mismo declaraciones de intervalo sobre la incertidumbre del parámetro sin aproximaciones asintóticas o un marco bayesiano, y no es aplicable cuando no se puede definir una verosimilitud.

Tensión semántica

Tensión semántica
Inferencia basada en la verosimilitud ↔ Inferencia bayesiana: ML usa solo la verosimilitud condicionada a los datos y proporciona estimaciones puntuales, mientras que los métodos bayesianos combinan verosimilitud con información a priori para obtener declaraciones probabilísticas completas — la elección depende de si se requiere información a priori y representación coherente de incertidumbre.

Síntesis

Síntesis
La máxima verosimilitud elige parámetros que hacen que los datos observados sean más plausibles bajo un modelo — es una optimización guiada por los datos cuya fiabilidad depende de la corrección del modelo, la identificabilidad y el tamaño muestral; es una herramienta fundamental pero dependiente del modelo, no una medida absoluta de verdad.