Definición
Una regularidad empírica observada en grandes corpus de lenguaje natural en la que la frecuencia de una palabra es aproximadamente inversamente proporcional a su posición en una lista ordenada por frecuencia: f(r) ∝ 1/r para rangos comunes, con desviaciones sistemáticas en las colas. Es una observación sobre la distribución de tokens, no una ley teórica necesaria.

Principio

Principio
El lenguaje natural muestra una relación rango‑frecuencia con cola pesada: un número pequeño de palabras de alto rango explica una gran parte de los tokens, mientras que muchas palabras aparecen rara vez. Este patrón permite expectativas sobre compresión, indexación y crecimiento de vocabulario.

Demostración

Demostración
Escenario ilustrativo → Situación: Un corpus de un millón de tokens se ordena por frecuencia. Reconocimiento: el token más frecuente aparece ~50 000 veces; el rango 10 aparece ~5 000 veces (aprox. 1/10); el rango 100 ~500 (aprox. 1/100). Acción: Analistas usan el patrón para crear listas de stopwords y optimizar índices invertidos. Consecuencia: Estructuras de índice y compresión explotan la asimetría predecible para reducir almacenamiento y coste de recuperación.

Aplicación incorrecta

Aplicación incorrecta
Asumir un 1/r exacto para corpus pequeños o específicos del dominio, o aplicar la ley a recuentos de tipos (tamaño del vocabulario) sin corregir por tamaño muestral. El error semántico es tratar la aproximación empírica de Zipf como una ley generativa precisa y universal.

Consecuencia

Consecuencia
Orienta elecciones prácticas en recuperación de información (ponderación de términos, eliminación de stopwords), modelado del lenguaje y compresión de datos. Un uso indebido puede provocar eliminación excesiva de stopwords o modelado inadecuado de palabras raras.

Inversión

Inversión
Corpus especializados, muy flexionados o muy pequeños suelen desviarse del 1/r: la cabeza puede ser más plana (concentración de palabras funcionales) y la cola más pesada (muchos hapax). La tokenización, normalización morfológica o tipología lingüística alteran el exponente observado.

Límite

Límite
Claramente dentro: distribuciones de frecuencia de tokens en grandes corpus representativos de lenguaje natural. Caso límite: corpus técnicos donde la morfología y el vocabulario desplazan la curva rango‑frecuencia. Claramente fuera: conjuntos categóricos arbitrarios sin proceso generativo lingüístico.

Tensión semántica

Tensión semántica
Tensión entre parsimonia en el modelado (leyes aproximadas útiles como la de Zipf) y la necesidad de precisión descriptiva en los extremos del corpus y según idioma o preprocesamiento.

Síntesis

Síntesis
La Ley de Zipf es un descriptor empírico robusto de la asimetría de tokens lingüísticos que justifica optimizaciones prácticas, pero es una aproximación cuyo exponente y ajuste dependen del idioma, tamaño del corpus y decisiones de preprocesamiento.