 ##  [Ley de Zipf](/es/node/72128) 

 Definición

Una regularidad empírica observada en grandes corpus de lenguaje natural en la que la frecuencia de una palabra es aproximadamente inversamente proporcional a su posición en una lista ordenada por frecuencia: f(r) ∝ 1/r para rangos comunes, con desviaciones sistemáticas en las colas. Es una observación sobre la distribución de tokens, no una ley teórica necesaria.

 

 

 

 

 

 





## Principio

Principio

El lenguaje natural muestra una relación rango‑frecuencia con cola pesada: un número pequeño de palabras de alto rango explica una gran parte de los tokens, mientras que muchas palabras aparecen rara vez. Este patrón permite expectativas sobre compresión, indexación y crecimiento de vocabulario.

 

 

 

 

 





## Demostración

Demostración

Escenario ilustrativo → Situación: Un corpus de un millón de tokens se ordena por frecuencia. Reconocimiento: el token más frecuente aparece ~50 000 veces; el rango 10 aparece ~5 000 veces (aprox. 1/10); el rango 100 ~500 (aprox. 1/100). Acción: Analistas usan el patrón para crear listas de stopwords y optimizar índices invertidos. Consecuencia: Estructuras de índice y compresión explotan la asimetría predecible para reducir almacenamiento y coste de recuperación.

 

 

 

 

## Aplicación incorrecta

Aplicación incorrecta

Asumir un 1/r exacto para corpus pequeños o específicos del dominio, o aplicar la ley a recuentos de tipos (tamaño del vocabulario) sin corregir por tamaño muestral. El error semántico es tratar la aproximación empírica de Zipf como una ley generativa precisa y universal.

 

 

 

 

 





## Consecuencia

Consecuencia

Orienta elecciones prácticas en recuperación de información (ponderación de términos, eliminación de stopwords), modelado del lenguaje y compresión de datos. Un uso indebido puede provocar eliminación excesiva de stopwords o modelado inadecuado de palabras raras.

 

 

 

 

## Inversión

Inversión

Corpus especializados, muy flexionados o muy pequeños suelen desviarse del 1/r: la cabeza puede ser más plana (concentración de palabras funcionales) y la cola más pesada (muchos hapax). La tokenización, normalización morfológica o tipología lingüística alteran el exponente observado.

 

 

 

 

 





## Límite

Límite

Claramente dentro: distribuciones de frecuencia de tokens en grandes corpus representativos de lenguaje natural. Caso límite: corpus técnicos donde la morfología y el vocabulario desplazan la curva rango‑frecuencia. Claramente fuera: conjuntos categóricos arbitrarios sin proceso generativo lingüístico.

 

 

 

 

 





## Tensión semántica

Tensión semántica

Tensión entre parsimonia en el modelado (leyes aproximadas útiles como la de Zipf) y la necesidad de precisión descriptiva en los extremos del corpus y según idioma o preprocesamiento.

 

 

 

 

 





## Síntesis

Síntesis

La Ley de Zipf es un descriptor empírico robusto de la asimetría de tokens lingüísticos que justifica optimizaciones prácticas, pero es una aproximación cuyo exponente y ajuste dependen del idioma, tamaño del corpus y decisiones de preprocesamiento.