Definición
Relación empírica observada en corpus textuales según la cual el número de tipos léxicos distintos V(N) crece de modo sublineal con el número total de tokens N y suele modelarse como V(N) ≈ K · N^β con 0 < β < 1 y K dependiente de la lengua y la tokenización. Caracteriza la disminución en la tasa de aparición de vocabulario nuevo conforme el corpus aumenta.

Principio

Principio
Debido a que los tokens añadidos repiten cada vez más tipos ya observados conforme el corpus crece, la incorporación incremental de texto produce progresivamente menos tipos nuevos; por tanto, la predicción del tamaño del vocabulario requiere un modelo de crecimiento sublineal, no una extrapolación lineal.

Demostración

Demostración
Escenario ilustrativo → Al indexar una colección de noticias, tras procesar 1 millón de tokens se registran 70 000 tipos distintos; al duplicar los tokens, el crecimiento de tipos es notablemente menor que el doble, coherente con V(N) ≈ K·N^β. Reconocimiento → Se ajustan K y β para estimar el tamaño del vocabulario y planificar almacenamiento y stemming. Acción → Se afinan las reglas de tokenización y las listas de palabras vacías para controlar el crecimiento del índice. Consecuencia → Las previsiones de indexado y compresión son más realistas y los diseños experimentales consideran la menor tasa marginal de descubrimiento léxico.

Aplicación incorrecta

Aplicación incorrecta
Asumir un β universal o tratar la relación como exacta para cualquier tokenización. El error es ignorar que β y K varían con la lengua, el género textual, la riqueza morfológica, la normalización y la heterogeneidad del corpus.

Consecuencia

Consecuencia
Usada correctamente, guía la planificación de capacidad de índices, umbrales de vocabulario en sistemas de búsqueda y estimaciones de esfuerzo de anotación; mal usada, conduce a sobredimensionar o subdimensionar recursos si no se ajustan empíricamente los parámetros al corpus y al preprocesamiento.

Inversión

Inversión
En flujos de tokens generados artificialmente o construidos de forma adversarial (por ejemplo, muchos identificadores únicos) o en corpora con productividad morfológica extrema y sin normalización, β puede tender a 1 y el vocabulario crecer casi linealmente, por lo que la suposición de sublinealidad deja de aplicarse.

Límite

Límite
Claramente dentro: grandes corpus de lengua natural con tokenización estándar y pocos identificadores sintéticos. Caso límite: lenguas aglutinantes sin normalización morfológica donde el crecimiento aparente de tipos es mayor. Claramente fuera: conjuntos de datos compuestos mayoritariamente por cadenas únicas generadas aleatoriamente o claves de base de datos.

Tensión semántica

Tensión semántica
Exhaustividad (capturar todos los tipos para fines lexicográficos) ↔ Practicidad (límites de indexación y almacenamiento que requieren filtrado o normalización).

Síntesis

Síntesis
La ley de Heaps es una expectativa paramétrica sobre la aparición de vocabulario que debe ajustarse empíricamente y entenderse en relación con la tokenización y la morfología; predice rendimientos decrecientes pero no la relevancia de los tokens para tareas posteriores.