Définition
Relation empirique observée dans les corpus textuels selon laquelle le nombre de types lexicaux distincts V(N) croît de manière sous‑linéaire avec le nombre total de tokens N, modélisée couramment par V(N) ≈ K · N^β avec 0 < β < 1 et un coefficient K dépendant de la langue et de la tokenisation. Elle caractérise la décroissance du taux de découverte de vocabulaire à mesure que le corpus s’agrandit.
Principe
Principe
Parce que les nouveaux tokens répètent de plus en plus des types déjà observés à mesure que le corpus s’étend, l’ajout de texte produit progressivement moins de nouveaux types ; il faut donc prévoir la taille du vocabulaire par un modèle de croissance sous‑linéaire plutôt que par une extrapolation linéaire.
Démonstration
Démonstration
Scénario illustratif → Lors de l’indexation d’un corpus d’articles, après 1 million de tokens l’indexeur observe 70 000 types distincts ; en doublant le nombre de tokens, la croissance des types est nettement inférieure au double, compatible avec V(N) ≈ K·N^β. Reconnaissance → On ajuste K et β pour estimer la taille du lexique et planifier le stockage et le stemming. Action → On affine la tokenisation et les listes de mots vides pour maîtriser la croissance de l’index. Conséquence → Les budgets d’indexation et de compression sont réalistes et la conception expérimentale tient compte de la diminution de la découverte lexicale marginale.
Mauvaise application
Mauvaise application
Supposer un β unique universel ou traiter la relation comme exacte quelle que soit la tokenisation. L’erreur consiste à ignorer que β et K varient selon la langue, le genre, la richesse morphologique, la normalisation et l’hétérogénéité du corpus.
Conséquence
Conséquence
Bien utilisée, la loi de Heaps guide la planification de capacité des index, les seuils de vocabulaire des systèmes de recherche et les prévisions d’effort d’annotation ; mal utilisée, elle conduit à un sur‑ ou sous‑dimensionnement si les paramètres du modèle ne sont pas estimés empiriquement pour le corpus et le pipeline de prétraitement considérés.
Inversion
Inversion
Dans des flux de tokens artificiels ou construits de façon adversariale (p. ex. nombreux identifiants uniques) ou dans des corpus à productivité morphologique extrême sans normalisation, β peut approcher 1 et la croissance du vocabulaire peut devenir quasi‑linéaire, rendant l’hypothèse de sous‑linéarité inapplicable.
Limite
Limite
Clairement dans : grands corpus de langue naturelle avec tokenisation standard et peu d’identifiants synthétiques. Cas frontière : langues agglutinantes sans normalisation morphologique où la croissance apparente des types est plus élevée. Claire hors : jeux de données composés principalement de chaînes uniques générées aléatoirement ou de clés de base de données.
Tension sémantique
Tension sémantique
Exhaustivité (capturer tous les types pour des fins lexicographiques) ↔ Praticité (contraintes d’indexation et de stockage nécessitant filtrage ou normalisation).
Synthèse
Synthèse
La loi de Heaps fournit une attente paramétrique sur la découverte lexicale qui doit être ajustée empiriquement et interprétée selon la tokenisation et la morphologie ; elle prédit des rendements décroissants sans décider de la pertinence des tokens pour les tâches ultérieures.