Définition
Une technique non supervisée qui regroupe des documents en clusters selon une mesure de similarité choisie de sorte que les éléments d’un même cluster se ressemblent davantage entre eux qu’avec ceux d’autres clusters, utilisée pour révéler des regroupements thématiques, soutenir la navigation ou résumer des collections.

Principe

Principe
L’appartenance à un cluster dépend du métrique de similarité et de la représentation choisie (p. ex. sac de mots, TF‑IDF, embeddings) ; le clustering révèle la structure présente sous ces choix méthodologiques plutôt que des catégories objectives, de sorte que l’algorithme et la définition de distance influencent substantiellement les résultats.

Démonstration

Démonstration
Scénario illustratif : un archive numérique calcule des embeddings de documents et applique un clustering agglomératif pour organiser un important lot de rapports. Les clusters obtenus sont inspectés et utilisés pour créer des facettes de navigation ; les conservateurs réétiquettent ou fusionnent des clusters lorsque ceux‑ci traduisent des distinctions de métadonnées plutôt qu’une cohérence thématique.

Mauvaise application

Mauvaise application
Prendre les clusters pour des catégories thématiques stables sans validation. Cette erreur paraît plausible car les clusters peuvent sembler cohérents ; l’erreur sémantique consiste à ignorer que différentes représentations ou mesures de distance produiront des regroupements différents, et que les clusters peuvent refléter des signaux stylistiques, temporels ou d’auteur plutôt que le sujet.

Conséquence

Conséquence
Le clustering facilite l’exploration, la découverte de regroupements émergents et la réduction du tri manuel. Mal appliqué, il peut masquer des sujets minoritaires, produire des résumés trompeurs ou biaiser la découverte en faveur des langues ou formats dominants du corpus.

Inversion

Inversion
Lorsque des vocabulaires contrôlés ou des règles d’indexation précises sont requis, la classification supervisée ou la curation humaine peut être nécessaire ; pour des corpus très petits, le clustering fournit des partitions instables et peu informatives.

Limite

Limite
Clairement dans la définition : regroupement non supervisé de vecteurs documentaires en clusters pour mettre en évidence des groupements destinés à la navigation. Cas limite : modèles de thèmes produisant des mixtions document–thème « soft » — liés mais génératifs et probabilistes plutôt que partitions dures. Clairement hors définition : notices de vedettes-matière créées manuellement par des catalogueurs.

Tension sémantique

Tension sémantique
Exploration et évolutivité (découverte algorithmique de groupes) versus reproductibilité et interprétabilité (dépendance à la représentation et aux paramètres) ; la découverte à grande échelle peut être en tension avec l’assignation thématique cohérente et responsable.

Synthèse

Synthèse
Le clustering documentaire est une lentille méthodologique — utile pour explorer et réduire l’effort manuel — mais ses sorties exigent validation et souvent interprétation humaine avant d’être utilisées comme regroupements thématiques faisant autorité.