Définition
Un processus d’apprentissage supervisé qui attribue une ou plusieurs étiquettes prédéfinies ou catégories de sujet à des textes ou notices bibliographiques en entraînant un modèle sur des exemples labellisés et en l’appliquant à des éléments non labellisés ; inclut variantes binaire, multiclasse, multilabel et hiérarchique.

Principe

Principe
Un classifieur apprend une fonction qui mappe des caractéristiques dérivées du texte vers des étiquettes en optimisant un objectif prédictif sur des données d’entraînement représentatives ; une application fiable dépend de la qualité des étiquettes, de la représentation des caractéristiques et de la similarité distributionnelle entre entraînement et déploiement.

Démonstration

Démonstration
Scénario illustratif : une bibliothèque entraîne un classifieur multiclasse sur des articles de presse labellisés pour attribuer des catégories (politique, économie, sports). Après validation sur des données tenues à l’écart, le modèle indexe automatiquement les articles entrants ; le personnel contrôle ponctuellement les cas ambigus et met à jour les données d’entraînement au fil de l’évolution des sujets.

Mauvaise application

Mauvaise application
Déployer un classifieur entraîné sur un corpus étroit et non représentatif et prendre une forte précision in‑sample pour une preuve de généralisation. L’erreur est de confondre la performance sur l’ensemble d’entraînement avec une validité robuste à l’échelle du domaine sans évaluation sur échantillons représentatifs et contemporains.

Conséquence

Conséquence
Bien entraînée et surveillée, la classification automatise l’indexation, améliore la recherche et le filtrage et permet des analyses à grande échelle. Mal appliquée, elle produit des erreurs systématiques d’étiquetage, renforce les biais présents dans les données d’entraînement et dégrade la découverte par les usagers ou la prise de décision en aval.

Inversion

Inversion
En l’absence de données labellisées fiables ou si les étiquettes sont contestées, le regroupement non supervisé, l’apprentissage actif ou des flux de travail avec intervention humaine peuvent être préférables ; en cas de dérive conceptuelle, les modèles doivent être réentraînés ou adaptés.

Limite

Limite
Clairement dans la définition : modèles supervisés entraînés sur corpus étiquetés et curationnés pour attribuer des sujets prédéfinis. Cas limite : approches semi‑supervisées ou faiblement supervisées combinant étiquettes limitées et grands corpus non labellisés. Clairement hors définition : regroupement purement non supervisé ou catalogage manuel sans modélisation prédictive.

Tension sémantique

Tension sémantique
Précision prédictive et automatisation versus transparence, interprétabilité et nécessité de données labellisées représentatives ; l’automatisation peut entrer en conflit avec les exigences de responsabilité et d’explicabilité.

Synthèse

Synthèse
La classification de textes concrétise des définitions subjectives curationnelles en systèmes prédictifs ; son efficacité dépend moins du choix d’algorithme que de la qualité des étiquettes, de la rigueur d’évaluation et de la surveillance continue des changements distributionnels.