Définition
Méthode de réduction de dimension qui révèle des associations terme–document latentes en factorisant une matrice de co‑occurrence terme–document (classiquement via une SVD tronquée) pour produire un espace vectoriel de plus faible dimension où termes et documents sémantiquement proches sont rapprochés.
Principe
Principe
LSA approxime la structure de co‑occurrence à haute dimension par un nombre réduit de composantes orthogonales capturant les schémas de corrélation dominants ; cette approximation algébrique met en évidence les usages partagés (synonymie) et peut réduire la parcimonie et le bruit.
Démonstration
Démonstration
Scénario illustratif → Reconnaissance : un corpus contient des documents utilisant des synonymes différents pour un concept. → Action : construire la matrice terme–document, calculer la SVD tronquée et projeter termes et documents dans un espace latent de dimension k. → Conséquence : des documents utilisant des formes de surface différentes pour le même concept se rapprochent dans l'espace latent, améliorant la recherche sans recours à un thésaurus explicite.
Mauvaise application
Mauvaise application
Interprétation erronée : considérer chaque dimension LSA comme un « sujet » interprétable ou comme une distribution probabiliste. Erreur sémantique : les dimensions LSA sont des composantes d'algèbre linéaire (vecteurs de base orthogonaux), pas des distributions génératives ; les traiter comme des topics probabilistes induit des erreurs d'interprétation.
Conséquence
Conséquence
LSA fournit des représentations compactes qui renforcent la robustesse face à la variation lexicale et réduisent la dimension pour des modèles en aval ; toutefois, une troncation excessive peut fusionner des concepts distincts et diminuer le pouvoir discriminant.
Inversion
Inversion
Qualification : pour des données textuelles basées sur des comptes, très biaisées ou générationnelles discrètes, des modèles de topics probabilistes (pLSA, LDA) ou des factorisations non négatives peuvent mieux correspondre aux hypothèses ; l'approximation linéaire de LSA est moins adaptée aux structures sémantiques non linéaires ou très creuses.
Limite
Limite
Clairement inclus : méthodes utilisant la troncation SVD d'une matrice terme–document pour former un espace vectoriel latent. Cas limite : les schémas de pondération (TF‑IDF, log‑entropy) appliqués avant la SVD modifient les résultats et brouillent les limites méthodologiques. Clair‑hors : modèles de topics probabilistes définissant un processus de génération de documents.
Tension sémantique
Tension sémantique
Tension entre compacité/réduction du bruit et interprétabilité : réduire fortement la dimension donne des représentations compactes et débruitées mais peut effacer des axes sémantiques lisibles par l'humain.
Synthèse
Synthèse
LSA est un outil algébrique : il échange l'interprétabilité directe contre une géométrie latente compacte qui capture la structure de co‑occurrence ; la voir comme la meilleure approximation linéaire éclaire ses forces (gestion de la synonymie, réduction du bruit) et ses limites (absence de sémantiques génératives).