Definición
Método de reducción de dimensionalidad que descubre asociaciones latentes término–documento al factorizar una matriz de coocurrencia término–documento (habitualmente mediante SVD truncada) para producir un espacio vectorial de menor dimensión donde términos y documentos relacionados semánticamente están más próximos.

Principio

Principio
LSA aproxima la estructura de coocurrencia de alta dimensión mediante un conjunto reducido de componentes ortogonales que capturan patrones de correlación dominantes; esta aproximación algebraica enfatiza patrones de uso compartido (sinonimia) y puede reducir la dispersión y el ruido.

Demostración

Demostración
Escenario ilustrativo → Reconocimiento: un corpus contiene documentos que usan sinónimos distintos para un mismo concepto. → Acción: construir la matriz término–documento, calcular la SVD truncada y proyectar documentos y términos en vectores latentes de dimensión k. → Consecuencia: los documentos que usan distintos términos superficiales para el mismo concepto aparecen próximos en el espacio latente, mejorando la recuperación frente a la sinonimia sin necesitar un tesauro explícito.

Aplicación incorrecta

Aplicación incorrecta
Interpretación errónea: leer cada dimensión LSA como un topic interpretable o como una distribución probabilística. Error semántico: las dimensiones LSA son componentes de álgebra lineal (vectores de base ortogonales), no distribuciones generativas; tratarlas como tópicos probabilísticos conduce a interpretaciones equivocadas.

Consecuencia

Consecuencia
LSA ofrece representaciones compactas que aumentan la robustez ante la variación léxica y reducen la dimensionalidad para modelos posteriores; sin embargo, una truncación excesiva puede fusionar conceptos distintos y reducir la capacidad discriminativa.

Inversión

Inversión
Calificación: para datos textuales basados en recuentos, muy sesgados o generativos discretos, modelos de topics probabilísticos (pLSA, LDA) o factorizaciones no negativas pueden ajustarse mejor a las suposiciones; la aproximación lineal de LSA es menos adecuada para estructuras semánticas no lineales o muy dispersas.

Límite

Límite
Claramente dentro: métodos que usan truncamiento por SVD de una matriz término–documento para formar un espacio vectorial latente. Caso límite: esquemas de ponderación (TF‑IDF, log‑entropy) aplicados antes de la SVD afectan los resultados y difuminan los límites del método. Claramente fuera: modelos de topics probabilísticos explícitos que definen un proceso de generación de documentos.

Tensión semántica

Tensión semántica
Tensión entre compacidad/reducción de ruido e interpretabilidad: reducir la dimensión al máximo produce representaciones compactas y descontaminadas pero puede ocultar ejes semánticos legibles por humanos.

Síntesis

Síntesis
LSA es una herramienta algebraica: sacrifica la interpretabilidad directa por una geometría latente compacta que captura la estructura de coocurrencia; entenderla como la mejor aproximación lineal aclara sus ventajas (manejo de sinonimia, reducción de ruido) y sus límites (ausencia de semántica generativa).