Definición
Método de reducción de dimensionalidad que descubre asociaciones latentes término–documento al factorizar una matriz de coocurrencia término–documento (habitualmente mediante SVD truncada) para producir un espacio vectorial de menor dimensión donde términos y documentos relacionados semánticamente están más próximos.
Principio
Principio
LSA aproxima la estructura de coocurrencia de alta dimensión mediante un conjunto reducido de componentes ortogonales que capturan patrones de correlación dominantes; esta aproximación algebraica enfatiza patrones de uso compartido (sinonimia) y puede reducir la dispersión y el ruido.
Demostración
Demostración
Escenario ilustrativo → Reconocimiento: un corpus contiene documentos que usan sinónimos distintos para un mismo concepto. → Acción: construir la matriz término–documento, calcular la SVD truncada y proyectar documentos y términos en vectores latentes de dimensión k. → Consecuencia: los documentos que usan distintos términos superficiales para el mismo concepto aparecen próximos en el espacio latente, mejorando la recuperación frente a la sinonimia sin necesitar un tesauro explícito.
Aplicación incorrecta
Aplicación incorrecta
Interpretación errónea: leer cada dimensión LSA como un topic interpretable o como una distribución probabilística. Error semántico: las dimensiones LSA son componentes de álgebra lineal (vectores de base ortogonales), no distribuciones generativas; tratarlas como tópicos probabilísticos conduce a interpretaciones equivocadas.
Consecuencia
Consecuencia
LSA ofrece representaciones compactas que aumentan la robustez ante la variación léxica y reducen la dimensionalidad para modelos posteriores; sin embargo, una truncación excesiva puede fusionar conceptos distintos y reducir la capacidad discriminativa.
Inversión
Inversión
Calificación: para datos textuales basados en recuentos, muy sesgados o generativos discretos, modelos de topics probabilísticos (pLSA, LDA) o factorizaciones no negativas pueden ajustarse mejor a las suposiciones; la aproximación lineal de LSA es menos adecuada para estructuras semánticas no lineales o muy dispersas.
Límite
Límite
Claramente dentro: métodos que usan truncamiento por SVD de una matriz término–documento para formar un espacio vectorial latente. Caso límite: esquemas de ponderación (TF‑IDF, log‑entropy) aplicados antes de la SVD afectan los resultados y difuminan los límites del método. Claramente fuera: modelos de topics probabilísticos explícitos que definen un proceso de generación de documentos.
Tensión semántica
Tensión semántica
Tensión entre compacidad/reducción de ruido e interpretabilidad: reducir la dimensión al máximo produce representaciones compactas y descontaminadas pero puede ocultar ejes semánticos legibles por humanos.
Síntesis
Síntesis
LSA es una herramienta algebraica: sacrifica la interpretabilidad directa por una geometría latente compacta que captura la estructura de coocurrencia; entenderla como la mejor aproximación lineal aclara sus ventajas (manejo de sinonimia, reducción de ruido) y sus límites (ausencia de semántica generativa).