Definición
Un modelo formal de recuperación de información que representa documentos y consultas como vectores en un espacio de términos compartido (típicamente bolsa de términos), donde medidas de similitud entre vectores (p. ej. similitud coseno) producen resultados ordenados según el solapamiento ponderado de términos.

Principio

Principio
Mapear textos a vectores numéricos y aplicar una métrica de similitud convierte el solapamiento léxico (con ponderación y normalización de términos) en una puntuación ordinal de relevancia; los esquemas de ponderación (TF, TF‑IDF, etc.) y la normalización determinan la influencia de términos comunes frente a distintivos.

Demostración

Demostración
Escenario ilustrativo: se construyen dos vectores documento y un vector consulta con pesos de término; al calcular la similitud coseno los documentos se ordenan de modo que el que comparte más y mejor ponderados términos con la consulta aparece primero, guiando una página de resultados ordenados.

Aplicación incorrecta

Aplicación incorrecta
Considerar el VSM como un modelo semántico o probabilístico de relevancia (por ejemplo, asumir que captura sinonimia o la intención del documento sin modelado adicional) es un error; el VSM es una abstracción geométrica basada en ocurrencia de términos y pesos, no en equivalencia semántica profunda.

Consecuencia

Consecuencia
El VSM produce rankings graduados y eficientes que permiten coincidencias parciales y puntuación de relevancia, habilitando búsquedas escalables; es sensible a desfases de vocabulario e ignora el orden de las palabras y las relaciones sintácticas salvo que se complemente con características o embeddings.

Inversión

Inversión
Cuando la coocurrencia de términos, la semántica o el significado contextual son centrales (consultas cortas, polisemia, contenido multilingüe), los embeddings distribucionales, LSI o modelos neuronales de ranking pueden ofrecer mejor emparejamiento al captar similitud semántica más allá del solapamiento superficial de términos.

Límite

Límite
Claramente dentro: vectorizaciones bolsa‑de‑palabras con pesos explícitos de término y similitud coseno/producto punto que generan una lista ordenada. Caso límite: representaciones vectoriales derivadas de embeddings que sustituyen pesos léxicos por características densas aprendidas. Claramente fuera: modelos booleanos de coincidencia exacta que devuelven conjuntos no ordenados.

Tensión semántica

Tensión semántica
Interpretabilidad ↔ Expresividad — la ponderación lineal y interpretable del VSM permite decisiones de ranking transparentes, mientras que representaciones más ricas (embeddings densos) ofrecen mayor expresividad semántica a costa de interpretabilidad directa.

Síntesis

Síntesis
El modelo de espacio vectorial intercambia estructura lingüística por álgebra lineal: al representar textos como vectores ponderados permite recuperación ordenada, escalable e interpretable basada en solapamiento de términos, pero sigue siendo vulnerable a limitaciones de vocabulario y estructura salvo que se amplíe.