
Reducción de Dimensionalidad: LSA + t‑SNE
El algoritmo que entiende significados… y el que dibuja mundos ocultos
Cómo comprimir textos en conceptos y cómo convertir datos imposibles en mapas que parecen magia.
Hasta ahora hemos conocido a dos personajes con caracteres muy distintos. PCA, que aplana el universo buscando dónde varían más los datos. Y LDA, que separa universos buscando las fronteras entre clases. Dos filosofías, dos formas de mirar una nube de puntos.
Pero hay un tipo de dato que se resiste a ambos, que no se deja domar ni por la variación ni por las fronteras: el texto.
Y es que un texto no es una nube de puntos cualquiera. Un texto tiene significado. Tiene contexto. Tiene relaciones entre unas palabras y otras que ningún número, por sí solo, captura. Cuando lo convertimos en cifras (bolsa de palabras, TF‑IDF, embeddings…), nos encontramos de golpe con vectores monstruosos: 10.000, 20.000, 50.000 dimensiones. Demasiado ruido. Demasiado espacio vacío. Y desde luego, imposible de visualizar.
Aquí entran nuestros dos protagonistas de hoy, y lo bonito es que no compiten: se complementan.
- LSA reduce dimensiones entendiendo el significado.
- t‑SNE visualiza datos complejos dibujando mapas que parecen magia.
Uno comprime. El otro revela. Juntos forman un dúo casi perfecto para trabajar con lenguaje.

LSA — Latent Semantic Analysis
El algoritmo que descubre conceptos escondidos entre miles de palabras
LSA nació para resolver un problema que, una vez lo ves, ya no puedes dejar de ver:
Los textos tienen demasiadas palabras, pero muy pocos conceptos.
Piénsalo. Que tu vocabulario tenga 50.000 palabras posibles no significa que un documento contenga 50.000 ideas. Quizá tiene tres: economía, política y energía. O dos: viajes y gastronomía. O una sola: deporte. Las palabras son muchas; las ideas de fondo, poquísimas.
LSA se propone precisamente eso: encontrar esos pocos conceptos ocultos bajo la avalancha de palabras.
¿Cómo lo hace?
LSA toma tu matriz de documentos y palabras (por ejemplo, una matriz TF‑IDF) y aplica una vieja conocida: SVD. Sí, la misma descomposición que ya vimos por dentro de PCA.
La maquinaria es idéntica, pero aquí la lectura cambia por completo:
- U → tus documentos, representados ahora en un espacio de conceptos.
- Σ → la importancia de cada concepto (cuánto pesa en el conjunto).
- V → tus palabras, colocadas en esos mismos conceptos.
Y esa nueva representación te permite decir cosas que antes eran impensables:
- «Este documento habla un 70% de política y un 30% de economía.»
- «Esta palabra está fuertemente asociada al concepto de tecnología.»
- «Estos dos textos se parecen porque comparten los mismos conceptos latentes, aunque no usen las mismas palabras.»
Ese último punto es la joya. LSA no entiende el significado como lo entiende un humano, pero descubre patrones semánticos lo bastante buenos como para saber que «coche» y «automóvil» viven cerca, aunque no se escriban igual.
¿Por qué funciona?
Porque las palabras no aparecen al azar. Aparecen en compañía. Si un documento habla de fútbol, tarde o temprano asomarán gol, estadio, delantero, árbitro y liga. Si habla de cocina, aparecerán receta, horno, ingredientes, sabor y chef.
LSA detecta esas co‑ocurrencias (qué palabras suelen aparecer juntas) y las agrupa en conceptos latentes. No lee: cuenta compañías. Y resulta que contar compañías, a gran escala, se parece muchísimo a entender de qué va un texto.
¿Para qué sirve LSA?
Su terreno es todo lo que tenga que ver con organizar lenguaje. Sirve para agrupar documentos por temas, para buscar textos similares, para mejorar motores de búsqueda (encontrando resultados relevantes aunque no contengan la palabra exacta), y como paso previo antes de un clustering, porque entrega representaciones semánticas compactas en lugar de vectores gigantes y ruidosos.
En una sola frase:
LSA es PCA aplicado al lenguaje.
t‑SNE — t‑Distributed Stochastic Neighbor Embedding
El algoritmo que dibuja mundos ocultos en 2D
Si LSA comprime textos en conceptos, t‑SNE persigue algo completamente distinto y, en cierto modo, más artístico:
t‑SNE crea mapas visuales donde lo parecido queda junto y lo distinto queda lejos.
Es un algoritmo de visualización no lineal, y conviene tener claro lo que no hace, porque ahí está su personalidad. No intenta explicar la variación, como PCA. No intenta separar clases, como LDA. No busca conceptos, como LSA. t‑SNE persigue algo mucho más humano, casi intuitivo:
Preservar la vecindad de los datos.
Si dos puntos son parecidos en 300 dimensiones, t‑SNE los coloca juntos en el plano. Si son distintos, los aleja. Nada más. Y de esa regla tan simple emerge algo asombroso.
La intuición
Imagina 10.000 documentos representados en 300 dimensiones (venidos de LSA, de embeddings, de lo que sea). Visualizar eso es, literalmente, imposible para un cerebro humano.
t‑SNE hace algo elegante en tres tiempos:
- Mira quién es vecino de quién en el espacio original de 300 dimensiones.
- Reparte los puntos en un plano de 2D intentando respetar esas vecindades.
- Ajusta las posiciones una y otra vez, iterativamente, hasta que los grupos se van formando solos, como imanes que encuentran su sitio.
El resultado es un mapa que parece brujería: clusters nítidos, temas separados, subgrupos dentro de los grupos, fronteras suaves y patrones que PCA jamás te habría enseñado, porque PCA solo dibuja líneas rectas y aquí la estructura es curva, orgánica, retorcida.
¿Por qué t‑SNE se hizo tan famoso?
Seamos sinceros: en parte, porque produce gráficos espectaculares. Pero no es solo estética. Cuando le das embeddings de texto, de imágenes o de audio, t‑SNE te revela cosas que estaban ahí, escondidas: grupos temáticos, estilos visuales, géneros musicales, tipos de cliente, segmentos ocultos que nadie había etiquetado. Por eso se convirtió en la herramienta favorita para explorar datos complejos y «ver con los ojos» lo que un modelo aprendió por dentro.
LSA + t‑SNE — el dúo perfecto
Ahora se entiende por qué funcionan tan bien juntos. Cada uno cubre el punto ciego del otro.
LSA baja de 50.000 dimensiones a 100 o 200, quedándose con la esencia semántica. t‑SNE toma esas 200 y las lleva hasta 2, donde por fin puedes mirarlas.
LSA descubre los conceptos; t‑SNE los dibuja. LSA comprime; t‑SNE revela. LSA pone orden en el lenguaje; t‑SNE lo convierte en un mapa que puedes recorrer con la vista.
Es la diferencia entre tener una biblioteca perfectamente catalogada… y tener, además, un plano que te muestra dónde está cada sección.
Ejemplo en nuestra tienda
Volvamos a lo concreto. Supón que tienes 20.000 reseñas de clientes, vectorizadas con TF‑IDF, lo que te deja con vectores de 50.000 dimensiones. Un muro de números impenetrable.
Aplicas LSA → reduces a 150 conceptos. Aplicas t‑SNE → reduces a 2 dimensiones. Y entonces abres el gráfico y aparece esto:
- un cluster claro de reseñas positivas,
- un cluster de quejas sobre envíos,
- un cluster de problemas con devoluciones,
- un cluster de comentarios sobre atención al cliente,
- y, dentro de cada uno, subgrupos más finos.
Lo que hace un momento era puro ruido textual se ha convertido, sin que nadie etiquetara nada, en un mapa legible de lo que piensan tus clientes.
Ventajas y desventajas
Como cada algoritmo brilla y tropieza en cosas distintas, vale la pena verlos por separado.
LSA
| Ventajas | Desventajas |
|---|---|
| Reduce la dimensionalidad del texto de forma drástica | Es lineal: solo capta relaciones sencillas |
| Descubre conceptos latentes que no ves a simple vista | No captura significados complejos ni matices |
| Muy rápido | No entiende el contexto profundo de una frase |
| Basado en SVD, estable y robusto | Se queda corto frente a embeddings modernos |
t‑SNE
| Ventajas | Desventajas |
|---|---|
| Visualizaciones espectaculares y reveladoras | Solo sirve para visualizar, no para alimentar modelos |
| Descubre clusters ocultos | No preserva las distancias globales (la geometría «grande» engaña) |
| Encaja perfecto con embeddings | Puede ser lento con muchísimos puntos |
| Ideal para análisis exploratorio | Los resultados dependen de sus hiperparámetros (como la perplexity) |
Un aviso importante sobre t‑SNE, porque lleva a mucha gente a error: las distancias entre clusters no significan nada. Que dos grupos aparezcan lejos en el mapa no quiere decir que sean «muy distintos»; t‑SNE cuida la vecindad local, no las distancias grandes. Léelo como quien mira un mapa de metro: te dice qué estaciones están conectadas, no los kilómetros reales entre ellas.
¿Cuándo usar este dúo (y cuándo no)?
Úsalo cuando tengas texto ya vectorizado, quieras descubrir temas ocultos, necesites visualizar clusters semánticos, estés explorando datos complejos sin saber muy bien qué buscas, o trabajes con embeddings de texto, imagen o audio.
Evítalo cuando necesites interpretabilidad absoluta (t‑SNE no te da explicaciones, te da un dibujo), cuando dependas de preservar las distancias globales de tus datos, o cuando el volumen sea tan enorme que t‑SNE se vuelva demasiado lento (ahí conviene mirar alternativas como UMAP).
En resumen
LSA y t‑SNE son dos mitades de una misma idea: dar sentido a datos que, en bruto, no hay forma de mirar. LSA descubre los conceptos latentes escondidos entre miles de palabras. t‑SNE dibuja esos conceptos en un mapa que revela patrones invisibles.
Y con esto, la familia va quedando completa:
Si PCA era descubrir dimensiones,
y LDA era descubrir separaciones,
LSA es descubrir significados,
y t‑SNE es descubrir paisajes.
Es el dúo que mira tus datos, se remanga, y te dice:
«Déjame comprimir tus ideas… y luego enseñarte el mapa donde viven.»


