
Deep Learning: Perceptrón y MLP
El nacimiento de las redes neuronales modernas
Cómo una idea tan simple como «suma pesos y activa una función» terminó creando todo el Deep Learning.
Hasta ahora hemos recorrido el mundo del Machine Learning clásico. PCA aplana universos, LDA dibuja fronteras, LSA descubre significados, t‑SNE revela paisajes, y los métodos ensemble encuentran fuerza en la multitud. Cada uno, a su manera, es brillante.
Pero todos, por potentes que sean, chocan con el mismo muro.
Hay patrones que no se dejan atrapar con árboles, ni con regresiones, ni con distancias, ni con proyecciones. Patrones demasiado curvos, demasiado profundos, demasiado abstractos para las herramientas que hemos visto. Piensa en reconocer una cara en una foto, entender el tono de una frase o predecir el siguiente fotograma de un vídeo: ahí los métodos clásicos levantan las manos y se rinden.
Justo ahí nace el Deep Learning.
Y como toda gran historia, empieza con algo diminuto. Una unidad mínima. Un átomo.

El perceptrón.
El perceptrón: la neurona artificial que lo empezó todo
El perceptrón es la idea más simple que puedes tener de una neurona. Y su funcionamiento cabe en cuatro pasos:
- Toma varias entradas (los datos).
- Multiplica cada una por un peso (su importancia).
- Suma todo.
- Pasa el resultado por una función que decide: ¿sí o no?
Es, literalmente, una puerta. Una frontera. Una línea recta trazada en el espacio.
Matemáticamente es casi trivial:
Donde $f$ suele ser una función escalón: si la suma supera cierto umbral, la neurona «se activa» y dispara un 1; si no, se queda en 0. Los pesos $w$ dicen cuánto importa cada entrada, y $b$ (el sesgo) mueve el umbral a un lado u otro.
Un ejemplo tonto para verlo claro. Imagina que quieres decidir si sales a correr. Tus entradas son: ¿hace sol? ¿tienes tiempo? ¿te apetece? Cada una tiene un peso según lo que te importe. Sumas, y si pasas tu umbral personal… te pones las zapatillas. Eso es un perceptrón.
Es simple. Es elegante. Y es insuficiente.
La limitación fatal: el problema XOR
El perceptrón tiene un talón de Aquiles enorme: solo puede aprender fronteras lineales. Solo sabe separar el mundo con una línea recta. Y eso significa que hay problemas que jamás podrá resolver, por mucho que lo entrenes.
El ejemplo clásico es el XOR. La regla es sencilla: la respuesta es «sí» cuando las dos entradas son distintas, y «no» cuando son iguales. Si dibujas esos cuatro puntos en un plano, los que dicen «sí» quedan en dos esquinas opuestas, y los que dicen «no» en las otras dos. Cruzados en diagonal.
Y ahí está el drama: no existe ninguna línea recta capaz de separarlos. Por más que la gires, la muevas o la inclines, siempre dejará mezclados los puntos de ambas clases.
El perceptrón mira ese problema y solo puede decir:
«Lo siento, no puedo.»
Y esa limitación pesó tanto que, durante años, buena parte de la comunidad científica dio las redes neuronales por muertas. Hasta que alguien lanzó una pregunta que lo cambió todo:
¿Y si en lugar de un perceptrón conectamos muchos entre sí?
🧩 El MLP: la primera red neuronal «de verdad»
Un MLP (Multilayer Perceptron, perceptrón multicapa) es exactamente eso: una capa de perceptrones conectada a otra capa, conectada a otra, conectada a otra…
En el fondo es una composición de funciones. Una cadena de transformaciones. Una máquina que recibe datos en bruto y los va refinando paso a paso, capa a capa.
Su estructura tiene tres partes:
- Capa de entrada → recibe los datos.
- Capas ocultas → transforman la información (aquí ocurre la magia).
- Capa de salida → produce la predicción final.

La clave está en que cada capa aplica una función de activación no lineal (ReLU, tanh, sigmoid…). Esas funciones son las que permiten doblar, curvar y retorcer el espacio en lugar de partirlo con una simple recta.
Y ahí ocurre el milagro: si conectas dos perceptrones, uno detrás de otro, con una no linealidad en medio… el XOR se resuelve sin despeinarse. Lo que era imposible para una neurona se vuelve trivial para una red.
Con esa capacidad, un MLP aprende:
- fronteras curvas,
- patrones complejos,
- combinaciones no lineales,
- relaciones profundas entre variables.
Es el primer modelo que de verdad «piensa» en varios pasos.
La intuición: componer funciones
Piensa en un MLP como una fábrica en cadena:
- La primera capa detecta patrones simples.
- La segunda combina esos patrones en estructuras más complejas.
- La tercera los refina todavía más.
- La última toma la decisión.
Es como aprender a dibujar. Primero trazas líneas sueltas. Luego formas. Luego sombras. Luego detalles. Y al final, casi sin darte cuenta, aparece el dibujo completo.
El MLP hace justo eso, pero con matemáticas: parte de lo simple y va construyendo lo complejo, un nivel encima de otro.
El problema: ¿cómo ajustamos todos esos pesos?
Aquí llega la pregunta incómoda. Un perceptrón tiene un puñado de parámetros. Un MLP puede tener miles. Una red profunda, millones.
¿Cómo se ajusta todo eso? ¿Cómo sabe cada neurona qué peso debe tener? Y cuando la red se equivoca, ¿cómo se reparte la culpa del error entre millones de parámetros para saber cuál corregir y cuánto?
La respuesta es uno de los algoritmos más importantes de la historia del Deep Learning:
Backpropagation.
Pero ese es el tema del próximo capítulo.
En resumen
El perceptrón es la unidad mínima del Deep Learning: una neurona artificial que toma entradas, las pondera y decide. Pero está atrapado en las líneas rectas: solo aprende fronteras lineales.
El MLP es la revolución. Una red de perceptrones conectados que, gracias a las funciones de activación y a la composición de capas, aprende patrones que una sola neurona jamás podría capturar.
Es el primer modelo que «piensa» en varios pasos. El primero que puede doblar el espacio. El primero capaz de resolver lo que el perceptrón daba por imposible.
Y es el puente hacia lo que viene ahora:
Backpropagation: el algoritmo que enseña a las redes a aprender.



