
Regresión (Parte 6): Ridge & Lasso — Domando el sobreajuste
Cuando tu modelo tiene demasiada libertad, la solución no es quitársela — es cobrarle por usarla.
En la Parte 5 vimos el poder (y el peligro) de los polinomios. Con unas cuantas columnas extra — x², x³, x⁴… — nuestro modelo puede aprender curvas complejas. Pero también puede volverse loco: coeficientes gigantes, curvas que hacen piruetas, error de entrenamiento perfecto y error de validación desastroso.
Ese comportamiento tiene un nombre: sobreajuste. Y hoy aprendemos la herramienta que lo controla: la regularización.

1. El problema real: coeficientes que se desbocan
Cuando un modelo intenta perseguir el ruido, necesita hacer curvas muy bruscas. ¿Y cómo se consiguen curvas bruscas? Con coeficientes enormes.
Ejemplo típico:
- β₅ = 847
- β₆ = −2340
- β₇ = 3102
Signos alternos, magnitudes absurdas. El modelo está memorizando fluctuaciones aleatorias, no aprendiendo la tendencia real.
Si controlamos los coeficientes, controlamos el sobreajuste.
2. La idea clave: penalizar la complejidad
Hasta ahora, el modelo solo tenía un objetivo:
La regularización añade un segundo objetivo:
La nueva función de coste es:
- El primer término quiere ajustar los datos.
- El segundo quiere mantener los coeficientes pequeños.
λ (lambda) es el dial que controla cuánta disciplina aplicamos.
Metáfora:
“No te prohíbo usar x² o x³… pero te cobro por exagerar.”
3. Ridge Regression (L2): suavizar sin eliminar
Ridge penaliza la suma de los cuadrados:
Efecto:
- Los coeficientes grandes pagan mucho.
- Los coeficientes pequeños pagan poco.
- Todos se encogen, pero ninguno desaparece.
Resultado:
- Curvas suaves.
- Nada de oscilaciones violentas.
- Todas las características siguen presentes.
Metáfora:
“Ridge es poner amortiguadores: el coche sigue siendo potente, pero ya no salta en cada bache.”
4. Lasso Regression (L1): seleccionar lo que importa
Lasso penaliza la suma de valores absolutos:
Efecto:
- La presión hacia cero es constante.
- Si un coeficiente aporta poco, se va a cero exacto.
- El modelo elimina características automáticamente.
Resultado:
- Curvas suaves.
- Ecuaciones más simples.
- Selección automática de variables.
Metáfora:
“Lasso es limpiar un armario: lo que no usas, se va.”
5. Ridge vs Lasso (resumen rápido)
| Técnica | Qué hace | Cuándo usar |
|---|---|---|
| Ridge (L2) | Encoge coeficientes | Cuando todas las variables aportan algo |
| Lasso (L1) | Elimina coeficientes | Cuando solo unas pocas variables importan |
| Elastic Net | Mezcla L1 + L2 | Cuando hay muchas variables correlacionadas |
6. El papel de λ: el dial de disciplina
- λ = 0 → sin regularización → caos.
- λ pequeño → ligera suavización.
- λ óptimo → equilibrio perfecto.
- λ grande → modelo rígido → infraajuste.
Se elige con validación cruzada, igual que el grado del polinomio.
7. Cómo se entrena (versión ligera)
El descenso del gradiente sigue siendo el mismo. Solo cambian las derivadas:
Ridge:
→ empuja suavemente hacia cero.
Lasso:
→ empuja con fuerza constante hasta llegar a cero.
No necesitas más para entender la intuición.
8. Un ejemplo visual (conceptual)
Imagina el mismo polinomio de grado 10:
- Sin regularización: curva salvaje, coeficientes enormes.
- Con Ridge: curva suave, coeficientes pequeños.
- Con Lasso: curva suave, ecuación simple (solo x, x²).
Tres tratamientos, tres resultados. Solo Ridge y Lasso doman el caos.
9. Cuándo usar regularización
Usa regularización cuando:
- el error de validación es mucho mayor que el de entrenamiento
- los coeficientes son enormes
- tienes muchas características
- usas polinomios de grado alto
- hay multicolinealidad
- el modelo es inestable
No la uses cuando:
- tienes muchos datos y pocas variables
- el modelo ya generaliza bien
- el problema es falta de expresividad (no exceso)
10. En resumen
- El sobreajuste ocurre cuando los coeficientes se inflan.
- La regularización penaliza esa inflación.
- Ridge encoge coeficientes.
- Lasso elimina coeficientes.
- λ controla cuánta disciplina aplicamos.
- El entrenamiento sigue siendo descenso del gradiente.
- La regularización es el cinturón de seguridad de los modelos flexibles.


