Regularización en Machine Learning: Ridge y Lasso explicados de forma clara (Parte 6)


Regresión (Parte 6): Ridge & Lasso — Domando el sobreajuste

Cuando tu modelo tiene demasiada libertad, la solución no es quitársela — es cobrarle por usarla.

En la Parte 5 vimos el poder (y el peligro) de los polinomios. Con unas cuantas columnas extra — x², x³, x⁴… — nuestro modelo puede aprender curvas complejas. Pero también puede volverse loco: coeficientes gigantes, curvas que hacen piruetas, error de entrenamiento perfecto y error de validación desastroso.

Ese comportamiento tiene un nombre: sobreajuste. Y hoy aprendemos la herramienta que lo controla: la regularización.

 

Comparación visual entre modelos sin regularización, Ridge y Lasso mostrando el efecto sobre la curva y los coeficientes

1. El problema real: coeficientes que se desbocan

Cuando un modelo intenta perseguir el ruido, necesita hacer curvas muy bruscas. ¿Y cómo se consiguen curvas bruscas? Con coeficientes enormes.

Ejemplo típico:

  • β₅ = 847
  • β₆ = −2340
  • β₇ = 3102

Signos alternos, magnitudes absurdas. El modelo está memorizando fluctuaciones aleatorias, no aprendiendo la tendencia real.

Si controlamos los coeficientes, controlamos el sobreajuste.

2. La idea clave: penalizar la complejidad

Hasta ahora, el modelo solo tenía un objetivo:

Minimizar el error (MSE)

La regularización añade un segundo objetivo:

Minimizar el taman˜o de los coeficientes

La nueva función de coste es:

J(β)=error+λ⋅penalizacioˊn
  • El primer término quiere ajustar los datos.
  • El segundo quiere mantener los coeficientes pequeños.

λ (lambda) es el dial que controla cuánta disciplina aplicamos.

Metáfora:

“No te prohíbo usar x² o x³… pero te cobro por exagerar.”

3. Ridge Regression (L2): suavizar sin eliminar

Ridge penaliza la suma de los cuadrados:

λ∑βj2

Efecto:

  • Los coeficientes grandes pagan mucho.
  • Los coeficientes pequeños pagan poco.
  • Todos se encogen, pero ninguno desaparece.

Resultado:

  • Curvas suaves.
  • Nada de oscilaciones violentas.
  • Todas las características siguen presentes.

Metáfora:

“Ridge es poner amortiguadores: el coche sigue siendo potente, pero ya no salta en cada bache.”

4. Lasso Regression (L1): seleccionar lo que importa

Lasso penaliza la suma de valores absolutos:

λ∑∣βj∣

Efecto:

  • La presión hacia cero es constante.
  • Si un coeficiente aporta poco, se va a cero exacto.
  • El modelo elimina características automáticamente.

Resultado:

  • Curvas suaves.
  • Ecuaciones más simples.
  • Selección automática de variables.

Metáfora:

“Lasso es limpiar un armario: lo que no usas, se va.”

5. Ridge vs Lasso (resumen rápido)

Técnica Qué hace Cuándo usar
Ridge (L2) Encoge coeficientes Cuando todas las variables aportan algo
Lasso (L1) Elimina coeficientes Cuando solo unas pocas variables importan
Elastic Net Mezcla L1 + L2 Cuando hay muchas variables correlacionadas

6. El papel de λ: el dial de disciplina

  • λ = 0 → sin regularización → caos.
  • λ pequeño → ligera suavización.
  • λ óptimo → equilibrio perfecto.
  • λ grande → modelo rígido → infraajuste.

Se elige con validación cruzada, igual que el grado del polinomio.

7. Cómo se entrena (versión ligera)

El descenso del gradiente sigue siendo el mismo. Solo cambian las derivadas:

Ridge:

∂J∂βj=gradiente normal+2λβj

→ empuja suavemente hacia cero.

Lasso:

∂J∂βj=gradiente normal+λ⋅signo(βj)

→ empuja con fuerza constante hasta llegar a cero.

No necesitas más para entender la intuición.

8. Un ejemplo visual (conceptual)

Imagina el mismo polinomio de grado 10:

  • Sin regularización: curva salvaje, coeficientes enormes.
  • Con Ridge: curva suave, coeficientes pequeños.
  • Con Lasso: curva suave, ecuación simple (solo x, x²).

Tres tratamientos, tres resultados. Solo Ridge y Lasso doman el caos.

9. Cuándo usar regularización

Usa regularización cuando:

  • el error de validación es mucho mayor que el de entrenamiento
  • los coeficientes son enormes
  • tienes muchas características
  • usas polinomios de grado alto
  • hay multicolinealidad
  • el modelo es inestable

No la uses cuando:

  • tienes muchos datos y pocas variables
  • el modelo ya generaliza bien
  • el problema es falta de expresividad (no exceso)

10. En resumen

  • El sobreajuste ocurre cuando los coeficientes se inflan.
  • La regularización penaliza esa inflación.
  • Ridge encoge coeficientes.
  • Lasso elimina coeficientes.
  • λ controla cuánta disciplina aplicamos.
  • El entrenamiento sigue siendo descenso del gradiente.
  • La regularización es el cinturón de seguridad de los modelos flexibles.