Regularización en Regresión Logística: cómo Ridge, Lasso y Elastic Net estabilizan la clasificación (Parte 7)


Logistic Regression (Part 7): Regularization in Classification

When probabilities start to misbehave, regularization becomes essential.

En las Partes 1 a 6 aprendimos a ajustar rectas, a curvar el modelo cuando hacía falta y a domar el sobreajuste penalizando coeficientes con Ridge, Lasso y Elastic Net. Todo eso lo hicimos sobre regresión lineal, donde el modelo predice números continuos.

Hoy damos el salto natural: llevar esas mismas ideas al terreno de la clasificación. Y la buena noticia, que iremos viendo a lo largo del artículo, es que casi todo lo que ya sabes se traslada tal cual. Cambia la función que predecimos y cambia la pérdida que medimos, pero el mecanismo de regularización y de entrenamiento es el mismo que ya dominas.

Comparación de fronteras de decisión sin regularización, con Ridge y con Lasso en regresión logística.


1. Por qué la regresión logística necesita regularización incluso más que la lineal

La regresión logística no predice un número cualquiera: predice una probabilidad, un valor entre 0 y 1. Para conseguirlo toma la combinación lineal de siempre y la aplasta con la función sigmoide:

Esezes exactamente la recta (o el hiperplano) de siempre. La sigmoide solo se encarga de convertir cualquier número real en algo interpretable como probabilidad: loszmuy negativos los lleva cerca de 0 y los muy positivos cerca de 1.

Y ahí está precisamente el problema. La sigmoide se satura en los extremos:

  • sizes muy grande y positivo →ŷ ≈ 1
  • sizes muy grande y negativo →ŷ ≈ 0

En esas zonas planas la curva casi no cambia aunquezcambie mucho, así que su pendiente (el gradiente) se vuelve diminuta. Cuando eso ocurre pasan dos cosas malas a la vez: el aprendizaje se ralentiza porque los pasos del gradiente se quedan sin fuerza, y el modelo se vuelve peligrosamente sobreconfiado, afirmando «esto es clase 1 con probabilidad 99.9%» aunque esté equivocado.

¿Y qué es lo que empuja azhacia esos valores enormes? Coeficientes enormes. Si los β crecen sin control,zse dispara, la sigmoide se satura y el modelo memoriza el ruido del entrenamiento en lugar de aprender el patrón general.

Es exactamente el mismo mecanismo de sobreajuste que vimos en la Parte 6, pero aquí tiene un efecto extra desagradable: además de generalizar mal, rompe la calidad de las probabilidades. Por eso la regularización no es un lujo en clasificación, sino casi una necesidad.


2. La pérdida cambia: adiós MSE, hola Log-Loss

En regresión lineal medíamos el error con el MSE. En logística lo sustituimos por la log-loss (o entropía cruzada binaria), que mide cómo de buenas son las probabilidades predichas:

Parece más intimidante de lo que es. Léela por partes: para un ejemplo cuya clase real es1(yᵢ = 1), solo sobrevive el primer término,log(ŷᵢ), que castiga tanto más cuanto más baja sea la probabilidad que le diste a la clase correcta. Para uno de clase0, sobrevive el segundo. En ambos casos la idea es la misma: penaliza estar equivocado, y penaliza brutalmente estar equivocado con mucha confianza. Predecir 0.99 para algo que era clase 0 dispara la pérdida hacia el infinito.

¿Por qué no seguir con el MSE? Por varias razones que se refuerzan entre sí:

  • El MSE combinado con la sigmoide no es convexo, así que el descenso del gradiente podría quedarse atascado en mínimos locales.
  • La log-loss sí es convexa, lo que nos devuelve la garantía tan cómoda de la Parte 4: un único mínimo global.
  • La log-loss trata bien las probabilidades y castiga con dureza la confianza injustificada, justo lo que el MSE no hace.
  • Y no es un invento arbitrario: surge de forma natural de la máxima verosimilitud (MLE). Maximizar la probabilidad de haber observado tus datos equivale exactamente a minimizar la log-loss.

Lo importante para este artículo: cambiar la pérdida no cambia cómo se regulariza. La penalización se añade encima igual que antes.


3. Regularización L2, L1 y Elastic Net en logística

La receta es idéntica a la Parte 6: tomamos la pérdida y le sumamos un término que castiga los coeficientes grandes. Solo que ahora la pérdida base es la log-loss.

Ridge (L2)

Penaliza el cuadrado de los coeficientes, lo que empuja a todos hacia valores pequeños sin llegar a anularlos. En clasificación esto tiene un beneficio muy concreto: al mantener los β contenidos, evita quezse dispare y por tanto evita que la sigmoide se sature. El resultado es una frontera de decisión más suave y estable, con todas las variables aún presentes.

Lasso (L1)

Penaliza el valor absoluto, y eso tiene el efecto característico de llevar algunos coeficientes exactamente a cero. En la práctica, Lasso hace selección de variables: descarta las irrelevantes por sí solo. El modelo queda más simple, con una frontera de decisión más limpia y mucho más fácil de interpretar (puedes decir qué variables importan de verdad).

Elastic Net

Combina ambas penalizaciones. Es la opción a la que recurrir cuando hay muchas variables correlacionadas entre sí: Lasso por sí solo tiende a elegir una del grupo casi al azar y descartar el resto, mientras que la parte L2 de Elastic Net reparte el peso de forma más estable. Te quedas con la selección de variables de Lasso y la suavidad de Ridge.

Método Qué hace con los coeficientes Cuándo brilla
Ridge (L2) Los encoge, ninguno se anula Muchas variables útiles; quieres estabilidad
Lasso (L1) Anula los irrelevantes Quieres un modelo simple e interpretable
Elastic Net Mezcla de ambos Muchas variables correlacionadas

4. Cómo se entrena: el mismo motor, nueva pérdida

Aquí viene la parte más satisfactoria, y merece la pena detenerse en ella. La regla de actualización es la misma de siempre:

Y lo bonito es lo que sale al calcular la derivada de la log-loss con la sigmoide. Después de simplificar (los términos feos se cancelan de una forma casi mágica), la derivada queda así:

Fíjate bien: es exactamente la misma forma que en la regresión lineal de la Parte 4. «Error multiplicado por la variable, promediado». La única diferencia es que ahoraŷᵢviene de la sigmoide en lugar de una recta directa. Ese es el motivo real por el que decimos que el mecanismo es idéntico: no es solo que «se parezca», es que la fórmula del gradiente coincide literalmente.

Así que la actualización completa, ya con regularización L2 por ejemplo, queda:

Lo único genuinamente nuevo respecto a la Parte 6 es que laŷpasa por la sigmoide y que esa sigmoide puede saturarse. La penalización L1/L2 se comporta igual que ya conoces.


5. Qué pasa geométricamente: tres fronteras, tres comportamientos

En clasificación, el modelo no dibuja una recta que atraviese los puntos, sino una frontera de decisión: la línea (o curva) que separa una clase de otra. La regularización actúa directamente sobre la forma de esa frontera.

Imagina un problema con dos clases entremezcladas:

  • Sin regularización: con libertad para que los coeficientes crezcan, la frontera se retuerce y zigzaguea intentando capturar cada punto individual, incluido el ruido. Ajusta perfecto en entrenamiento y falla en datos nuevos. Es el sobreajuste de manual.
  • Con Ridge: al contener los coeficientes, la frontera se suaviza. Deja de perseguir puntos aislados y captura la tendencia general. Más estable, generaliza mejor.
  • Con Lasso: además de suavizar, elimina las variables que no aportan, lo que simplifica aún más la frontera al reducir las dimensiones que realmente participan.

La intuición de fondo es que coeficientes grandes = fronteras retorcidas = sigmoide saturada, y las tres formas de regularización (Ridge, Lasso y Elastic Net) atacan justo esa raíz manteniendo los coeficientes a raya.


6. Cuándo usar regularización en clasificación (y cuándo no)

No es una herramienta que debas activar siempre por defecto. La cuestión es reconocer las señales.

Actívala cuando:

  • Tienes muchas características, sobre todo si son más que ejemplos de entrenamiento.
  • Hay multicolinealidad (variables muy correlacionadas entre sí).
  • La frontera de decisión parece demasiado compleja o inestable.
  • Observas coeficientes enormes o probabilidades sospechosamente extremas (0.999, 0.001).
  • El error de validación es mucho mayor que el de entrenamiento: la firma clásica del sobreajuste.

Piénsatelo dos veces cuando:

  • Tienes muchos datos y pocas variables: el modelo ya tiene poco margen para sobreajustar.
  • El modelo ya generaliza bien: no arregles lo que no está roto.
  • El problema es de falta de expresividad, no de exceso: si el modelo se queda corto (underfitting), regularizar solo empeora las cosas, porque le atas todavía más las manos.

En la práctica, el mando que ajustas esλ(o su inverso,C, en herramientas como scikit-learn, dondeCgrande significa poca regularización). Se elige con validación cruzada, probando varios valores y quedándote con el que mejor generaliza.


7. En resumen

  • La regresión logística predice probabilidades mediante la sigmoide, no números continuos.
  • La sigmoide se satura cuando los coeficientes crecen: gradientes diminutos, sobreconfianza y peor generalización.
  • Cambiamos el MSE por la log-loss, que es convexa, castiga la confianza injustificada y nace de la máxima verosimilitud.
  • Ridge suaviza los coeficientes, Lasso los anula y hace selección de variables, y Elastic Net combina ambos para variables correlacionadas.
  • El entrenamiento sigue siendo descenso del gradiente, y su fórmula coincide literalmente con la de la Parte 4: «error por variable, promediado».
  • La regularización es la clave para conseguir fronteras de decisión estables y probabilidades fiables.

Con esto cerramos el círculo de toda la serie: las mismas tres ideas (una pérdida, un gradiente y una penalización) sirven tanto para predecir números como para clasificar. Lo único que cambia entre un problema y otro es la función que envuelve la salida y la pérdida que mides. El motor, siempre el mismo.