RegularizaciónRegularization

Penalizar que los valores del modelo crezcan demasiado

Puntos clave
  • La regularización es un mecanismo que, durante el entrenamiento, penaliza que los valores crezcan demasiado. El modelo aprende mirando el error, pero también el tamaño de sus valores.
  • Si solo se busca reducir el error, algunos valores se disparan y aparece una respuesta llena de altibajos que encaja al milímetro con los datos.
  • Con la penalización de por medio, el modelo busca arreglárselas sin usar valores tan grandes. El resultado es más suave y funciona mejor con datos nuevos.
  • La fuerza de la penalización la fija una persona: si es muy débil no sirve de nada, y si es muy fuerte impide aprender lo que hay que aprender.
  • Comparte nombre, pero no función, con la normalización que ajusta los valores a un mismo rango.
Contenido

1La analogía

Cuando el fuego bajo una olla a presión es fuerte, la presión de dentro no deja de subir. Si se la deja así, la tapa termina cediendo, así que se le coloca encima una pesa. Cuando la presión llega a cierto límite, la pesa se levanta y deja escapar vapor poco a poco, y la presión vuelve a bajar de ese límite.

La pesa no frena la cocción: el fuego sigue igual y los ingredientes se cuecen igual. Solo hace que, cada vez que la presión intenta dispararse por encima del límite, haya que pagar un precio por ello. Gracias a eso, el interior se mantiene siempre en un nivel manejable.

La regularización es esa pesa. El entrenamiento sigue su curso, pero cada vez que un valor intenta crecer se le suma un pequeño costo. Si la ganancia de agrandar el valor no supera ese costo, el modelo prefiere no agrandarlo. El peso de la pesa se decide antes de poner la olla al fuego.

2En detalle

Si solo se reduce el error, los valores crecen

El entrenamiento se mueve únicamente hacia reducir el error. Pero si se intenta acertar exactamente cada punto de los datos, la línea que representa la respuesta tiene que retorcerse mucho para pasar entre ellos. Para retorcerse así, algunos valores deben volverse muy grandes: cuanto más grande el valor, más se dispara el resultado con un cambio mínimo en la entrada.

Ese modelo obtiene un puntaje excelente con los datos que usó para entrenar, pero falla mucho ante datos que nunca vio, porque copió hasta el ruido mezclado en los datos. Eso es lo que se llama sobreajuste.

Un valor grande significa además que el resultado depende demasiado de ese valor: basta con que esa característica cambie un poco para que la respuesta se tambalee. Por eso un valor grande es, de por sí, una señal de riesgo.

Se penaliza el tamaño

La regularización añade un elemento más a lo que el entrenamiento mide como error. Hasta ahora solo se miraba "cuánto se falló"; ahora también se mira "qué tan grandes son los valores". El entrenamiento se mueve hacia reducir la suma de los dos.

Entonces, agrandar un valor para reducir un poco el error se vuelve una mala jugada. El modelo solo agranda un valor cuando eso reduce el error de forma clara, y en los demás casos prefiere mantenerlo pequeño. El resultado es una respuesta más suave, y esa suavidad se traduce en resultados parecidos ante datos nuevos.

Este elemento también entra en el cálculo que mueve los valores en cada paso: se suma una fuerza extra que tira de cada valor un poco hacia cero. A este método también se le llama decaimiento de peso.

Se fija la fuerza de la penalización

Cuánto pesa la pesa lo decide una persona. Si ese valor es demasiado pequeño, la penalización apenas se nota y los valores siguen disparándose. Si es demasiado grande, el modelo no logra agrandar los valores que necesitaría y termina perdiéndose incluso las reglas reales que había en los datos, dando respuestas demasiado obvias.

La fuerza adecuada depende de cuántos datos hay y de qué tan grande es el modelo. Con pocos datos conviene una penalización fuerte, porque es más fácil memorizar; con datos de sobra, una más suave. En la práctica se prueban varias fuerzas y se elige la que da mejor puntaje con datos apartados para ese fin.

Dos formas de penalizar

El resultado cambia según cómo se mida el tamaño de los valores. Sumar el cuadrado de cada valor castiga con especial dureza a los más grandes: en conjunto los valores se vuelven más pequeños, pero rara vez llegan a cero, y varios se reparten el trabajo de forma pareja.

Sumar el valor absoluto es distinto: empuja a cero directamente a los valores menos útiles, así que se reduce la cantidad de valores que realmente se usan. Esta forma conviene cuando se quiere averiguar qué características sobran. También es común combinar las dos.

3Con más precisión

La regularización añade a la función de pérdida un término que mide el tamaño de los valores, y minimiza ambos a la vez. Sumar el cuadrado se llama L2; sumar el valor absoluto, L1. El coeficiente que multiplica ese término es la fuerza de la penalización, y no lo decide el entrenamiento sino una persona de antemano.

En sentido amplio, "regularización" también designa cualquier ajuste que impida que el modelo memorice los datos por completo: apagar al azar parte de las neuronas durante el entrenamiento, o detener el entrenamiento en cuanto el puntaje empieza a empeorar, caen dentro de ese sentido amplio. Pero en sentido estricto, regularización suele referirse justo a esta penalización sobre el tamaño de los valores.

La analogía también cojea en algún punto. La pesa de la olla solo actúa en el instante en que se cruza el límite fijado, pero la penalización siempre está un poco presente, incluso cuando los valores son pequeños. No hay un límite que haya que cruzar para que empiece a actuar: el costo crece junto con el valor, de forma continua.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que esta regularización es la misma que ajusta los valores a un rango entre 0 y 1, pero en realidad son mecanismos distintos: este penaliza el tamaño de los valores, mientras que ajustar rangos es otra técnica con otro nombre.

  • Es fácil pensar que cuanto más fuerte la penalización, más sólido se vuelve el modelo, pero en realidad, si se pasa de la cuenta, el modelo deja de aprender lo que necesita y el puntaje baja junto con eso.

  • Es fácil pensar que aplicar regularización elimina el sobreajuste, pero en realidad solo lo reduce, y conviene combinarla con más datos o con un buen punto para detener el entrenamiento.

7Resumen en una línea

En resumenLa regularización es la pesa que cobra un precio cada vez que un valor intenta crecer, para que el modelo elija una respuesta suave en lugar de copiar los datos al detalle.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02