Parada tempranaEarly Stopping

Detener el entrenamiento cuando el puntaje empieza a empeorar

Puntos clave
  • La parada temprana es detener el entrenamiento, sin completar todas las vueltas fijadas, en el punto donde el puntaje empieza a empeorar.
  • El criterio no es el puntaje con los datos de entrenamiento, sino el puntaje con datos separados aparte. El de entrenamiento mejora hasta el final.
  • No se detiene apenas empeora una vez. Se espera unas vueltas más, y solo si no se recupera, se termina ahí.
  • Después de detenerse, no se usa el último estado, sino que se vuelve al punto de mejor puntaje.
  • Casi no hay nada que ajustar y reduce mucho el sobreajuste, así que se deja puesto por defecto en casi cualquier entrenamiento.
Contenido

1La analogía

Al moler el café, se prepara una taza cambiando poco a poco el grosor de la molienda. Al principio el grano es grueso, el agua pasa de largo y el café sale aguado. Al molerlo un poco más fino, el sabor aparece; más fino todavía, y el aroma se vuelve más intenso. Hasta acá, cuanto más fino, mejor.

Pero pasado cierto punto la cosa se da vuelta. El polvo sigue haciéndose más fino, pero el sabor, en vez de mejorar, se vuelve pastoso y amargo. Si se sigue moliendo pensando que más fino siempre es mejor, termina saliendo un café imposible de tomar.

Por eso se va probando cada taza y se anota el grosor que dio el mejor resultado. Cuando el sabor empieza a decaer, se suelta el molinillo y se vuelve a ese grosor anotado. La parada temprana es justo ese soltar el molinillo. El grado de molienda sigue subiendo, pero se sabe que el sabor se dobla en algún punto, así que se busca ese punto y ahí se detiene.

2En detalle

Dos puntajes que se mueven distinto

Mientras se entrena, se miden dos puntajes en dos lugares distintos. Uno es con los datos que se usaron para entrenar; el otro, con datos que se dejaron aparte y nunca entraron al entrenamiento. El puntaje con los datos de entrenamiento casi siempre mejora vuelta tras vuelta, porque el modelo los va memorizando cada vez mejor.

El puntaje con los datos separados aparte se mueve distinto. Al principio mejora junto con el otro, pero pasado cierto punto deja de subir y empieza, de a poco, a empeorar. Es el momento en que el modelo empieza a copiar, además de la regla que traen los datos, el ruido que solo está en esos datos.

El punto donde las dos líneas empiezan a separarse es el punto de parada. Para verlo hay que medir los dos puntajes en cada vuelta y anotarlos uno al lado del otro.

Los datos separados aparte no se usan jamás para entrenar. Si entran aunque sea una vez, ese puntaje también mejora junto con el otro, y el punto donde se dobla deja de verse. Para que la parada temprana funcione bien, lo primero es mantener estos datos completamente intactos.

No se detiene enseguida

El puntaje con los datos separados aparte se mueve con cierto temblor. Como el lote de datos cambia en cada vuelta, es común que empeore una o dos vueltas y después vuelva a mejorar. Si se detiene apenas al primer bajón, se corta un entrenamiento que todavía podía seguir bajando.

Por eso se fija de antemano cuántas vueltas esperar. Si desde la mejor marca pasan tantas vueltas como se fijó sin que se supere ese récord, recién ahí se detiene. Si este margen se fija corto, se corta antes de tiempo; si se fija largo, se estira un entrenamiento que ya no hacía falta.

Se vuelve al mejor punto

Usar tal cual el estado en el momento de detenerse sale perdiendo. Como pasaron varias vueltas desde que salió el mejor puntaje, el último estado ya está un poco peor que aquel.

Por eso, cada vez que se supera el récord durante el entrenamiento, se guarda aparte ese estado. Al detenerse, se recupera el mejor de todos los que se guardaron. Con el café es lo mismo que, apenas el sabor empieza a decaer, volver el molinillo al grosor que dio la mejor taza.

Guardar hace falta solo cuando se rompe el récord, no en cada vuelta; si se guardara todo, el espacio se llenaría enseguida. Cuanto más grande el modelo, más pesa cada copia, así que decidir qué guardar y cuándo pasa a ser parte de la configuración del entrenamiento.

Por qué se usa tanto este método

La parada temprana casi no pide ajustes. Alcanza con fijar cuántas vueltas esperar, y no toca la forma del modelo. Aun así, reduce el sobreajuste de forma bastante notoria. Al no darle tiempo a que los valores crezcan de más, produce un efecto parecido al de las técnicas que penalizan directamente ese crecimiento.

También ahorra bastante tiempo de entrenamiento. Si se fija un número generoso de vueltas y se le suma la parada temprana, el entrenamiento corre solo lo necesario y se detiene solo. Es habitual usarla junto con técnicas que penalizan que los valores crezcan demasiado, o con las que apagan al azar una parte del modelo durante el entrenamiento.

3Con más precisión

La parada temprana termina el entrenamiento cuando la métrica en los datos de validación no mejora durante un número fijo de vueltas, y recupera los valores del momento de mejor marca. La métrica que se sigue puede ser un error o puede ser otra métrica, como la exactitud. Como la dirección en que "mejorar" cambia según la métrica, si se configura mal, el entrenamiento se detiene en un punto equivocado.

Hay un detalle a tener en cuenta. Si el punto de parada se eligió con los datos de validación, esos datos ya intervinieron, de algún modo, en el proceso de entrenamiento. El puntaje final tiene que medirse con otro conjunto de datos que no se haya usado ni una sola vez, para que no quede inflado.

La analogía también tiene sus costuras. El café se prueba con el paladar de una persona, pero en el entrenamiento el puntaje se mide con un cálculo fijado de antemano. Y el molinillo se puede volver atrás sin que cambie el grano, mientras que en el entrenamiento, para poder volver atrás, hace falta haber guardado los valores de antes. Si no se guardaron, se termina con el estado ya empeorado.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que cuanto más se entrena, mejor sale el modelo, pero en realidad, pasado cierto punto, el puntaje con datos nuevos empieza a empeorar en vez de mejorar.

  • Es fácil pensar que hay que detenerse apenas el puntaje empeora una vez, pero en realidad puede ser solo un temblor pasajero, así que conviene esperar unas vueltas más antes de decidir.

  • Es fácil pensar que la parada temprana se decide mirando el puntaje de los datos de entrenamiento, pero en realidad se decide solo con el puntaje de los datos que nunca entraron al entrenamiento.

7Resumen en una línea

En resumenLa parada temprana es soltar el molinillo justo cuando el sabor empieza a decaer, para quedarse con el mejor estado justo antes de que el modelo empiece a memorizar de más.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02