OptimizadorOptimizer

La regla que recibe el gradiente y decide cómo mover los valores

Puntos clave
  • El optimizador es la regla que recibe el gradiente y decide cómo mover los valores en la práctica. La dirección la fija el descenso de gradiente; el tamaño base, la tasa de aprendizaje.
  • El primer truco es el impulso: si se viene moviendo hacia el mismo lado, hereda la velocidad del paso anterior y avanza con más fuerza.
  • El segundo truco es dar un paso distinto según la dirección: donde el valor se sacude mucho, avanza poco; donde apenas cambia, avanza más.
  • Con estos trucos se reduce el rebote de lado a lado en valles angostos y largos, y en el mismo tiempo se baja mucho más.
  • Cambiar de optimizador no elimina la necesidad de fijar la tasa de aprendizaje. El tamaño base lo sigue poniendo una persona.
Contenido

1La analogía

En una carrera de relevos, si el siguiente corredor espera parado en la línea de salida, el tiempo del equipo se resiente: tiene que arrancar de cero justo al recibir la posta. Por eso el corredor ve venir al compañero y empieza a correr antes, para heredar directamente su velocidad.

La forma de correr también cambia según el tramo. En las curvas, el cuerpo se va hacia afuera, así que conviene acortar el paso y pisar más seguido; en las rectas, se estira la zancada al máximo. En la misma pista, el movimiento cambia según en qué tramo se esté.

Eso mismo hace el optimizador: hereda la velocidad del paso anterior y ajusta la zancada según el tramo. Hacia dónde ir ya está decidido; lo único que le toca es con qué estilo recorrer el camino.

2En detalle

Saber solo la dirección sale caro

El gradiente indica hacia qué lado baja el terreno desde donde se está. Pero moverse a rajatabla en esa dirección genera desperdicio, sobre todo en un valle angosto y largo, empinado de un lado y suave del otro.

En un lugar así, se rebota con fuerza hacia el lado empinado y se vuelve, una y otra vez, mientras que hacia el lado suave apenas se avanza. Debería bajarse en línea recta por el valle, pero en cambio se avanza a los zigzags, chocando contra las paredes. Se gastan muchísimos pasos y se baja muy poco.

El optimizador no usa el gradiente tal cual: lo retoca antes de aplicarlo. Guarda memoria de los pasos anteriores y la mezcla con el gradiente actual para armar el movimiento real.

El impulso reduce el rebote

El primer truco es heredar, en cierta proporción, la magnitud del paso anterior. Si se viene yendo siempre hacia el mismo lado, esa parte heredada se acumula y el paso crece; si la dirección se invierte a cada rato, esos aportes se cancelan entre sí y se apagan.

Aplicado al valle, el vaivén contra las paredes se reduce y queda solo el avance a lo largo del valle, que gana velocidad. Con esa velocidad guardada, hasta se puede pasar de largo por encima de un pozo poco profundo, así que también baja el riesgo de quedar atrapado en un punto a medias.

La proporción heredada suele fijarse cerca de conservar casi todo el paso anterior. Si se fija demasiado alta, el movimiento sigue empujando hacia el rumbo viejo un buen rato después de haber cambiado de dirección; si se fija demasiado baja, es como no tener impulso.

Dar un paso distinto según la dirección

El segundo truco es manejar por separado el tamaño del paso de cada valor. Se lleva un registro de cuánto se sacudió ese valor hasta ahora, y a los que se sacudieron mucho se les reduce el paso, mientras que a los que casi no se movieron se les agranda.

Este truco ayuda sobre todo con características que aparecen rara vez. El valor asociado a una característica que aparece de vez en cuando tiene pocas oportunidades de actualizarse, y agrandarle el paso permite aprovechar bien esas pocas ocasiones. Adam, el optimizador más usado, combina estos dos trucos a la vez.

Aun así, el tamaño base lo pone una persona

Que el optimizador ajuste el paso por su cuenta no significa que ya no haga falta la tasa de aprendizaje. Lo que se ajusta por dirección es apenas un multiplicador; la línea base sobre la que se aplica ese multiplicador la sigue escribiendo una persona. Si esa línea base es grande, el movimiento rebota igual, por buenos que sean los demás trucos.

Por eso en la práctica es común dejar fijo un optimizador de uso extendido y ajustar solo la tasa de aprendizaje probando algunos valores. Corregir la tasa de aprendizaje suele mover el resultado mucho más que cambiar de optimizador.

3Con más precisión

El optimizador es la regla que recibe el gradiente y el historial de actualizaciones anteriores, y calcula cuánto se actualiza esta vez. La forma más simple es multiplicar el gradiente por la tasa de aprendizaje, lo que se conoce como descenso de gradiente estocástico. Sobre esa base fueron apareciendo, en orden, una variante que suma un término de impulso, y otra que acumula la magnitud de los gradientes anteriores para dividir el paso por dirección. Hoy lo más usado es la familia Adam, que combina el impulso con el ajuste por dirección.

La analogía también tiene sus costuras. En la pista de relevos se ven a simple vista las curvas y las rectas, pero en el entrenamiento no se sabe de antemano qué dirección es empinada: solo se infiere por el historial de sacudidas registrado hasta ahora. Además, el optimizador guarda ese historial por separado para cada valor, así que entrenar un modelo requiere varias veces más memoria que la cantidad de valores por sí sola. Cambiar de optimizador tampoco toca la dirección que entrega el descenso de gradiente ni la tasa de aprendizaje que fija la persona: solo cambia el estilo con que se usa esa dirección.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que con un buen optimizador ya no hace falta preocuparse por la tasa de aprendizaje, pero en realidad el tamaño base lo sigue fijando una persona, y ese valor es lo que más mueve el resultado.

  • Es fácil pensar que el optimizador encuentra una mejor respuesta, pero en realidad solo recorre el mismo terreno con más eficiencia; el terreno en sí no cambia.

  • Es fácil pensar que el optimizador más reciente siempre es mejor, pero en realidad, según los datos y el modelo, un método antiguo y simple suele funcionar igual de bien o mejor.

7Resumen en una línea

En resumenEl optimizador recibe la dirección cuesta abajo, hereda la velocidad anterior y ajusta el paso según cada dirección: es el estilo con el que se mueven los valores.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02