Normalización de capaLayer Normalization
El mecanismo que reajusta la escala de los números en cada capa
- La normalización de capa es el mecanismo que reajusta la escala de los números cada vez que se atraviesa una capa.
- El criterio de ajuste está dentro del bloque de números de una sola posición. No mira los ejemplos vecinos ni otras frases.
- Después del ajuste se añaden dos perillas que vuelven a estirar y a desplazar el resultado. Cuánto abrir cada una lo decide el entrenamiento.
- Sin este mecanismo, cuanto más profunda la red, más los números se disparan a lo absurdo o se desvanecen hasta casi cero, y el entrenamiento se detiene.
- Los modelos actuales suelen reajustar la escala antes de entrar en la capa, no después.
Contenido
1La analogía
En el boletín de un examen de práctica no aparecen solo los puntajes crudos. Lengua vale 100 puntos, Matemáticas vale 200 y Ciencias vale 50, así que si se muestran los puntajes crudos tal cual, la materia con más puntos posibles termina dominando todo el panorama. Por eso el boletín convierte los puntajes dispersos a una misma escala y los presenta uno al lado del otro.
Dentro de una red neuronal pasa algo parecido. Cada vez que se atraviesa una capa, los números crecen o se achican a su antojo. Algunas posiciones se disparan hasta varios cientos, y otras quedan pegadas cerca de cero. Si esto pasa así a la siguiente capa, una sola posición disparada puede tragarse todo el juicio.
La normalización de capa es sacar un boletín nuevo cada vez que termina una capa. Corre el promedio de los números de esa posición hasta el centro, achica de forma pareja el ancho en que estaban dispersos, y así los entrega a la siguiente capa.
2En detalle
Cuando la escala se descuadra, el entrenamiento se detiene
Cuanto más profunda la red, más grande se vuelve el problema. Si en una capa se cuela el hábito de inflar los números 1,5 veces, después de atravesar veinte capas ese hábito se multiplica sobre sí mismo y termina siendo miles de veces el valor original. Al revés, si en cada capa el valor se achica un poco, para cuando llega a la última capa ya es casi cero.
El entrenamiento se hace devolviendo el error de la última capa hacia la primera, y ese valor que vuelve sufre exactamente la misma multiplicación. Por eso las primeras capas terminan sin recibir ninguna señal, o reciben una señal de un tamaño imposible de manejar. Si las primeras capas no aprenden, se pierde el sentido de haber apilado tanta profundidad.
La normalización de capa impide que esta multiplicación se acumule: devuelve la escala a su lugar en cada capa. Gracias a eso, aunque se apilen decenas de capas, la primera y la última terminan manejando números de un tamaño parecido.
El criterio está solo dentro de una posición
Aquí, "una posición" es el bloque de números que lleva un solo trozo del texto. Un modelo de lenguaje lleva consigo, por cada trozo, miles de números. La normalización de capa saca el promedio y el ancho de dispersión solo dentro de esos miles, sin mirar nada más.
Lo importante es que no mira al costado. Sin importar cuántas frases se procesen juntas de una vez, ni si la frase es larga o corta, cada posición ajusta su escala mirando solo sus propios números. Por eso, incluso al generar una respuesta metiendo una sola frase, funciona exactamente igual que durante el entrenamiento.
Esta propiedad es especialmente favorable en modelos que manejan textos de largo variable. Los métodos que promedian cruzando varios ejemplos pierden estabilidad cuando se mezclan frases cortas y largas.
Dos perillas para revertir el ajuste
Forzar la escala a un mismo molde puede borrar diferencias de tamaño que el modelo había construido con esfuerzo. Por eso, después de normalizar, se añaden dos perillas. Una vuelve a estirar o a achicar el ancho; la otra desplaza el conjunto entero hacia arriba o hacia abajo.
Estas perillas no las fija una persona: las define el entrenamiento. Si conviene dejar bien marcada la diferencia en cierta posición, el modelo agranda la perilla de esa posición. La normalización no borra información: solo pareja la línea de salida, y cuánto abrirla después queda en manos del modelo.
¿Antes o después de la capa?
La estructura inicial ponía la normalización después de que terminaba el cálculo de la capa. Con esta disposición, cuando la red se volvía muy profunda, el comienzo del entrenamiento se sacudía mucho, y hacía falta un calentamiento: empezar con una tasa de aprendizaje muy pequeña e ir subiéndola despacio.
La disposición que más se usa hoy es la contraria: primero se reajusta la escala antes de entrar en la capa, y el resultado que produce la capa se suma al valor original, sin tocar, que llegó por el atajo. Así, el canal que atraviesa de principio a fin queda limpio, y hasta un modelo muy profundo se entrena de forma estable.
El mismo mecanismo, según dónde se coloque, puede decidir si el entrenamiento funciona o no. Que el lugar donde se inserta importe más que el cálculo mismo de reajustar la escala es una de las lecciones que dejó el trabajo con modelos profundos.
3Con más precisión
La normalización de capa calcula el promedio y la desviación estándar dentro del bloque de rasgos de un solo ejemplo, resta el promedio, divide por la desviación estándar, y vuelve a estirar y a desplazar el resultado con dos valores que se aprenden. Va en dirección justo opuesta a la normalización por lotes, que agrupa el cálculo cruzando varios ejemplos en la misma posición. Los modelos recientes suelen usar una variante más liviana que se salta el paso de restar el promedio y solo ajusta el ancho, y como el cálculo baja sin que casi cambie el rendimiento, se ha vuelto muy popular.
La analogía también tiene sus costuras. Convertir un boletín se hace una sola vez para que se vea bien, pero la normalización de capa se repite tantas veces como capas tenga el modelo, cada vez que se fabrica un solo trozo de respuesta. Además, un boletín informa el puesto por materia, pero la normalización no ordena nada: deja intacta la posición relativa de los números y solo cambia la escala. Por último, aunque el nombre lleve "normalización", el propósito es muy distinto al de la regularización que combate el sobreajuste: este es un mecanismo de estabilidad de cálculo que evita que el entrenamiento se derrumbe.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que es lo mismo que un preprocesamiento que se hace una sola vez antes de meter los datos, pero en realidad se repite cada vez que se atraviesa una capa dentro del modelo.
Es fácil preocuparse pensando que ajustar la escala borra información, pero en realidad la relación relativa entre los tamaños se mantiene intacta, y se puede recuperar lo que haga falta con las perillas aprendidas.
Es fácil pensar que es un mecanismo para evitar el sobreajuste, pero en realidad es un mecanismo de estabilidad que impide que los números se disparen o se desvanezcan en las capas profundas.
7Resumen en una línea
En resumenLa normalización de capa devuelve la escala de los números a su lugar cada vez que se atraviesa una capa, y así permite que una red apilada en profundidad se entrene sin derrumbarse.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02