Ley de escaladoScaling Law

Regla que muestra cuánto mejora el rendimiento al crecer la escala

Puntos clave
  • La ley de escalado muestra cuánto sube el rendimiento al agrandar el tamaño del modelo, los datos de entrenamiento y el cálculo invertido.
  • Agrandar solo uno de los tres se frena enseguida. Hace falta agrandarlos juntos para que la mejora siga.
  • La curva de mejora es suave, así que unos pocos experimentos chicos alcanzan para estimar el resultado de un experimento mucho más grande.
  • Por eso se puede decidir de antemano en qué gastar un presupuesto limitado. Ahí está la verdadera utilidad de esta regla.
  • El tramo de mejora se va achicando. Duplicar el tamaño no duplica el rendimiento.
Contenido

1La analogía

Si a una planta en maceta le echas litros de agua para que crezca rápido, se le pudren las raíces. Cambiarla a una maceta más grande tampoco la hace crecer en la misma proporción, y si el rincón no recibe luz, de nada sirve el tamaño de la maceta. El tamaño de la maceta, el agua y las horas de sol tienen que acompañarse entre sí para que la planta crezca.

Después de unos meses cuidándola, se agarra el ritmo de cuánto crece al mes. Se puede imaginar más o menos cómo estará para fin de verano, y con ese cuadro se puede decidir de antemano cuándo cambiarla de maceta o cuánto abono comprar.

La ley de escalado es justamente ese cálculo. Cuando se agrandan juntos el tamaño del modelo, la cantidad de texto que se le da y el tiempo de cálculo invertido, cuánto mejora el rendimiento aparece dibujado en una curva sorprendentemente suave. Eso sí, duplicar el tamaño de la maceta no duplica la altura de la planta. No se recupera exactamente lo que se puso.

2En detalle

Los tres hay que agrandarlos juntos

Al hablar de agrandar un modelo, hay a grandes rasgos tres cosas que se pueden aumentar: la cantidad de valores dentro del modelo, la cantidad de texto que se le da y el total de cálculo invertido en entrenarlo.

Los tres están entrelazados. Si a un modelo grande se le muestra poco texto, termina memorizando lo que vio de memoria y se queda débil frente a frases que nunca vio. Si a un modelo pequeño se le vuelca demasiado texto, el recipiente se le queda corto y deja de mejorar a partir de cierto punto. Y si el tiempo de cálculo no alcanza, aunque los otros dos estén listos, el entrenamiento termina a medio hacer.

Por eso agrandar solo uno choca contra una pared enseguida. Durante un tiempo el peso recayó en agrandar el tamaño del modelo, pero después se confirmó que, con el mismo presupuesto de cálculo, conviene más dejar el modelo un poco más chico y mostrarle mucho más texto.

La mejora se dibuja en una curva suave

Lo sorprendente de esta regla es que el resultado no sale a los saltos. Si se experimenta multiplicando por varias veces el tamaño o los datos, el valor que mide el rendimiento no baja en escalones ni a los tumbos: dibuja una curva suave. La misma forma se repite a lo largo de varios órdenes de magnitud.

Que la curva sea suave significa que se puede predecir. Con unos pocos puntos de entrenamientos chicos ya se puede trazar una línea y estimar dónde va a caer una escala mucho más grande.

Eso sí, la curva se va acostando cada vez más. Al principio, con agrandar un poco ya se nota una mejora clara; más adelante hace falta multiplicar por diez para ganar apenas un poco. Eso significa que se entra en un tramo donde, cuanto más se paga, menos se gana.

Por eso se puede repartir el presupuesto de antemano

Entrenar un modelo grande es difícil de revertir una vez que arranca. Se invierten meses y una cantidad enorme de cálculo, y si al final se descubre que la configuración estaba mal, la pérdida es grande.

Aquí la ley de escalado funciona como un mapa. Con una cantidad de cálculo fija, se puede calcular de antemano en qué proporción conviene repartir ese presupuesto entre tamaño del modelo y cantidad de datos. El resultado de unos pocos experimentos chicos sirve para estimar el de uno grande, y el diseño se cierra según esa estimación.

También se hace al revés: fijar una meta y calcular hacia atrás el presupuesto necesario. Si se necesita tal rendimiento, se calcula más o menos qué tamaño y qué cantidad de datos hacen falta. La decisión de agrandar la escala dejó de ser una corazonada para volverse un cálculo.

Lo que la regla no dice

Lo que muestra esta curva es un valor muy básico, algo como "qué tan bien acierta la palabra siguiente". Capacidades que de verdad nos interesan, como si traduce bien o si resuelve un problema largo hasta el final, se relacionan con ese valor de forma bastante suelta.

Tampoco dice cuándo va a aparecer una capacidad concreta. Algunas tareas parecen no funcionar en absoluto hasta que se cruza cierta escala, y de golpe empiezan a funcionar. La curva de fondo es suave, pero la capacidad que se ve por fuera aparece a los saltos, y eso hace difícil anticiparla.

La calidad de los datos tampoco entra en la curva. Con la misma cantidad, un texto bien depurado da resultados bastante mejores. Además, el texto escrito por personas es un recurso limitado, así que agrandarlo sin fin no es un camino abierto. Por eso el interés se corrió, en parte, de agrandar el entrenamiento a invertir más cálculo en el momento de responder.

3Con más precisión

La ley de escalado es una regla empírica que describe la relación entre el tamaño del modelo, la cantidad de datos, el cálculo y el error de entrenamiento. No es algo demostrado que se cumpla siempre como una ley de la naturaleza: es una regularidad que se observó una y otra vez en muchos experimentos. El eje vertical suele medir qué tan bien se acierta la palabra siguiente, y al poner los ejes en escala logarítmica, la curva se ve casi como una línea recta.

La analogía también tiene sus límites. La planta en maceta deja de crecer al alcanzar su tamaño adulto, pero esta curva no tiene un final visible. En cambio hay un piso que ningún gasto logra cruzar, y la curva solo se le va acercando cada vez más. Además, a la planta el agua extra se le nota el mismo día, pero con el modelo hay que terminar todo el entrenamiento para conocer el resultado. Y sobre todo, que la curva mejore y que la respuesta sea correcta son cosas distintas: agrandar la escala no hace desaparecer solo el problema de inventar hechos que no existen.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que con solo agrandarlo ya mejora, pero en realidad, si no se agrandan también los datos y el cálculo, enseguida se queda estancado.

  • Es fácil pensar que, por llamarse ley, se cumple siempre, pero en realidad es una regla observada en muchos experimentos, así que puede fallar si cambian las condiciones.

  • Es fácil pensar que la curva dice cuándo va a aparecer una capacidad, pero en realidad solo muestra la mejora de un valor básico.

7Resumen en una línea

En resumenLa ley de escalado es la regla que deja ver de antemano cuánto va a mejorar el rendimiento cuando se agrandan juntos el tamaño, los datos y el cálculo.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02