AutorregresiónAutoregressive
Releer lo escrito para encadenar el siguiente trozo
- La autorregresión consiste en releer lo que se acaba de escribir para decidir el siguiente trozo. Es la forma en que hoy escribe la IA conversacional.
- No arma la frase de una sola vez: pega un trozo, relee todo desde el principio y pega otro.
- Como lo anterior debe fijarse antes que lo siguiente, no se pueden generar varios trozos a la vez. Por eso las respuestas largas tardan más.
- Un trozo ya pegado no se deshace. Si algo se tuerce al principio, el error se arrastra y el relato sigue sonando convincente.
- Al leer la pregunta puede verse todo de una vez. Se lee entero, pero se escribe trozo a trozo.
Contenido
1La analogía
Hay un juego que se juega en los chats grupales: una persona escribe una frase, la siguiente añade otra, y entre todos arman una historia, un renglón a la vez. Pero imagina ese chat con un solo participante.
Así juega esa única persona. Sube hasta arriba del chat y relee todo lo que se ha escrito hasta ese momento, empezando por el principio, incluida la línea que ella misma acaba de mandar. Después decide qué línea añadir a continuación —solo una— y la envía. En cuanto la envía, vuelve a leer todo desde el principio y añade otra línea más.
Esa repetición es la autorregresión. Lo que se manda al chat no se puede borrar. Si en la tercera línea la historia se desvía hacia algo disparatado, desde ese punto en adelante la IA sigue escribiendo como si ese disparate fuera parte de la premisa.
2En detalle
Solo se decide un trozo a la vez
Lo que hace el modelo al generar una respuesta es más simple de lo que parece. Lee todo el texto que existe hasta ese momento, le pone una puntuación a cada candidato para el siguiente trozo según lo verosímil que sea, y elige uno para pegarlo al final. Hasta aquí, un paso.
Cuando termina un paso, el texto es un trozo más largo. Ahora vuelve a leer ese texto alargado desde el principio y repite exactamente lo mismo. Si la respuesta tiene cien trozos, este paso se repite cien veces.
No hay un plan de la frase entera escrito de antemano al que solo falte transcribir. Ni siquiera dónde termina la frase está decidido de entrada: se define en el momento en que, dando estos pasos, sale elegido el trozo del punto final o el trozo de cierre.
Lo que ella misma escribe vuelve a ser la entrada
Aquí está la razón del nombre autorregresión. La salida del modelo se convierte, de inmediato, en su propia entrada siguiente. Nadie añade nada nuevo desde fuera: el modelo recibe de vuelta lo que él mismo acaba de generar.
Por eso los primeros trozos condicionan mucho la dirección de toda la respuesta. Si empieza con "Claro que sí", lo que sigue tiende a sonar explicativo; si abre con "Lo siento, pero", tiende a inclinarse hacia una negativa. La técnica de escribir de antemano el comienzo de la respuesta en el prompt funciona bien precisamente por esta propiedad.
La misma propiedad también genera problemas. Si al principio se cuela un nombre que no es real, las frases siguientes lo dan por hecho y siguen construyendo la historia sobre esa base. Así es como un error se vuelve cada vez más convincente.
El punto sin retorno
Una persona que escribe puede volver atrás y corregir una frase anterior. La autorregresión no tiene ese paso. Un trozo, una vez pegado, se queda ahí, y el modelo solo puede pensar sobre lo que ya está escrito.
Por eso a veces se hacen avanzar varios caminos posibles a la vez y, al final, se elige el mejor. También existe el método de dejar que el modelo termine la respuesta entera y luego se revise y la reescriba él mismo. Que los modelos de razonamiento escriban un largo proceso de pensamiento antes de la respuesta va en esa dirección: si no se puede deshacer, mejor dar bastantes vueltas por adelantado.
Por qué escribir es tan lento
Leer una pregunta y escribir una respuesta tienen velocidades muy distintas. La pregunta ya está completa en trozos, así que se puede meter entera y procesar de una vez. La respuesta, en cambio, necesita que el trozo anterior esté fijado antes de poder empezar el siguiente.
Por eso cada trozo obliga a atravesar el modelo entero una vez más. Decenas de capas, miles de millones de pesos, solo para conseguir un trozo. Si la respuesta se duplica en longitud, el tiempo de espera también se duplica. El streaming que hace que el texto aparezca fluyendo en pantalla no oculta este paso a paso: simplemente lo muestra tal cual es.
Existen otras formas
No toda generación funciona así. La difusión, muy usada en imágenes, retoca la imagen entera un poquito a la vez. Como todo el lienzo mejora al mismo tiempo desde el principio hasta el final, no hay un orden fijo. En el texto también se investigan enfoques parecidos que retocan todo a la vez.
Aun así, en el texto la autorregresión sigue siendo la que más se usa. El entrenamiento es más simple y lo que se genera mantiene mejor la coherencia de principio a fin.
3Con más precisión
Un modelo autorregresivo, condicionado en la secuencia de tokens que existe hasta ese momento, entrega una distribución de probabilidad para el siguiente token, y repite el gesto de tomar uno de esa distribución y pegarlo al final. Ajustes como la temperatura o el top-p son las palancas que deciden cómo se elige dentro de esa distribución. Al entrenar, como ya existe la frase correcta completa, se puede enseñar todas las posiciones a la vez; solo hace falta una máscara que impida ver por adelantado lo que viene después.
La analogía también tiene sus costuras. Quien relee el chat grupal repasa todo con la vista cada vez, pero el modelo guarda calculado lo que ya procesó y solo calcula de nuevo el trozo recién añadido. Por eso, en la práctica, no se vuelve más lento en cada paso por tener que releer el texto entero. Además, una persona se adelanta mentalmente a la frase siguiente, pero un modelo autorregresivo no guarda de forma explícita ningún plan que vaya más allá del próximo trozo. También hay esfuerzos activos por reducir el número de pasos, como hacer que un modelo pequeño escriba varios trozos de antemano y que uno grande confirme de una vez si son correctos.
4Pruébalo
- LLM Visualization (disección en 3D de un modelo) ailearn.space Sigue paso a paso qué recorre el modelo por dentro mientras se genera un solo trozo
- WebLLM Chat (una IA de chat que corre en el navegador) ailearn.space En equipos lentos se nota muy bien que la respuesta no llega de golpe, sino pegada trozo a trozo
5Malentendidos comunes
Es fácil pensar que la IA arma toda la respuesta de antemano y solo la muestra despacio, pero en realidad cada trozo se genera y se envía ahí mismo, uno a la vez.
Es fácil pensar que, si la respuesta sale mal, la IA corrige lo anterior por su cuenta, pero en realidad no puede deshacer un trozo ya escrito: solo puede seguir construyendo sobre él.
Es fácil pensar que con una computadora mejor la respuesta llegaría de golpe, pero en realidad lo anterior debe fijarse antes que lo siguiente, así que el número de pasos no se reduce.
7Resumen en una línea
En resumenLa autorregresión es releer una y otra vez lo que la IA misma escribió para decidir solo el siguiente trozo, y de ahí salen tanto su lentitud como sus errores convincentes.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02