Ajuste por instruccionesInstruction Tuning

Etapa donde el modelo aprende a responder según la instrucción

Puntos clave
  • El ajuste por instrucciones enseña a un modelo que ya sabe usar el idioma a responder según la instrucción que recibe.
  • El material de entrenamiento son pares de instrucción y respuesta adecuada, escritos o revisados por personas.
  • Un modelo que no pasó por esta etapa, al recibir una pregunta, sigue escribiendo frases parecidas en vez de responder.
  • No es el lugar donde se agrega conocimiento nuevo. Se aprende con qué forma sacar lo que ya sabe.
  • Después de esta etapa viene otra que pule el tono de la respuesta según las preferencias de las personas.
Contenido

1La analogía

La noche antes del estreno, el elenco se junta a ensayar. En ese ensayo no se enseña a actuar por primera vez: los diálogos y las emociones ya los saben todos. Lo que se ajusta es la coordinación: entrar cuando el director de escena hace una seña, moverse de lugar cuando cambia la luz, esperar si no hay ninguna señal.

Una IA pasa por una etapa parecida. Ya tiene la capacidad de leer una cantidad enorme de texto e ir encadenando palabras. Pero que entienda una instrucción de una persona como una señal y devuelva la respuesta adecuada a esa señal es otra cosa aparte. Por eso se hace pasar por una etapa donde se ajusta la coordinación con material que empareja instrucciones con la respuesta adecuada. Eso es el ajuste por instrucciones.

Un actor que termina el ensayo no ganó más talento actoral. Sigue teniendo el mismo talento, solo que ahora se mueve según la señal. Un modelo que pasa por esta etapa tampoco sabe más cosas: lo que cambia es el momento y la forma en que saca lo que ya sabía.

2En detalle

En qué estado está el modelo antes del ensayo

Un modelo que terminó de entrenarse con una cantidad enorme de texto es un maestro de seguir escribiendo. Le des la frase que le des, agrega una frase siguiente verosímil. El problema es cuando lo que quiere la persona no es que siga escribiendo.

Si a un modelo así le escribes "enséñame cómo hacer una tortilla de patatas", en vez de la receta puede seguir encadenando cosas como "y también cómo hacer una tortilla francesa" o "¿y qué tal una ensalada de acompañamiento?". No entendió el pedido como un pedido: siguió escribiendo lo que suele venir después de esa frase.

Es como un actor que dice muy bien sus diálogos fuera del escenario, pero no conoce la seña de entrada. No es que le falte talento: no conoce la regla de coordinación.

El guion del ensayo son pares de instrucción y respuesta

El material de entrenamiento viene en pares: de un lado va una instrucción que una persona podría dar, y del otro una buena respuesta que le corresponde. El modelo ve muchísimos de estos pares y aprende que después de una instrucción viene una respuesta con esta forma.

Las instrucciones cubren un rango muy amplio: resume esto, ordénalo en una tabla, dilo con otras palabras, explica por qué es así, o pregunta de vuelta porque no se cumple una condición. También hay pares donde, ante una pregunta difícil, lo correcto es admitir que no se sabe.

Importa más la variedad que la cantidad de pares. Si solo se meten instrucciones parecidas, el modelo queda diestro solo en ese formato, como ensayar veinte veces la misma escena y no tocar el resto de la obra.

No es el lugar para meter conocimiento nuevo

Es fácil confundir esta etapa con inyectar conocimiento, pero lo que de verdad crece es la forma y la actitud. Si lo que se quiere es que el modelo maneje contenido que no sabe, como normas internas de una empresa, conviene más buscar ese material y ponerlo al lado.

Claro que si se meten muchas instrucciones de un campo concreto, el modelo se acostumbra al tono y al formato de ese campo, pero el efecto de memorizar hechos es chico, y si el material tiene contenido erróneo, ese error también se le pega.

Es como el ensayo, que no hace crecer mucho el talento actoral del elenco: el recorrido y las señales quedan bien grabados, pero la voz misma no cambia.

Es de otra capa que dar instrucciones con el prompt

Escribir bien la instrucción mejora la respuesta del modelo. Eso se parece a hacer una seña con la mano, ahí mismo, sobre el escenario. Hay que volver a avisar cada vez, y desaparece en cuanto empieza una conversación nueva.

El ajuste por instrucciones es el lado que hace que se mueva así sin necesidad de esa seña. Los valores internos del modelo cambian un poco, y con eso basta una instrucción corta para responder con el largo y la forma adecuados. Que las cosas funcionen solo con la instrucción, sin necesitar ejemplos pegados, se lo debe a esta etapa.

Las dos cosas no se reemplazan entre sí. Incluso a un modelo ya bien ajustado, una instrucción clara le sigue marcando una gran diferencia.

Se conecta con la etapa siguiente

Al terminar esta etapa, el modelo sigue bien las instrucciones, pero el tono de la respuesta todavía es tosco. Cuando dos respuestas cumplen igual la instrucción y una se lee mucho mejor que la otra, el criterio para distinguir cuál es mejor todavía no se aprendió aquí.

Por eso viene una etapa más después. Personas comparan varias respuestas, eligen la mejor, y esa preferencia se usa para pulir el tono de la respuesta. Se llama RLHF (Reinforcement Learning from Human Feedback, aprendizaje por refuerzo con retroalimentación humana).

Es como, después de coordinar la puesta en escena con el ensayo, ajustar la intensidad y el ritmo de la actuación viendo la reacción del público. La etapa anterior se encarga de la forma; esta, del matiz.

3Con más precisión

El ajuste por instrucciones es un entrenamiento adicional supervisado con pares de instrucción y respuesta. Ajusta un poco los valores obtenidos en el preentrenamiento, sin sacudirlos demasiado. La cantidad de material es muy chica en comparación: bastan unos pocos miles de buenos pares para que el resultado cambie de forma notable. Últimamente se mezclan pares escritos por personas con pares generados por un modelo grande, y a veces se filtran automáticamente los pares de peor calidad antes de usarlos.

La analogía también tiene sus límites. Un actor entiende y recuerda la regla, pero el modelo no entiende tanto como que se le ajusta un valor hasta que resulta natural que a esta instrucción le siga esta respuesta. Por eso sigue bien una instrucción parecida a las del guion, pero puede desmoronarse ante una muy distinta en tono. Además, el ensayo se hace una sola vez, mientras que esta etapa se repite, retocando el material, cada vez que sale un modelo nuevo, y si se entrena mucho tiempo con un solo tipo de par, la capacidad amplia que se ganó en el preentrenamiento se puede desdibujar.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el ajuste por instrucciones mete conocimiento nuevo, pero en realidad se acerca más a aprender con qué forma sacar lo que ya se sabe.

  • Es fácil pensar que es lo mismo que escribir un buen prompt, pero en realidad, si el prompt es la instrucción de cada momento, esta etapa es un ajuste que queda incorporado al propio modelo.

  • Es fácil creer que, tras esta etapa, el modelo hace cualquier cosa que se le pida, pero en realidad también se incluyen en el material situaciones donde conviene preguntar de vuelta o rechazar el pedido.

7Resumen en una línea

En resumenEl ajuste por instrucciones es como el ensayo que coordina a actores que ya saben actuar para que se muevan con la seña, y hace que el modelo entienda la instrucción como una señal y responda con la forma adecuada.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02