Predicción del siguiente tokenNext-Token Prediction

Adivinar el trozo siguiente a partir de lo ya escrito

Puntos clave
  • La predicción del siguiente token consiste en, viendo el texto que ya está escrito, adivinar solo el trozo que viene justo después.
  • No se señala uno solo a dedo. Se le pone una posibilidad a cada uno de decenas de miles de candidatos, y de ahí se elige.
  • La respuesta correcta ya está dentro del texto original. Por eso la corrección es automática, sin que nadie tenga que anotar la solución.
  • Un solo texto genera tantos problemas como trozos tiene, porque basta con ir corriendo un lugar la parte que se tapa.
  • Al escribir una respuesta se repite lo mismo. Esta tarea tan simple sostiene la traducción, el resumen y la conversación por igual.
Contenido

1La analogía

Dobla por la mitad el tique de la compra y tapa la línea de abajo. Si arriba pone leche, huevos y pan, puedes imaginar qué venía en la línea siguiente: la lista de la compra ya se dibuja sola en tu cabeza. Con solo esas tres palabras, la mente completa el resto casi sin esfuerzo.

Lo bueno de este juego es que corregir sale gratis. Basta con desdoblar el papel: la respuesta ya está impresa ahí. No hace falta buscar una hoja de soluciones ni preguntarle a nadie.

Con un solo tique se pueden plantear muchísimos problemas. Adivinar la segunda línea viendo solo la primera, adivinar la tercera viendo las dos primeras. Salen tantos problemas como líneas. Trasladar este juego al texto es la predicción del siguiente token.

2En detalle

No elige uno: reparte posibilidades

El modelo no señala a dedo un solo candidato para la siguiente posición. A cada uno de los decenas de miles de candidatos de la lista de trozos le pone una puntuación: "así de probable es que venga esto". Después de "hoy el tiempo está muy", "bueno" saca una puntuación alta, "despejado" también bastante, y "cuadrado" muy baja.

Después se elige uno mirando esas puntuaciones. Si siempre se eligiera el primero, la respuesta se volvería rígida y repetiría las mismas palabras. Por eso normalmente se mezcla algo de azar entre los candidatos con puntuación alta. De ahí viene que la misma pregunta reciba, cada vez, respuestas un poco distintas.

Adivina y comprueba al instante

El entrenamiento consiste en repetir este juego una cantidad enorme de veces. Se muestra el texto hasta cierto trozo, se pide adivinar el siguiente y se compara con el trozo real que aparece en el texto original.

Si falla, se ajustan un poquito los números internos del modelo, para que la próxima vez la posibilidad del lado correcto salga algo más alta. Un solo ajuste es tan pequeño que casi no se nota, pero repetirlo miles de millones de veces termina dando resultado.

Lo notable es que aquí no interviene ninguna persona. El problema sale del texto y la respuesta está en ese mismo texto. Cualquier texto que exista en internet se convierte, tal cual, en un libro de ejercicios.

De un solo texto salen problemas a borbotones

Basta con correr un lugar la parte que se tapa para que aparezca un problema nuevo. Un texto con mil trozos da, aproximadamente, mil problemas: se aprovecha el documento entero, hasta el final, sin desperdiciar nada.

Cuánto se muestra por delante también cambia cada vez. Algunos problemas hay que resolverlos viendo solo los tres trozos anteriores, y otros viendo varios cientos. Practicar con contexto corto y con contexto largo se mezcla de forma natural.

La dificultad también varía mucho según la posición. El trozo siguiente a "gracias por" casi está decidido, y cualquiera lo acierta, pero el primer trozo del desenlace de una historia solo se puede intuir sosteniendo todo el contenido anterior. Al mezclarse problemas fáciles y difíciles, seguir resolviéndolos de la misma manera va ampliando por sí solo el rango que se domina.

El punto donde adivinar se vuelve capacidad

Adivinar el siguiente trozo parece trivial. Pero para hacerlo bien hace falta saber cada vez más cosas. Para acertar lo que sigue a "la capital de Francia es" hace falta geografía, y para lo que sigue a "tres más cuatro es" hace falta saber sumar.

En textos largos las exigencias crecen más. Para acertar el trozo siguiente a la última línea de una novela hay que sostener quién hizo qué antes. Al final, de tanto esforzarse por seguir acertando, el conocimiento y el razonamiento terminaron entrando de propina.

Al generar una respuesta se hace lo mismo. Al recibir una pregunta, se elige el trozo que le seguiría, se vuelve a leer el texto con ese trozo pegado, y se elige otro más. Traducir, resumir, conversar: por dentro, en todos los casos ocurre solo esto.

3Con más precisión

El último paso del modelo entrega un bloque de puntuaciones para la lista de trozos entera. Convertir esas puntuaciones en una proporción que sume 1 da la probabilidad del siguiente trozo. Entrenar es mover un poco los números internos para que suba la probabilidad asignada al trozo correcto, y a la medida de esa distancia se le llama pérdida.

La analogía también tiene sus costuras. El tique ya está impreso del todo, así que la respuesta es una sola y está fija, pero en un texto puede haber varias palabras posibles a continuación: después de "hoy el tiempo está muy" hay muchas que resultan naturales. Por eso el entrenamiento no busca memorizar una única respuesta, sino repartir peso de forma pareja entre los candidatos que suenan plausibles. Además, el modelo solo mira el siguiente trozo, uno; no planea la frase entera de antemano. Dónde va a terminar la respuesta también se decide mientras se escribe. Y la unidad que se adivina no es la palabra, sino un trozo más pequeño, así que completar una sola palabra a veces necesita varias predicciones seguidas.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el modelo sabe con certeza cuál es la siguiente palabra, pero en realidad reparte posibilidad entre todos los candidatos y elige entre ellos, así que la misma pregunta puede recibir respuestas distintas.

  • Es fácil pensar que con solo adivinar el siguiente trozo no se pueden hacer cosas difíciles, pero en realidad, para acertar bien, hace falta conocimiento, cálculo y comprensión del contexto, y esa capacidad crece junto con la tarea.

  • Es fácil pensar que la respuesta ya está lista de antemano y solo se muestra letra por letra, pero en realidad ese trozo se está decidiendo justo en el instante en que aparece en pantalla.

7Resumen en una línea

En resumenLa predicción del siguiente token consiste en, viendo solo el texto anterior, repartir posibilidad y elegir el trozo que viene justo después, y casi todo lo que hace un modelo de lenguaje se apoya en esta repetición.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02