GPT

Modelo de lenguaje que sigue escribiendo mirando solo hacia atrás

Puntos clave
  • GPT (Generative Pre-trained Transformer, transformer generativo preentrenado) es un modelo de lenguaje construido para seguir escribiendo un fragmento a la vez mirando solo el texto anterior.
  • El nombre completo es también la estructura: genera (Generative), se preentrena de antemano (Pre-trained) y está hecho con la arquitectura transformer.
  • No ve nada de lo que viene después. Aprendió a adivinar el fragmento siguiente con esa parte tapada, porque nunca escribió nada todavía.
  • Cada vez que agrega un fragmento, vuelve a leer desde el principio todo lo que lleva escrito. Por eso se hace más lento cuanto más larga es la respuesta.
  • No fabrica un modelo distinto para cada tarea. Con un único modelo ya entrenado traduce, resume y conversa.
Contenido

1La analogía

Habrás recibido alguna vez una tarjeta de sellos con diez casillas. El sello siempre se pone en la primera casilla vacía, empezando por la izquierda. Nunca se sella primero la sexta casilla, ni se borra un sello ya puesto para volver a ponerlo.

Con solo mirar la tarjeta se sabe dónde va el próximo sello: lo que ya está sellado define esa única casilla siguiente. Las casillas que todavía no llegaron no sirven de nada para decidir, porque están vacías.

Así escribe GPT. Vuelve a mirar entera la tarjeta ya sellada y estampa la casilla siguiente; con la tarjeta actualizada, vuelve a mirarla desde el principio y estampa la que sigue. Nunca salta adelante ni retrocede: solo repite ese mismo gesto, una y otra vez, hasta llenar la tarjeta entera.

2En detalle

El nombre completo describe la estructura

Al final está transformer, el esqueleto. Es el método que decide cuánto se fija cada fragmento de la frase en los demás, y hoy lo usa la mayoría de los modelos de lenguaje.

En el medio está el preentrenamiento, que marca el orden. Antes de saber quién va a preguntar qué, el modelo dedica una etapa a formar su base con una cantidad enorme de texto. Se construye antes de decidir para qué se va a usar.

Al principio está generativo, que describe la tarea. En vez de elegir entre opciones ya dadas, crea texto que no existía. Juntando las tres piezas queda: "un modelo hecho con transformer, preentrenado de antemano, que sigue escribiendo texto".

Solo mira hacia atrás y avanza en una sola dirección

Para GPT, lo que viene después de la posición actual es como si no existiera. Así se entrenó: con la parte de atrás tapada, adivinando el fragmento que sigue. Si la respuesta estuviera al lado, no serviría como ejercicio.

Tampoco vuelve atrás a corregir un fragmento ya puesto. Una persona escribe, borra una frase anterior y la reescribe; GPT deja el sello ya puesto tal cual y solo sigue pegando encima. Por eso, si el texto empieza a desviarse, sigue adelante tomando incluso esa desviación como parte del texto anterior.

Claro que si le pides "corrige la frase anterior así", lo hace. Pero eso es seguir escribiendo de nuevo con la corrección incluida, no volver atrás y modificar letras que ya salieron.

En cada fragmento vuelve a mirar la tarjeta entera desde cero

Cada vez que suma un fragmento, GPT relee todo el texto que lleva hasta ese momento. Al elegir el décimo fragmento está mirando a la vez los otros nueve; al elegir el centésimo, mira los otros noventa y nueve.

Por eso, cuanto más larga es la respuesta, más trabajo cuesta producir cada fragmento nuevo. Esa sensación de que el texto sale fluido en pantalla y luego se frena un poco hacia el final viene de ahí. Si además la conversación se alarga, cada vez hay que releer también lo anterior, y la carga crece todavía más.

También hay un tope a la cantidad que puede leer de una vez. Si la conversación pasa ese límite, lo más viejo se queda afuera. Después de hablar un buen rato, la sensación de que olvidó una condición que se dio al principio viene de que esa parte ya no está en la tarjeta.

Un solo modelo sirve para muchas cosas

Antes se hacía un traductor, un resumidor y un clasificador de emociones por separado. GPT invierte eso: primero se construye un modelo con base sólida y después, cambiando solo la instrucción, se le piden distintas tareas.

Al mismo modelo, si le dices "tradúcelo al inglés" se vuelve traductor, y si le dices "resúmelo en tres líneas" se vuelve resumidor. No hace falta construir un modelo nuevo por cada función que se añade, y ese es el motivo por el que los modelos de lenguaje se expandieron tan rápido a tantos campos.

3Con más precisión

GPT también es el nombre de un producto concreto, pero aquí se trata la estructura que hay detrás. Se refiere a apilar solo la parte decodificadora del transformer y entrenarla, con la parte posterior tapada para que solo vea el contexto anterior, a adivinar el fragmento siguiente. Después de ese entrenamiento suele añadirse una etapa más para que siga bien las instrucciones de una persona.

La analogía también tiene sus límites. En la tarjeta de sellos la casilla siguiente está fijada de antemano, pero GPT asigna una probabilidad a decenas de miles de candidatos posibles para el fragmento siguiente y elige entre ellos, así que el mismo texto de entrada puede dar respuestas algo distintas cada vez. Además, un sello queda puesto para siempre, mientras que para el modelo todo el texto anterior es una entrada que se vuelve a leer cada vez: no queda ninguna marca grabada en algún lugar.

Como el nombre se hizo tan conocido, a veces se usa como si nombrara a toda la inteligencia artificial conversacional, pero GPT en realidad nombra solo una de esas ramas. Modelos hechos con el mismo método aparecen en distintos lugares con nombres distintos.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que GPT piensa toda la respuesta de antemano y luego la suelta, pero en realidad solo repite la tarea de decidir un fragmento a la vez, así que hasta dónde se corta la frase también se decide mientras escribe.

  • Es fácil pensar que GPT busca en internet en tiempo real para responder, pero en realidad sigue escribiendo a partir de lo que ya aprendió de antemano, y la búsqueda es una función aparte que se le añade.

  • Es fácil pensar que GPT recuerda el contenido de la conversación, pero en realidad cada vez vuelve a leer entera la conversación hasta ese punto, así que lo que queda fuera de ese tramo desaparece.

7Resumen en una línea

En resumenGPT es una forma de modelo de lenguaje que, con un transformer ya preentrenado, mira solo el texto anterior y sigue pegando un fragmento a la vez.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02