Modelo de lenguajeLanguage Model

Calcula qué palabra viene después según el texto que la precede

Puntos clave
  • El modelo de lenguaje es un programa que mira el texto que ya se escribió y calcula la probabilidad de la palabra que viene después.
  • Nadie le metió reglas de gramática. Aprendió su propio criterio repitiendo el ejercicio de adivinar la palabra siguiente sobre cantidades enormes de texto.
  • No fija una sola respuesta. Reparte probabilidad entre varios candidatos y elige entre ellos. Por eso la misma pregunta no siempre da la misma respuesta.
  • Cuánto texto anterior alcanza a mirar marca gran parte de su rendimiento. Pasó de mirar dos o tres palabras a mirar un documento entero.
  • Traducir, resumir y responder preguntas se resuelven igual: encadenando la palabra siguiente. Un LLM (Large Language Model, modelo de lenguaje de gran escala) no es más que este mismo modelo llevado a gran tamaño.
Contenido

1La analogía

En el móvil, si escribes "nos vemos a las" aparece encima del teclado una fila de palabras candidatas para seguir: "ocho", "siete", "hora". ¿De dónde sale esa sugerencia? De mirar lo que ya escribiste y calcular qué palabra suele aparecer después, con qué frecuencia. Eso es exactamente lo que hace un modelo de lenguaje.

La sugerencia nunca es una sola palabra. Aparecen varias, en fila. La primera es la candidata más probable y la probabilidad baja según te alejas de esa posición. El modelo de lenguaje también guarda, para cada candidato, el tamaño de esa probabilidad.

Tocas una y la frase crece una palabra; con la frase más larga aparece una sugerencia nueva. Esa repetición sin fin es la respuesta larga que terminamos leyendo.

2En detalle

No puntúa una palabra: puntúa a todos los candidatos a la vez

Lo que entrega un modelo de lenguaje no es una palabra. Es una tabla de puntuaciones que asigna, de una sola vez, "la probabilidad de venir después" a cada fragmento que conoce. Si la lista de fragmentos tiene decenas de miles de entradas, salen decenas de miles de puntuaciones.

Esa tabla se ordena para que todo sume 1. Así se puede leer como "este candidato tiene 40 por ciento, aquel 15 por ciento". Que el teclado solo muestre tres sugerencias es cosa del tamaño de la pantalla: por dentro hay muchísimos más candidatos ordenados por rango.

Si la puntuación se reparte de forma pareja, cualquier palabra encaja de forma natural en ese hueco. Si se concentra en un solo candidato, ese hueco casi no admite otra cosa. El final de un refrán muy conocido es justo ese tipo de hueco.

Nadie le escribió las reglas

No se le cargó ningún libro de gramática. El método de entrenamiento es sorprendentemente simple: se toma un texto, se tapa lo que sigue, se le pide al modelo que adivine la palabra siguiente y, según cuánto se equivocó frente a la respuesta real, se ajustan un poquito sus números internos. Esto se repite miles de millones de veces.

Lo importante es que nadie tiene que etiquetar la respuesta correcta a mano: ya está dentro del propio texto. Por eso se pudo usar tal cual la cantidad descomunal de texto que hay en internet, y eso explica el salto de tamaño que dieron los modelos de lenguaje.

Aprendiendo así no solo entra la gramática. Entran también los hechos y el tono que carga ese texto, porque para acertar la palabra siguiente hace falta saber, hasta cierto punto, cómo es el mundo.

No siempre elige al candidato número uno

¿Qué pasaría si siempre se eligiera al candidato con más puntuación? La frase se pondría rígida enseguida y repetiría las mismas expresiones. Por eso, en la práctica, la puntuación se trata como una probabilidad: el candidato favorito se elige con frecuencia, pero de vez en cuando gana el segundo o el tercero.

Hay un control aparte que regula la fuerza de ese azar. Al máximo, las respuestas se vuelven más variadas pero se cuela algún desvarío; al mínimo, quedan estables pero un poco planas. Por eso la misma pregunta lanzada dos veces puede volver con respuestas distintas.

Cuánto alcanza a mirar hacia atrás marca el nivel

Los métodos iniciales solo miraban las dos o tres palabras anteriores. No podían retomar algo dicho más atrás, como "el libro que pedí prestado ayer en la biblioteca". El sujeto que aparece al principio de la frase se perdía para cuando llegaba el final.

Después llegó una forma de ir arrastrando memoria palabra a palabra, y hoy se impuso un método que pone sobre la mesa, de golpe, todos los fragmentos anteriores y calcula cuánto se relacionan entre sí. Que el rango visible pasara de unas pocas líneas a un libro entero es el mayor cambio de los últimos años.

Traducir y resumir también son, al final, seguir escribiendo

El modelo de lenguaje no trae incorporada una función de traducción aparte. Al calcular con probabilidad qué sigue después de "traduce esta frase al español", lo que sale es una traducción. Resumir y responder preguntas funcionan con el mismo mecanismo.

Por eso lo que se escriba antes cambia mucho el resultado. Es el mismo principio por el que las sugerencias del teclado cambian por completo según lo que ya escribiste.

3Con más precisión

Un modelo de lenguaje es la función que calcula la distribución de probabilidad del siguiente token dados los tokens anteriores. Para cada fragmento entrega una puntuación, la convierte en una probabilidad que suma 1 y elige una entre ellas. Qué tan bien acierta se mide con un valor llamado perplejidad: cuanto más bajo, menos dudó al elegir la palabra siguiente.

No existe solo el modo de escribir de izquierda a derecha. También hay modelos de lenguaje que dejan un hueco en medio de la frase y lo completan mirando ambos lados a la vez; los modelos usados en búsqueda o clasificación aprenden así. El modo que sigue escribiendo es fuerte generando texto; el que completa el centro es fuerte entendiendo el sentido.

La analogía también tiene un límite. Las sugerencias del teclado suelen mirar solo lo que tú mismo escribiste antes y un tramo corto de contexto; el modelo de lenguaje juzga con el criterio que sacó de una cantidad enorme de texto ajeno, y mira de una vez un tramo anterior mucho más largo. Por eso dos personas con el mismo teclado pero costumbres de escritura distintas reciben sugerencias distintas, mientras que un modelo de lenguaje parte del mismo criterio para cualquiera que lo use.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el modelo de lenguaje aprendió reglas de gramática y con eso arma frases, pero en realidad nunca recibió reglas: de tanto repetir el ejercicio de adivinar la palabra siguiente, lo gramatical terminó teniendo más probabilidad.

  • Es fácil pensar que siempre elige la palabra con más probabilidad, pero en realidad introduce variación a propósito, así que la misma pregunta puede volver con una respuesta distinta cada vez.

  • Es fácil pensar que un modelo de lenguaje y un LLM son cosas distintas, pero en realidad es el mismo principio llevado a mucha más escala.

7Resumen en una línea

En resumenEl modelo de lenguaje es como el teclado que sugiere la palabra siguiente: mira lo escrito y le pone probabilidad a lo que viene después, y con ese único truco también traduce y resume.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02