AutoatenciónSelf-Attention

Las palabras de una frase se consultan entre sí

Puntos clave
  • La autoatención es la forma en que las palabras de una misma frase se consultan entre sí. No trae información de fuera.
  • Cada posición de la frase es, a la vez, la que pregunta y la que responde. No es una estructura donde solo un lado pregunta.
  • Al terminar de consultarse, el contenido de cada posición se reescribe con el contexto ya incorporado. Las mismas letras cambian si la frase es distinta.
  • Todas las posiciones hacen esto al mismo tiempo. No hay que esperar turno de principio a fin, así que el entrenamiento se volvió mucho más rápido.
  • Repetir este proceso en varias capas amplía el alcance de la consulta hasta captar la estructura de la frase entera.
Contenido

1La analogía

En un mismo edificio, cada vivienda tiene su buzón. Si la vivienda 3 reparte una nota que dice "¿cómo se llamaba nuestro perro?", las demás viviendas cuelgan su respuesta, cada una con lo que sabe, en su propio buzón. La vivienda 3 recoge esas respuestas y con ellas vuelve a redactar lo que dice en su placa de la puerta. La autoatención es esta estructura: las notas solo circulan dentro del mismo edificio.

Lo importante es que todos hacen esto a la vez. No pregunta solo la vivienda 3: la 1, la 2 y la 4 también reparten su nota y también recogen sus respuestas. Todos son, al mismo tiempo, quien pregunta y quien responde.

Aquí no llega correo de fuera, del cartero de la ciudad. No entra información nueva: es la información que ya estaba repartida dentro del edificio la que encuentra su lugar.

2En detalle

Circula dentro, no fuera

La atención en sí se usó primero para conectar dos grupos distintos: al traducir, unía las palabras del texto original con las del texto traducido. Quien preguntaba y quien respondía eran frases diferentes.

La autoatención juntó esos dos lados en uno. Quien pregunta y quien responde son la misma frase. De ahí el nombre, "sobre sí misma". Este cambio, tan simple, hizo posible la estructura del transformer, y casi todos los modelos de lenguaje actuales se apoyan en ella.

Cada posición cumple tres papeles a la vez

Cada posición produce tres cosas: una nota que dice "esto es lo que busco", una etiqueta que dice "esto es lo que tengo" y el contenido real que va a entregar. Es como si un mismo buzón enviara la carta, colgara la etiqueta y preparara además el contenido de la respuesta.

Cuanto mejor encajan la nota y la etiqueta, mayor es el peso de la respuesta que llega desde esa posición. Como los pesos suman 1, si una posición se consulta mucho, las demás se consultan automáticamente menos.

Las tres cosas se extraen del mismo original, cada una de forma distinta. Cómo extraerlas se decidió durante el entrenamiento.

Al recoger las respuestas, el contenido cambia

Cuando terminan de llegar las respuestas, el contenido de cada posición ya no es el mismo de antes. Lo recogido se mezcla según su peso y se incorpora al propio contenido. Así, la posición de "eso" queda impregnada con fuerza de la información de "pastel", mencionado antes, y la posición de "luminoso" se impregna de si lo anterior era una habitación o un carácter.

Aquí ocurre que una misma letra pase a significar algo distinto según la frase. Sola, la palabra "vela" tiene varios sentidos, pero al recoger las respuestas de las palabras de alrededor queda claro si se trata de encender una en casa o de izarla en un barco.

Todas trabajan a la vez

El método anterior tenía que procesar la primera palabra antes de pasar a la segunda: era una fila esperando turno. La autoatención no tiene ese orden. Como cada posición mira a todas las demás a la vez, todo se puede calcular simultáneamente.

Este punto trajo el cambio más grande en la práctica. Encajó justo con la capacidad de los chips de cálculo para procesar miles de tareas a la vez, y el entrenamiento se volvió incomparablemente más rápido. Es la razón práctica por la que hoy existen modelos tan grandes.

A cambio, se pierde la información de orden. Si todas se miran a la vez, no se sabe quién va antes y quién después. Por eso hay que añadir, aparte, una marca de orden a cada posición.

Capa tras capa, la vista se amplía

No termina con recoger respuestas una sola vez. Con el contenido ya actualizado, se reparte otra nota y se repite el proceso en varias capas. En la segunda capa ya se intercambia contenido con contexto incorporado, así que se pueden ver relaciones mucho más amplias.

Se observa que las capas de abajo captan sobre todo la relación con la palabra de al lado o las parejas gramaticales, mientras que hacia arriba se capta más el tema general o el hilo lógico de la frase. Lo que cada capa mira cambia un poco en cada nivel.

3Con más precisión

La autoatención es la atención en la que la consulta, la clave y el valor se generan todos a partir de la misma entrada. Se compara la consulta de cada posición con las claves de todas las posiciones para obtener una puntuación, se reduce una vez según el tamaño del vector, el softmax la convierte en pesos que suman 1, y con esos pesos se promedian los valores. En los modelos que escriben texto de forma continua, se tapa lo que va después de cada posición.

El cálculo crece en proporción al cuadrado del número de posiciones: si la frase se duplica, los pares a comparar se cuadruplican. Por eso el costo de manejar contextos largos sube de golpe, y siguen apareciendo variantes para reducirlo.

La analogía también tiene sus costuras. En el edificio hay una persona en cada vivienda que lee y juzga la respuesta, pero en la autoatención no hay nadie que juzgue: los pesos salen solos de multiplicar y sumar números ajustados en el entrenamiento. Tampoco hay un orden real en el reparto de notas: un único cálculo matricial procesa todos los pares a la vez.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la autoatención trae información de fuera de la frase, pero en realidad solo intercambian información las posiciones que ya están en la entrada.

  • Es fácil pensar que se consulta más a las palabras cercanas, pero en realidad el peso se decide sin importar la distancia, y una palabra lejana puede consultarse mucho más.

  • Es fácil pensar que atención y autoatención son lo mismo, pero en realidad la atención es el concepto más amplio, y solo es autoatención cuando quien pregunta y quien responde coinciden.

7Resumen en una línea

En resumenLa autoatención es como los buzones de un mismo edificio: las palabras de la frase se preguntan y se responden entre sí, y cada una reescribe su contenido con el contexto ya incorporado.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02