Vision Transformer

La estructura que corta la foto en trozos y los trata como texto

Puntos clave
  • El Vision Transformer corta la foto en trozos del mismo tamaño y los pone en fila, como si fueran las palabras de un texto.
  • A cada trozo se le agrega una marca que indica dónde estaba originalmente. Sin ella, se pierde la información de posición.
  • A diferencia de recorrer de cerca hacia afuera, desde el primer paso compara incluso los trozos más lejanos entre sí.
  • No trae ningún hábito previo sobre las fotos, así que necesita muchísimos datos para rendir de verdad.
  • Cuando aumentan los trozos, la cantidad de pares que hay que comparar crece mucho más rápido, y el cálculo se vuelve pesado.
Contenido

1La analogía

En un puerto, la carga que llega no se mueve toda junta. Se reparte en cajas del mismo tamaño y a cada caja se le pone un número. Desde ese momento, la sala de control ya no trabaja con la carga en sí, sino con una lista de cajas numeradas.

El Vision Transformer tampoco mira la foto entera de una sola vez. La corta en trozos cuadrados del mismo tamaño, los alinea en fila y le pone a cada uno un número que indica de qué lugar exacto vino.

Tratarlo como lista hace que la distancia desaparezca. La caja de un extremo del muelle y la del otro extremo, en la lista, son solo dos renglones, así que la sala de control puede comparar ambas de inmediato, una junto a la otra, sin tener que caminar por todo el patio.

2En detalle

Corta la foto en trozos del mismo tamaño

El primer paso es cortar. La foto se divide, muy apretada, en cuadrados de unos pocos píxeles de lado. En una foto grande pueden salir varios cientos de trozos. Los trozos no se superponen ni dejan huecos, así que, si se juntan todos de nuevo, se reconstruye la foto original completa.

Cada trozo es, en el fondo, un grupo de puntos de color. Ese grupo se comprime en una sola fila de números. Después de este paso, una foto se convierte en varios cientos de filas de números.

Aquí está lo clave: esas filas de números tienen el mismo aspecto que el resultado de cortar una oración en trozos. Por eso se puede usar casi sin modificaciones la estructura pensada para tratar texto. De ahí viene el nombre Vision Transformer.

Sin un número, se pierde el lugar

En el momento en que los trozos se alinean en fila, aparece un problema: en la fila ya no se sabe cuál trozo estaba arriba a la izquierda de la foto ni cuál abajo a la derecha. Si se mezcla el orden de los trozos, el resultado del cálculo sale exactamente igual.

Por eso se le suma a cada trozo un pequeño grupo de números que indica su lugar. Cumple el mismo papel que el número que se le pone a un contenedor. Solo después de agregar esta marca se puede distinguir un trozo de arriba de uno de abajo.

Compara de inmediato trozos lejanos

Aquí es donde se separa de la CNN. La CNN (Convolutional Neural Network, red neuronal convolucional) desliza una ventana pequeña sobre la foto y solo mira los píxeles vecinos en cada paso. Como el rango que ve en un solo paso es angosto, hace falta apilar muchas capas para ampliar la vista hasta el otro extremo de la foto.

El Vision Transformer, en cambio, compara todos los trozos entre sí desde el primer paso. Calcula de inmediato cuánto se relaciona el trozo de arriba a la izquierda con el de abajo a la derecha. Puede unir desde el principio un objeto que quedó fotografiado partido en dos extremos de la imagen.

A cambio, pierde una ventaja que la CNN tenía gratis. Que los puntos cercanos suelen estar relacionados, y que un objeto sigue siendo el mismo aunque se desplace un poco: la CNN ya trae eso incorporado en su propia estructura. El Vision Transformer tiene que aprenderlo todo a partir de los datos.

El precio de no traer nada aprendido de antemano

Por eso, con pocos datos, rinde incluso peor que la CNN. Si se entrena con apenas unas decenas de miles de fotos, no logra captar bien la relación entre los trozos y se tambalea. No traer hábitos previos significa libertad, pero también significa que hay que aprenderlo absolutamente todo desde cero.

En cambio, si primero aprende de forma amplia con muchísimas fotos, después suele dar mejores resultados que la CNN. Los hábitos previos ayudan, pero también son un límite. Por eso se volvió habitual tomar lo que aprendió con un conjunto de datos enorme y ajustarlo después para cada tarea concreta.

La cantidad de trozos es directamente el costo

Como todos los trozos se comparan con todos, si los trozos se duplican, los pares por comparar se cuadruplican. Para subir la resolución de la foto hay que cortar los trozos más chico o aumentar su cantidad, y en ese momento el cálculo crece mucho. Eso pesa bastante en tareas donde la resolución alta importa.

Por eso las estructuras que aparecieron después mezclan otro enfoque: comparar primero los trozos cercanos y, a medida que se avanza, ir fusionando trozos para reducir su cantidad. Empezar fino e ir agrupando de a poco se parece bastante a lo que ya hacía la CNN. Las dos familias terminaron acercándose, tomando prestado lo mejor de cada una.

3Con más precisión

El Vision Transformer divide la foto en parches cuadrados sin superposición, convierte cada parche en un vector, le suma información de posición y hace pasar todo por bloques de autoatención. Cuando se usa para clasificar, se agrega un lugar extra junto a los trozos para guardar un resumen, y al final solo se toma el valor de ese lugar para decidir la etiqueta. Quitando el corte y la marca de posición, el cálculo es casi idéntico al de un transformer para texto.

La analogía también tiene sus costuras. La carga dentro de un contenedor sigue igual si se abre para mirar, pero un trozo cortado se comprime en un grupo de números y sigue cambiando capa tras capa, sin necesidad de volver nunca a la imagen original. Además, la persona de la sala de control revisa la lista renglón por renglón, pero la atención calcula de una sola vez la relación de todos los pares. Y sobre todo, el número del contenedor lo define una persona, pero la marca de posición de cada trozo es un valor que se afina junto con el resto durante el entrenamiento.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el Vision Transformer reemplazó por completo a la CNN, pero en realidad, con pocos datos o poco cálculo disponible, la familia de la CNN sigue teniendo ventaja.

  • Es fácil creer que cortar la foto en trozos rompe la relación entre ellos, pero en realidad, después de cortar, todos los trozos se comparan entre sí, así que hasta los más lejanos quedan conectados de una vez.

  • Es fácil pensar que cortar los trozos más finos siempre es mejor, pero en realidad, cuantos más trozos hay, más rápido crecen los pares por comparar, y el cálculo se vuelve difícil de sostener.

7Resumen en una línea

En resumenEl Vision Transformer corta la foto en trozos del mismo tamaño, los alinea como palabras y compara todos entre sí, así que desde el principio puede conectar de una vez incluso los puntos más lejanos.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02