U-Net
Red que encoge y vuelve a agrandar para recuperar la posición
- U-Net es una estructura que encoge una imagen poco a poco y luego la vuelve a agrandar hasta su tamaño original. El nombre viene de que ese bajar y subir dibuja una U.
- Al encoger se distingue mejor qué hay, y al agrandar se puede señalar con precisión dónde está. Hacían falta las dos cosas, y de ahí salió esta forma.
- La información fina que se pierde al encoger se recupera enviando en paralelo la imagen previa a que se encogiera. Este atajo es el corazón de U-Net.
- El resultado sale del mismo tamaño que la imagen de entrada. Encaja bien con tareas donde hay que dar una respuesta casilla por casilla.
- Los modelos de generación de imágenes lo usan desde hace mucho como el encargado de quitar el ruido. Nació para trazar contornos en imágenes médicas.
Contenido
1La analogía
Estás buscando un punto de encuentro en un barrio que no conoces. Alejas los dedos en la pantalla del mapa para reducirlo. Los nombres de las calles pequeñas desaparecen, pero de un vistazo entiendes hacia dónde queda todo, dónde está la avenida principal y dónde el río. Para tener una idea de conjunto, hace falta reducir.
Ahora separas los dedos para acercar de nuevo. Pero si simplemente agrandas la imagen reducida, las calles quedan borrosas y no distingues dónde está cada edificio. Lo que se perdió al reducir no vuelve solo por agrandar.
Así que usas un truco: guardas de antemano la imagen antes de reducirla, y cuando vuelves a acercar con el mismo nivel de zoom, la pones al lado y las comparas. La dirección general viene de la imagen reducida; la posición exacta de cada calle, de la imagen guardada. Así trabaja U-Net.
2En detalle
Al encoger se sabe qué es, al agrandar se sabe dónde está
Cuando se encoge una imagen, una sola casilla pasa a representar una zona amplia. Puntos que estaban lejos entre sí terminan cayendo en la misma casilla, así que resulta más fácil tomar una decisión general, como si esto es un gato o un coche. A cambio, se pierde precisión sobre en qué casilla exacta cae un borde.
Agrandar funciona al revés. Cuantas más casillas hay, con más detalle se puede señalar una posición, pero al mirar solo una zona estrecha cuesta más saber qué es el conjunto. Ninguno de los dos, por sí solo, basta para dar una respuesta completa.
U-Net mete las dos cosas en una sola estructura. En la primera mitad va encogiendo sin parar mientras identifica qué es cada cosa; en la segunda mitad va agrandando sin parar mientras devuelve esa decisión a las casillas originales.
Envía la imagen previa a un lado, por un atajo
Por mucho que se esfuerce el lado que agranda, no puede recrear la información fina que ya se descartó. Por eso U-Net guarda la imagen de cada paso mientras baja, y se la entrega tal cual al paso del mismo tamaño mientras sube. A este atajo se le llama conexión de salto.
El lado que sube recibe dos cosas a la vez: la decisión sobre "qué es" que llegó de abajo, y la imagen original sobre "dónde estaba cada cosa" que llegó por el lado. Compara ambas y sube al siguiente tamaño.
Sin esta conexión, los bordes quedan borrosos y los contornos se difuminan. También ayuda a que, al entrenar, la señal llegue bien hasta las capas más profundas, así que el entrenamiento funciona incluso apilando muchas capas.
Sale con el mismo tamaño con el que entró
Un modelo normal de clasificación de imágenes recibe una imagen y devuelve una sola etiqueta. U-Net recibe una imagen y devuelve otra imagen del mismo tamaño. Es una forma pensada para tareas donde cada casilla necesita su propia respuesta.
El objetivo inicial era trazar el contorno de una lesión en una imagen médica: había que marcar, casilla por casilla, hasta dónde llegaba esa zona, así que el tamaño tenía que coincidir. Recortar el fondo de una foto o trazar carreteras en una imagen satelital son tareas con la misma forma de problema.
Qué hace en la generación de imágenes
Hoy el lugar donde más se usa U-Net es en la generación de imágenes. Los modelos de difusión parten de una mancha de ruido y la van generando mientras la limpian poco a poco. En cada paso hace falta algo que indique dónde y cuánto ruido hay que quitar de la imagen actual.
Esta tarea exige que la entrada y la salida tengan el mismo tamaño, que se entienda el conjunto y que también se sepa la posición exacta de cada punto. Es justo lo que U-Net sabe hacer. Por eso, para terminar una sola imagen, la vuelta completa en forma de U se repite decenas de veces, una de las razones por las que generar imágenes tarda más que generar texto.
Se sigue usando
En los últimos tiempos también se usan mucho estructuras que mantienen el mismo tamaño de principio a fin, en lugar de encoger y agrandar en forma de U, porque cuanto más grandes se hacen, mejor rinden. Aun así, U-Net es pequeño, rápido y aprende bien con pocos datos, así que sigue siendo la opción por defecto en herramientas que corren en dispositivos personales o en tareas de trazar contornos.
3Con más precisión
U-Net es una red convolucional donde un camino de contracción, que reduce la resolución mientras extrae rasgos, y un camino de expansión, que sube la resolución mientras reconstruye el resultado, quedan unidos de forma simétrica. Las conexiones de salto que unen ambos caminos a la misma resolución son lo que le da sentido al nombre de la estructura, y suelen combinarse uniendo los rasgos, uno junto al otro.
La analogía también tiene sus costuras. La imagen reducida del mapa es la misma imagen original, solo que más pequeña, pero la imagen que produce U-Net al encoger no es una reducción: son rasgos extraídos por el entrenamiento, y a simple vista no se ven como una imagen normal. Además, quien compara dos capturas solo las mira con los ojos, pero el modelo une las dos y las usa juntas como material para el cálculo de la siguiente capa. Cuando se usa en generación de imágenes, además, suele operar sobre un espacio comprimido en vez de sobre los píxeles directamente.
El número de veces que se encoge y se agranda tampoco es fijo, como sí lo es el zoom de un mapa con niveles marcados. Cada arquitectura decide cuántos escalones bajar antes de empezar a subir, y ese número se ajusta según el tamaño de la imagen y el detalle que haga falta capturar.
4Pruébalo
- Diffusion Explainer (visualización de la generación de imágenes) ailearn.space Puedes seguir, en cada paso de la generación, qué recibe y qué entrega por dentro la estructura en forma de U
- Netron (visor de arquitecturas de modelos) ailearn.space Al abrir un archivo de un modelo de imagen se ve la forma de U, bajando y subiendo, con líneas que saltan a un lado
5Malentendidos comunes
Es fácil pensar que U-Net es un modelo que dibuja imágenes desde cero, pero en realidad funciona más como quien marca o retira algo sobre una imagen del mismo tamaño que recibió.
Es fácil pensar que, al encoger y agrandar, la información original vuelve sola, pero en realidad, sin la imagen que se envía por el atajo, los bordes quedan borrosos.
Es fácil pensar que U-Net es una estructura vieja que ya no se usa, pero en realidad, por ser ligera y aprender bien con poco, sigue usándose mucho hoy.
7Resumen en una línea
En resumenU-Net encoge la imagen para saber qué es y la vuelve a agrandar para recuperar dónde está, enviando por un atajo la imagen previa a encogerse para recuperar el detalle fino.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02