ControlNet
Un mecanismo que fija con un boceto la forma de una imagen generada
- ControlNet es un mecanismo que, al generar una imagen, fija la forma con un dibujo. Traspasa con un boceto la composición y la pose que son difíciles de describir con palabras.
- Con solo texto, el color y el ambiente pueden salir bien, pero qué va a estar y dónde cambia cada vez que se genera. ControlNet sujeta ese lugar.
- El boceto puede ser de varios tipos: un contorno, líneas de esqueleto, un mapa de profundidad, bloques de color; según cuál se elija, cambia lo que queda sujeto.
- El modelo original queda congelado, y solo se entrena una rama adicional. Por eso se puede cambiar de tipo de boceto como quien cambia una pieza.
- La fuerza con la que se sujeta se puede ajustar. Apretado, sigue el boceto al pie de la letra; suelto, se aparta con libertad.
Contenido
1La analogía
Imagina una raya vertical bien derecha planchada al frente de un pantalón. Al pasar la plancha una vez, ese lugar queda fijado como el pliegue. El color de la tela, el estampado, el grosor: todo eso sigue igual. Lo único que queda decidido es dónde se dobla.
Si se aprieta la plancha mucho tiempo, la raya queda tan marcada que, se mueva como se mueva la persona, siempre se dobla ahí. Si se pasa apenas de rozón, la raya queda tenue y se corre un poco con cada paso. Tampoco hay un solo lugar posible para marcar: se puede seguir el contorno externo, o marcar solo una línea central.
ControlNet es fijar de antemano esa línea en el lugar donde se va a generar la imagen. El color, la textura y el ambiente se piden con palabras; qué va a estar y dónde, lo decide la línea que quedó fijada.
2En detalle
Con palabras es difícil fijar la posición
Una frase de encargo funciona bien para decidir qué dibujar. Pero un pedido como "la luz entra desde la izquierda, el marco de la ventana cae en el tercio superior derecho, la silla queda apenas de costado" se deshace apenas se intenta poner en palabras. Meter la misma frase diez veces da diez composiciones distintas.
Fijar el número que elige la mancha de partida hace que vuelva a salir la misma imagen, pero eso sujeta una sola imagen, no la composición: basta con cambiar una letra de la frase para que la escena se desordene de nuevo.
ControlNet no resuelve esto con palabras. Traspasa directamente, en forma de línea, la disposición que se quiere: la frase queda como frase, y la posición la decide la línea.
Lo que se traspasa es una sola capa de línea, no un dibujo
El boceto que se entrega no es un dibujo terminado. Es una imagen de la que solo queda una capa de información: un dibujo de líneas sacado de los bordes de una foto, líneas de esqueleto que unen la posición de las articulaciones, o un mapa de tonos que marca con brillo qué tan lejos está cada punto de la escena.
Que quede solo una capa tiene su motivo. Si se metiera la foto de referencia entera, el color y la textura vendrían pegados con ella y no quedaría margen para generar algo nuevo. Al dejar solo el contorno, la forma queda sujeta mientras el color y la textura siguen vacíos, y ese vacío lo llena la frase del encargo, como planchar solo el pliegue, no toda la tela.
Tampoco hace falta dibujar el boceto a mano: hay herramientas que, a partir de una foto de referencia, extraen la línea o el esqueleto. Por supuesto, también se puede trazar la línea directamente.
Lo original se deja tal cual, y solo se agrega una línea
ControlNet no arma de nuevo el modelo de generación de imágenes. Deja el modelo ya entrenado sin tocar y congelado, y al lado le pone una copia de la misma forma, entrenando solo esa copia, que aprende a leer el boceto y convertirlo en una señal de "acá hay una línea".
Esa señal se suma en medio de los pasos con los que el modelo original va afinando la imagen. Al principio queda apagada, sin ningún efecto, y a medida que avanza el entrenamiento se le va abriendo el paso poco a poco: el mismo principio que planchar un pliegue sin tocar el resto de la tela.
Gracias a esta estructura, se puede entrenar una rama distinta para cada tipo de boceto y cambiarla según haga falta, poniendo o quitando por separado la que sujeta la línea y la que sujeta la pose, o incluso las dos a la vez.
Qué tan fuerte y hasta dónde sujetar
Qué tan fuerte se sigue el boceto se ajusta con una sola perilla. Apretado, no se sale de la línea ni un poco, pero la imagen queda rígida y lo que está fuera de la línea sale pobre. Suelto, se ve más natural, pero la composición se corre de a poco. Es la misma diferencia que planchar apretando mucho tiempo o solo rozar de pasada.
También se puede decidir desde cuándo hasta cuándo se sujeta. La imagen empieza como una mancha borrosa y se va aclarando por etapas; la disposición general se decide en las primeras etapas y los detalles finos, en las últimas. Por eso, si se sujeta solo en las etapas iniciales y se suelta el resto, la composición queda fija mientras los detalles salen con libertad.
Elegir qué sujetar
Aunque se saque de la misma foto, el resultado cambia mucho según qué tipo de boceto se use. Con el contorno, el exterior del original queda casi igual; con solo el esqueleto, únicamente la pose se mantiene y el resto sale completamente nuevo; con solo el mapa de profundidad, se mantiene la disposición en el espacio y la frase decide qué va en cada lugar.
Por eso conviene decidir primero qué mantener y qué cambiar, y recién después elegir el tipo de boceto.
3Con más precisión
ControlNet le agrega una entrada de condición más al modelo de generación de imágenes. Deja fijos los valores del modelo ya entrenado, y una copia de la primera parte recibe el boceto, lo convierte en características y suma ese resultado en cada etapa intermedia del modelo original. La conexión entre la copia y el modelo original arranca sin dejar pasar nada, así que al principio del entrenamiento no daña el rendimiento previo.
La analogía de la plancha también tiene grietas. La línea marcada por la plancha es una fuerza física que obliga a doblar siempre por ese lugar, pero ControlNet no es una obligación: es una pista que se suma en cada etapa. Por eso, si se baja la fuerza, se puede pasar por encima de la línea, y si la frase y el boceto no coinciden entre sí, puede salir una imagen a medio camino de las dos, algo indecisa. También hay una diferencia en el origen: la línea la marca una persona a mano, mientras que el boceto suele extraerse de forma automática a partir de una imagen de referencia.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que meter un boceto es como pintarle color encima, pero en realidad la imagen se genera de nuevo desde cero, y solo la forma se tira en dirección al boceto.
Es fácil pensar que usar ControlNet significa volver a entrenar el modelo, pero en realidad el modelo original queda congelado tal cual, y solo se entrena la rama que se le agregó al lado.
Es fácil pensar que cuanto más preciso el boceto, mejor el resultado, pero en realidad, si las líneas son demasiado densas, no queda margen para generar nada nuevo y el resultado sale rígido y forzado.
7Resumen en una línea
En resumenControlNet es como planchar de antemano el lugar donde se va a doblar: el color y el ambiente se piden con palabras, y la forma queda sujeta por la línea que se fijó de antemano.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02