IA generativa Básico

Generación de videoText-to-Video

Crear una escena en movimiento a partir de texto o una foto

Puntos clave
  • La generación de video crea, a partir de unas líneas de texto o de una foto, una escena en movimiento.
  • Es mucho más difícil que generar una imagen. Hay que hacer que no un solo fotograma, sino decenas o cientos de ellos, encajen entre sí.
  • El mayor reto es que lo que aparece en un fotograma siga estando igual en el siguiente. Si la ropa cambia de color o un objeto desaparece, se nota enseguida.
  • Como se suma el tiempo, el cálculo crece mucho, así que lo que se genera de una vez es corto y tarda más.
  • Hay peticiones propias del video, como el movimiento de cámara, el cambio de plano o la velocidad, que no existen en una imagen fija.
Contenido

1La analogía

Detrás de una tela fina se enciende una lámpara, y al colocar entre ambas una figura recortada, sobre la tela aparece una silueta oscura. Si se mueve la figura poco a poco, la silueta parece caminar, girarse o hacer un gesto, y así se arma una historia.

Lo difícil aquí no es hacer bonita la silueta. Es que la figura recortada al principio se mantenga con la misma forma hasta el final de la historia. Si en algún momento se agranda un poco o le sale un brazo de más, quien mira lo nota al instante.

El movimiento tampoco sale como se quiere. Moverla de golpe se ve entrecortado, y si al moverla tiembla la dirección, la figura parece resbalar en vez de caminar. Hacer bien una sola escena y mantener el hilo entre escenas son tareas muy distintas.

2En detalle

No un solo fotograma, sino muchos que se encadenan

Hasta un video corto es, en realidad, cientos de imágenes pasando deprisa. Para unos pocos segundos hacen falta cientos de fotogramas. Pero si esos cientos se generan cada uno por separado, jamás se convierten en un video: si se piden varias imágenes con la misma frase y se ponen en fila, cada fotograma parece de un mundo distinto.

Por eso la generación de video trata desde el principio varios fotogramas como un bloque único. En vez de hacer el primer fotograma y luego el siguiente, se parte de todo el conjunto en estado borroso y se va afinando junto, a la vez. Al mirar el antes y el después de manera simultánea, el hilo puede mantenerse.

Se trabaja el tiempo a la vez

Si generar una imagen mira dos direcciones —ancho y alto—, generar un video suma una tercera: el tiempo. El punto de arriba a la izquierda de la pantalla se relaciona con el punto vecino, pero también con el mismo punto un instante antes y un instante después. Hay que atender juntas esas relaciones en el eje del tiempo para que el movimiento se vea natural.

Sumar una dirección más multiplica los valores que hay que manejar. Con la misma calidad de imagen, alargar cinco veces la duración no cuesta cinco veces más esfuerzo, sino bastante más. De ahí que tarde tanto en generarse y que la duración salga tan corta.

Por eso el método habitual es dividir el trabajo por etapas: primero se crea un esqueleto pequeño y suelto, después se rellena entre escenas para suavizar, y al final se sube la resolución. No se intenta hacer todo de una vez.

Dónde se rompe el hilo

Lo que más falla es la identidad de lo que aparece. Alguien sostenía un vaso azul y, unos segundos después, es un vaso verde; alguien camina y en un solo paso la ropa cambia de aspecto. Como cada instante se dibuja de nuevo, en cuanto se olvida lo anterior, se desajusta enseguida.

El fondo también tiembla con frecuencia. Cuando la cámara se mueve hacia un lado y vuelve, el lugar por el que acaba de pasar suele volver con otro aspecto. Lo que sale de cuadro y vuelve a entrar es especialmente frágil: a menudo se ve muy distinto al salir y al volver.

El texto también es un punto débil. Las letras de un letrero o una señal ya son difíciles en un solo fotograma, y al pasar de una escena a otra los trazos siguen moviéndose. Por eso, cuando el texto importa, se suele superponer aparte encima de la escena generada.

Todavía falla a menudo con la física

Aparece agua que fluye hacia arriba, un objeto que cae y no rebota, sino que se detiene, o un vidrio que se rompe y vuelve a unirse. Es porque no se aprendió como una regla de cómo funciona el mundo, sino que se encadenaron escenas que parecían verosímiles.

Falla especialmente en escenas donde dos cosas se tocan y algo cambia de estado: mover un objeto con la mano, o verter algo. Cortar la escena corta y evitar movimientos difíciles disimula el problema, y la corriente que intenta enfrentarlo de frente está llevando a investigar cómo incorporar las reglas del mundo dentro del modelo.

Qué se puede pedir

En la petición entra todo lo que ya se usaba para imágenes: qué hay, qué ambiente, de qué color. A esto se suman elementos propios del video: si la cámara avanza despacio, si recorre de lado a lado, o si se queda fija.

También se usa mucho dar directamente una imagen de partida: se hace primero una imagen que guste y se le indica "empieza en esta escena y muévete así". Como el punto de partida ya está fijado, el resultado se puede prever mucho mejor, y en el trabajo real este método es el más frecuente.

3Con más precisión

La generación de video suele usar la misma estructura que la generación de imágenes, pero le añade un eje de tiempo al lugar donde se manejan los valores. Se colocan varias escenas a la vez en el espacio latente, y se hace que se consulten entre sí no solo las relaciones dentro de una pantalla, sino también las de un mismo punto entre un instante y el siguiente. También se usa mucho el método por etapas: generar corto y en baja resolución, rellenar entre fotogramas y luego subir la resolución.

La analogía del teatro de sombras también tiene costuras. En el teatro de sombras hay una figura física que existe de verdad, así que su forma se mantiene sola; en la generación de video no hay nada que corresponda a esa figura. Cada instante se dibuja de nuevo intentando que se parezca al anterior, así que no es que se mantenga, sino que se está esforzando por mantenerse. Además, el teatro de sombras avanza en orden de principio a fin, pero la generación de video suele afinar de una vez todo el tramo, así que a veces la parte final influye en la inicial.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que es hacer varias imágenes y pegarlas en fila, pero en realidad, si se hicieran por separado, cada escena parecería de otro mundo, así que desde el principio se trabaja también el tiempo.

  • Es fácil pensar que la duración se puede alargar cuanto se quiera, pero en realidad, cuanto más larga, más crecen de golpe el desajuste entre escenas y el cálculo, así que se generan tramos cortos.

  • Es fácil pensar que si el video se ve natural es porque conoce las reglas del mundo, pero en realidad son escenas verosímiles encadenadas, y por eso a veces el agua fluye al revés.

7Resumen en una línea

En resumenLa generación de video es como mover poco a poco una figura recortada para armar una historia: hacer bien un solo fotograma es lo de menos, y lo verdaderamente difícil es mantener el hilo entre escenas.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02