Streaming

Enviar lo ya generado antes de que la respuesta esté completa

Puntos clave
  • El streaming es enviar primero lo que ya se generó, sin esperar a que la respuesta esté completa.
  • El momento en que termina la respuesta es casi el mismo. Lo que cambia es el tiempo hasta ver la primera letra.
  • El modelo de lenguaje ya genera de a un trozo, así que el streaming solo deja salir ese proceso tal cual.
  • Si al leer parece que va mal, se puede cortar en el medio, y así se ahorra tiempo y costo.
  • En cambio, no encaja con tareas que necesitan tener todo para poder juzgar.
Contenido

1La analogía

Frente a una olla enorme de sopa hirviendo, imaginemos un mostrador donde sirven un plato a la vez con un cucharón. Si hay que esperar a que se vacíe toda la olla para recién entonces servir la mesa, la fila tiene que quedarse parada un buen rato. Si en cambio se sirve un cucharón a la vez en cada plato, quien lo recibe puede empezar a comer antes de que se le llene el plato entero.

El streaming es ese cucharón. A medida que el modelo va generando la respuesta trozo por trozo, ese trozo recién hecho se empuja directo a la pantalla. Por eso da la sensación de que las letras salen fluyendo una tras otra.

El tiempo que tarda en vaciarse toda la olla es más o menos el mismo de cualquier forma. Lo que cambia es la espera hasta la primera cucharada. Eso sí, la sopa que ya se sirvió en el plato no se puede volver a recoger. Es como que, si se dejó salir mal el principio, ya no se puede deshacer.

2En detalle

La respuesta ya se genera de a un trozo

El modelo de lenguaje no arma la respuesta entera de una sola vez. Mira lo acumulado hasta ese momento, elige el siguiente trozo, lo pega, y vuelve a elegir otro. Si la respuesta es larga, este proceso se repite cientos o miles de veces.

Por eso, antes de que la respuesta termine, la parte de adelante ya está lista tal cual. El streaming no hace más que no retener esa parte lista y soltarla en el momento. No es una técnica que invente una velocidad nueva de la nada: es una forma de no quedarse con lo que ya se generó.

Aunque en pantalla parezca que sale letra por letra, la unidad real es el trozo, así que a veces saltan dos o tres letras juntas de golpe. Eso pasa cuando una palabra corta aparece entera de una sola vez.

Baja el tiempo hasta la primera letra

Al hablar de velocidad de respuesta, se miran dos tiempos por separado: el tiempo hasta que llega el primer trozo, y el intervalo entre un trozo y el siguiente. Con el streaming activado, el primer tiempo baja bastante. El segundo intervalo queda igual.

La sensación de espera que siente la persona viene sobre todo del primer tiempo. Mirar una pantalla vacía unos segundos y ver que el texto empieza a fluir enseguida se sienten completamente distintos. Si las letras salen más rápido de lo que se puede leer, se termina leyendo casi como si se hubiera esperado a que todo estuviera listo.

Cuanto más larga la respuesta, más grande la diferencia. Cuanto más larga es una respuesta, más tarda en completarse, así que si se la retiene hasta el final, también crece el tiempo mirando la pantalla vacía.

Se puede cortar a mitad de camino

Si al ver la respuesta fluir uno se da cuenta de que va en una dirección equivocada, se puede parar en el acto. Suele ser más rápido corregir la pregunta y volver a preguntar. La parte que todavía no se generó ni siquiera llega a calcularse, así que tampoco se gasta ese tiempo ni ese costo.

Un programa hace lo mismo. Recibe solo hasta la parte que necesita y corta la conexión, o si aparece una expresión prohibida mientras fluye, la corta ahí mismo. Reacciona más rápido que revisar recién cuando llegó toda la respuesta.

También hay lugares donde no encaja

En tareas donde hace falta la respuesta completa para poder juzgar algo, el streaming casi no ayuda. Cuando hay que revisar si cumple un formato antes de pasarla, sacar un valor de la respuesta para meterlo en otro programa, o elegir una entre varias respuestas: en todos esos casos, hay que esperar hasta el final de todos modos, así que dejarla fluir antes en pantalla no sirve de mucho.

También complica al que recibe. Hay que ir uniendo cada trozo a medida que llega, recuperar la conexión si se corta a mitad de camino, y recién terminar cuando llega la señal de que ya terminó. Si no se trata de mostrar letras en pantalla, recibirlo todo de una sola vez suele ser más simple.

3Con más precisión

El streaming es una forma de comunicación en la que el servidor no cierra la respuesta como un solo bloque, sino que mantiene la conexión abierta y va dejando fluir los trozos en orden a medida que se generan. Al final llega una señal aparte que avisa que terminó. La unidad del trozo no es la letra, sino el token que maneja el modelo.

También hay puntos donde la analogía no encaja. Quien sirve con el cucharón ve cuánta sopa queda en la olla; el modelo no sabe de antemano cuánto más va a seguir la respuesta. No es que se reparta después de tener definido el final: cada vez que se genera un trozo, decide ahí mismo si sigue o si termina. Por eso no se puede dibujar con exactitud una barra de progreso. Tampoco se puede volver a corregir un trozo ya enviado, así que si se agarró mal la dirección al principio, sigue arrastrando eso. De ahí también viene que la velocidad de salida no sea pareja. Cuando se junta mucha gente, el intervalo entre trozos se alarga, y a veces la respuesta se detiene un instante y vuelve a fluir.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que activar el streaming hace que la respuesta termine más rápido, pero en realidad el momento en que sale la última letra es casi el mismo, y lo único que cambia es que la primera letra se ve antes.

  • Es fácil creer que, como las letras salen de a una, se generan de a una letra, pero en realidad se generan en unidades más grandes que una letra, así que varias letras aparecen juntas.

  • Es fácil pensar que si se corta a mitad de camino igual se cobra todo, pero en realidad la parte que no se llegó a generar no se calcula, así que se paga menos.

7Resumen en una línea

En resumenEl streaming, en vez de esperar a que la respuesta esté del todo lista, la va sacando trozo por trozo como si sirviera con un cucharón, y así acorta la espera.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02