Multimodal

La IA que procesa texto, imagen y sonido a la vez

Puntos clave
  • Multimodal es la propiedad de un modelo que recibe texto, imagen, sonido y video a la vez y los maneja juntos.
  • Aunque el formato cambie, por dentro todo se convierte en el mismo tipo de números y queda en un solo lugar.
  • Por eso se puede saltar de un formato a otro: ver una foto y responder con palabras, o buscar una imagen a partir de una descripción hablada.
  • No solo lo que recibe puede ser de varios formatos: lo que entrega también puede serlo.
  • Eso sí, cada formato tiene un nivel de destreza distinto. Las letras pequeñas en una imagen o una ubicación exacta todavía son un punto débil.
Contenido

1La analogía

Imagina que vas a buscar un bolso a una oficina de objetos perdidos. Una persona muestra una foto guardada en el teléfono, otra lo describe con palabras —marrón, con una manija rota— y otra escribe el día, la hora y la línea de metro en la que lo perdió.

Las tres formas de mostrarlo son distintas. Pero en la cabeza de quien recibe, las tres apuntan a lo mismo. Ya sea mirando la foto, escuchando la descripción o leyendo la hora, todo lleva al tercer estante de esa fila. El formato cambia, pero lo que señalan es lo mismo.

Por eso se puede preguntar con una foto y recibir la respuesta en palabras.

Multimodal es esa oficina de objetos perdidos.

2En detalle

Formatos distintos que llegan al mismo lugar

El texto, la imagen y el sonido son completamente distintos por fuera. El texto es una fila de letras, la imagen es una grilla de puntos, el sonido es una onda que sube y baja en el tiempo. Así como están, no hay forma de compararlos.

Un modelo multimodal convierte cada uno de los tres en un bloque de números. Lo importante es que, una vez convertidos, los tres quedan en el mismo espacio. Se entrena para que el bloque de números que sale de una foto de gato y el que sale de la palabra "gato" terminen ubicados cerca uno del otro.

Una vez que están en el mismo lugar, lo que sigue es igual sin importar de dónde vino cada uno. Se pueden comparar y combinar de la misma forma. Por eso el modelo puede juzgar si una foto encaja con una frase, o si un sonido coincide con sus subtítulos.

Qué se puede hacer con esto

Lo más común es que describa una foto. Se puede sacar una foto del interior de la heladera y preguntar qué cocinar, o fotografiar una tabla dibujada a mano y pedir que la organice. Como se muestra directamente lo que sería tedioso pasar a palabras, se ahorra trabajo.

También funciona al revés. Se puede describir algo con palabras para encontrar una imagen parecida, o meter una grabación larga y pedir que se extraiga solo lo que interesa. Además se pueden mezclar varios formatos a la vez: si se sube la foto de un manual junto con una pregunta escrita, el modelo mira ambas cosas juntas y responde.

Esta forma de trabajar resulta cómoda por una sola razón. Lo que le pasa a una persona casi nunca llega en un solo formato.

La respuesta también sale en varios formatos

No solo lo que recibe es de varios tipos. Lo que entrega también puede dividirse en texto, imagen o sonido. A la misma pregunta se le puede pedir que responda con palabras, que la lea en voz alta o que la dibuje.

Eso sí, todavía es poco frecuente que un solo modelo haga todo esto por sí mismo. Es más común que varias partes trabajen enlazadas como un equipo. A los ojos de quien lo usa se ve como un solo bloque, pero por dentro suele estar dividido entre la parte que mira la imagen, la que arma las palabras y la que produce el sonido.

Donde le cuesta más

Que reciba todos los formatos no significa que sea igual de bueno en todos. En general, la imagen queda algo más floja frente al texto, y el sonido más flojo aún frente a la imagen. Esto ocurre porque la cantidad de material disponible para entrenar varía mucho de un formato a otro.

Le cuesta especialmente lo minucioso. Es frecuente que lea mal una letra pequeña dentro de una imagen, que confunda si un objeto está a la izquierda o a la derecha, o que cuente mal una cantidad. Capta bien el clima general, pero es torpe para los detalles finos.

Por eso conviene que una persona revise cuando la exactitud del número o de la ubicación importa de verdad. Si la foto se saca con buena luz, nítida y con la parte relevante bien grande, el resultado mejora notablemente. Es mucho mejor mostrar una sola cosa bien grande que meter varias cosas en una misma imagen.

3Con más precisión

Modalidad es la palabra que designa el canal por el que entra la información. El texto es un canal, la imagen es otro, el sonido es otro. Multimodal significa que se maneja más de uno de esos canales, y a cada uno le corresponde una parte al frente que lo convierte en un bloque de números. Solo después de un entrenamiento que ubica esos resultados en un mismo espacio se puede mezclarlos de verdad.

La analogía de la oficina de objetos perdidos también tiene sus límites. Una persona a cargo, si la foto y la descripción no coinciden, vuelve a preguntar; el modelo, en cambio, a veces arma una respuesta plausible aunque haya un desajuste. De ahí que a veces afirme que algo está en la foto cuando no lo está. Una persona mira la imagen moviendo los ojos de una parte a otra con detenimiento, mientras que el modelo se acerca más a recorrerla toda de una vez, así que es fácil que se le escape un detalle pequeño.

Tampoco es que todos los canales se manejen de la misma manera. La imagen se corta en pequeños bloques a los que se les asigna un orden, y el sonido se despliega como si fuera una imagen que representa cómo cambia en el tiempo, antes de procesarlo. Por fuera parece que se puede meter cualquier cosa en una sola ventana, pero por dentro cada canal pasa por su propio tratamiento.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que, si es multimodal, es igual de bueno en todos los formatos, pero en realidad la destreza varía bastante de un canal a otro.

  • Es fácil pensar que, al recibir una imagen, lee las letras con exactitud, pero en realidad es frecuente que se equivoque con letra pequeña o una foto borrosa.

  • Es fácil pensar que recibir varios formatos es solo una función más que se agregó, pero en realidad hace falta un entrenamiento aparte que ubique los canales en el mismo lugar para que eso sea posible.

7Resumen en una línea

En resumenMultimodal es la propiedad de trasladar texto, imagen y sonido a un mismo lugar para que un modelo los maneje juntos, y eso permite preguntar y responder saltando de un formato a otro.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02