Visión y audio Intermedio

EspectrogramaSpectrogram

El dibujo que deja ver el sonido con los ojos

Puntos clave
  • El espectrograma es un dibujo que despliega el sonido para que se pueda ver. El eje horizontal es el tiempo, el vertical es la altura del sonido, y lo oscuro que se ve marca la fuerza.
  • En cada trozo corto se mide qué altura de sonido hay y cuánta cantidad, esa medida se levanta en una columna, y las columnas se ponen una tras otra en el tiempo.
  • La transcripción de voz, la detección de tono, la separación de fuentes y la generación de sonido ocurren todas sobre este dibujo.
  • Si los trozos se cortan más cortos, el tiempo se ve más nítido pero la altura se emborrona. No se puede tener las dos cosas nítidas a la vez.
  • Al dibujo le falta información, así que con este dibujo solo no se puede recuperar el sonido original tal cual.
Contenido

1La analogía

En los cajones de una biblioteca antigua hay una ficha por cada libro. En cada ficha están anotadas, casilla por casilla, las características de ese libro, y cuando las fichas se colocan en orden, al abrir el cajón se ve de un vistazo cómo va todo. Una sola ficha no dice gran cosa, pero en cuanto se alinean muchas, se convierte en algo que se puede leer.

El espectrograma es exactamente ese cajón de fichas hecho con sonido. El sonido se corta en trozos muy cortos, y de cada trozo se escribe una ficha. En la ficha hay casillas que van desde el sonido más grave hasta el más agudo, y se marca en ese instante cuánto se oscurece cada casilla. Colocar estas fichas muy juntas en orden de tiempo y mirarlas de lado es justo lo que es un dibujo del sonido.

2En detalle

Con la forma de onda sola es difícil saber

Al abrir un archivo grabado aparece una forma de olas que muestra, en el tiempo, cuánto se movió el aire. Ahí se ve enseguida si el sonido es fuerte o flojo, y cuándo empieza y termina.

Pero lo que de verdad se quiere saber no se ve bien. Si es un zumbido grave o un chirrido agudo, si es una voz humana o una puerta que se cierra, todo eso queda mezclado en lo apretadas que están las olas, y si varios sonidos se superponen, esa onda se junta en una sola línea, aún más difícil de distinguir.

Por eso, casi todo lo que se hace con sonido no trabaja directamente con la forma de onda, sino que primero la pasa a un dibujo separado por alturas.

Una ficha por cada trozo corto

Si se mide la altura del sonido tomándolo entero, solo se sabe qué notas hubo en toda la pieza, pero se pierde cuándo hubo cada una. Por eso se mide en trozos muy cortos, cada uno tan breve que dentro de él se puede dar por hecho que el sonido casi no cambia.

En cada trozo se mide la fuerza de cada componente, de grave a agudo, y eso da una columna vertical. Ese trozo se desliza un poco hacia el lado y se repite el cálculo; al pegar las columnas una tras otra en el tiempo, el dibujo queda completo, y como los trozos se solapan al desplazarse, no quedan cortes bruscos entre una columna y la siguiente.

Las divisiones de las casillas suelen ajustarse al oído humano. Como se nota bien una pequeña diferencia en los sonidos graves y casi no se nota la misma diferencia en los agudos, la parte grave se divide muy fina y la aguda más gruesa.

Cómo leer el dibujo

El eje horizontal es el tiempo, el vertical es la altura, y lo oscuro marca la fuerza. La voz aparece en este dibujo como rayas horizontales paralelas. La raya más baja es la altura básica a la que vibran las cuerdas vocales, y por encima se apilan más rayas a intervalos regulares. Cuando en una canción se sube de nota, todo ese conjunto de rayas se desplaza hacia arriba.

Sonidos como una consonante final o un sonido de "s" aparecen sin rayas, como una mancha ancha y difuminada arriba. Un aplauso o una puerta al cerrarse se ven como una línea vertical corta y ancha, y un tramo silencioso es simplemente un espacio vacío. Aunque dos personas digan la misma palabra, la separación entre sus rayas y la forma de sus manchas son distintas, y ese patrón funciona como la huella de cada voz.

Elegir la nitidez implica perder algo

Cuanto más cortos se hacen los trozos, más claro queda cuándo pasó cada cosa. A cambio, dentro de cada trozo hay menos onda, así que las casillas de altura se vuelven borrosas. Al revés, si los trozos se alargan, la altura se separa con más finura, pero el instante exacto en que cambió el sonido se emborrona.

No se pueden tener las dos cosas nítidas al mismo tiempo. Solo queda elegir según lo que se quiera observar. Para transcribir habla, donde el sonido cambia rápido, se cortan trozos cortos; para mirar los acordes de una pieza musical, se cortan un poco más largos.

Sobre este dibujo pasan las cosas

Al pasar el sonido a espectrograma, un problema de sonido se convierte en un problema de imagen. Ya hay muchísimos métodos acumulados para reconocer patrones en una imagen, así que se pueden aprovechar tal cual.

La transcripción de voz lee, en este dibujo, el patrón de cada sonido y lo pasa a letras; la detección de tono consiste en señalar cuál raya, entre todas, es la de referencia. La separación de fuentes consiste en repartir los patrones superpuestos entre los distintos instrumentos, y la generación de sonido hace el camino contrario: primero dibuja este cuadro y después lo convierte en forma de onda.

3Con más precisión

La forma de construirlo consiste en cortar la señal en segmentos cortos y calcular los componentes de frecuencia de cada segmento, y a este proceso se le llama transformada de Fourier de tiempo corto. Al cortar, se aplica una ventana que suaviza los bordes, para reducir el ruido que aparece en los empalmes. La fuerza no se suele mostrar tal cual, sino comprimida en una escala logarítmica, porque la diferencia entre un sonido fuerte y uno flojo es tan grande que, sin comprimir, el sonido flojo directamente no se ve. A la versión donde las casillas se reajustan según la sensibilidad del oído humano se le llama espectrograma de mel, y es la que más se usa en el trabajo con voz.

También hay puntos donde la analogía se queda corta. En la ficha de biblioteca, una persona elige a mano qué anotar; el espectrograma, en cambio, rellena todas las casillas sin excepción siguiendo un cálculo fijo. Pero hay algo que no queda anotado en ninguna ficha: en qué punto exacto empieza la onda de cada componente. Por eso, para devolver la forma de onda original a partir solo de este dibujo hace falta adivinar la parte que falta, y esa tarea le corresponde al vocoder.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que el espectrograma contiene el sonido tal cual, pero en realidad es un resumen que descarta parte de la información, así que el sonido reconstruido a partir de él difiere sutilmente del original.

  • Es fácil pensar que es lo mismo que el dibujo de olas de un programa de grabación, pero en realidad es un dibujo al que se le añade el eje de altura que la forma de onda no tiene.

  • Es fácil pensar que cuanto más nítido, mejor es el dibujo, pero en realidad, si se afina el tiempo, la altura se emborrona, así que hay que elegir según lo que se quiera ver.

7Resumen en una línea

En resumenEl espectrograma es un dibujo del sonido hecho colocando en orden de tiempo una ficha por cada trozo corto, y casi todo lo que se hace con sonido ocurre sobre este dibujo.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02