Separación de fuentesSource Separation
Separar un sonido mezclado en sus distintas partes
- La separación de fuentes es el trabajo de tomar un sonido grabado con varias cosas mezcladas y guardar cada una por separado.
- El sonido mezclado no tiene fronteras. La onda ya está fundida en una sola, así que no hay ningún punto por donde cortar.
- Por eso se despliega el sonido en un dibujo y se le asigna a cada casilla qué proporción le corresponde a quién.
- Cada tipo de sonido tiene un patrón de altura, un timbre y una forma de moverse en el tiempo distintos, y eso es lo que sirve de pista.
- No sale limpio del todo. En la parte separada siempre queda algún rastro del otro sonido.
Contenido
1La analogía
En un solo estanque de piscifactoría nadan mezcladas varias especies. Aun así, se pueden separar en tanques distintos. Como el tamaño, la profundidad en la que nadan y sus costumbres de movimiento son distintos, cambiando el tipo de red y el punto donde se recoge, cada especie termina en un tanque diferente. Claro que no queda perfecto: en cada tanque se cuelan unos pocos peces de otra especie, y una especie nunca vista no tiene tanque asignado.
La separación de fuentes hace lo mismo, pero con sonido. Dentro de un mismo archivo hay una voz y una instrumental mezcladas, o las distintas voces de una sala de reuniones. Usando como pista los rasgos propios de cada tipo, se reparte el sonido en distintos "tanques", y a partir de ahí se puede escuchar solo la voz, solo la batería o solo una persona.
2En detalle
Después de mezclarse, no quedan fronteras
En el estanque, las especies siguen nadando por separado, pero con el sonido la cosa cambia. Cuando varios sonidos ocurren en el mismo espacio, la vibración del aire simplemente se suma y se convierte en una sola onda. Dentro del archivo grabado no están la voz y la instrumental una junto a la otra: solo queda el resultado de sumarlas.
En términos de números, es como si solo se diera el resultado de sumar varios números y hubiera que adivinar cuáles eran los originales. La respuesta no queda determinada de una sola manera. Por eso la separación de fuentes no es una tarea de medir, sino de adivinar.
Se puede adivinar porque cada sonido tiene una forma propia. No es que se hayan sumado números cualquiera: se sabe que lo que se sumó tiene la forma típica de una voz, o la forma típica de una batería, y eso deja margen para separarlas.
El reparto se hace sobre el dibujo del sonido
En la práctica, el trabajo no corta directamente la forma de onda; muchas veces ocurre sobre el dibujo del sonido. Se despliega un dibujo dividido en casillas de tiempo y de altura, y a cada casilla se le asigna qué proporción de ese sonido le corresponde a cada tipo.
Al aplicar esta tabla de proporciones, una parte queda y el resto se atenúa. Si se hace una tabla por cada tipo de sonido, sale por separado el sonido de cada uno. Lo normal es ajustar las cosas para que, al sumar todos los tipos, se vuelva a obtener el sonido original.
Es importante no asignarle a cada casilla un único dueño fijo. Es habitual que en la misma casilla convivan dos sonidos a la vez. Repartir la casilla, por ejemplo mitad y mitad, evita que el sonido separado quede cortado a trozos.
En qué se apoya para separar
La pista más fuerte es el patrón de altura. La voz forma rayas regulares y la batería forma manchas cortas y anchas, así que en el dibujo tienen una forma distinta. También cambia cuánto dura el sonido: un instrumento de cuerda se alarga, uno de percusión desaparece en un instante.
También se observa cómo se mueve en el tiempo. La voz sube y baja según la letra y la respiración, mientras que la instrumental sigue el compás. Ese ritmo distinto, cuando ambos se superponen, sirve de pista para separarlos.
Si la grabación está repartida entre izquierda y derecha, la dirección también es una pista: se puede distinguir un sonido que se oye más fuerte a un lado de otro que se oye centrado. Aun así, los métodos actuales separan bastante bien incluso una grabación mezclada en un solo canal.
No queda del todo limpio
Al escuchar por separado la voz ya extraída, se oye de fondo, muy débil, un resto de la instrumental. Del otro lado queda un rastro de la voz. A veces el sonido queda con un eco como bajo el agua, o con un roce en los bordes.
Hay casos especialmente difíciles: cuando dos voces muy parecidas hablan al mismo tiempo, cuando la grabación se hizo en una sala con mucho eco, o cuando se mezcla un instrumento o un sonido que no estaba en los datos de entrenamiento. También es difícil recuperar un sonido que ya quedó emborronado en la propia grabación original. La información que se perdió no vuelve solo porque se separe.
Dónde se usa
El uso más conocido es dejar solo la instrumental de una canción o extraer únicamente la voz. También se usa para restaurar grabaciones antiguas, separando cada instrumento y volviendo a mezclarlos, y para subir el volumen de los diálogos de una película mientras se baja el del sonido de fondo.
En el terreno del habla se usa para dejar solo la voz de una persona en una grabación de reunión, o para separar la voz del ruido en una llamada hecha en un lugar ruidoso. Al aplicar la transcripción de voz después de separar, la exactitud sube de forma notable, así que muchas veces se coloca como un paso previo.
3Con más precisión
Como el problema consiste en recuperar los sonidos originales a partir de una señal donde varios están mezclados, también se trata bajo el nombre de separación ciega de señales. A la técnica de asignar una proporción por casilla sobre el dibujo del sonido se le llama enmascaramiento, y hoy también se usa mucho un enfoque que separa directamente desde la forma de onda, sin pasar por el dibujo. Qué tan bueno es el resultado se mide comparando cuánto del sonido original queda en la parte separada y cuánto se filtró de los demás. En música, lo habitual es dividir en categorías fijadas de antemano: voz, batería, bajo y el resto.
También hay puntos donde la analogía se queda corta. En el estanque, las especies existen de verdad por separado, así que basta con sacarlas; en un sonido mezclado no queda ninguna entidad real que separar. El sonido separado no es un fragmento recuperado de la grabación original, sino algo generado de nuevo, más parecido a "así debía de sonar". Por eso en el archivo separado pueden aparecer roces que no estaban en el original, y el mismo archivo puede dar resultados ligeramente distintos según la herramienta que se use.
4Pruébalo
5Malentendidos comunes
Es fácil pensar que, si se borra una parte de la grabación original, la otra queda intacta, pero en realidad la parte superpuesta se atenúa junto con la que se borra, así que la que queda también sale un poco dañada.
Es fácil pensar que el sonido separado es igual a si se hubiera grabado por separado desde el principio, pero en realidad es un sonido reconstruido de forma creíble, y al escuchar con atención se notan rastros.
Es fácil pensar que un archivo de buena calidad siempre se separa bien, pero en realidad, si hay sonidos parecidos superpuestos o mucho eco, ni siquiera un buen archivo se separa con facilidad.
7Resumen en una línea
En resumenLa separación de fuentes reparte en distintos tanques lo que estaba mezclado en un mismo estanque, y como el sonido no tiene fronteras que cortar, se reconstruye asignando una proporción a cada casilla.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02