SegmentaciónSegmentation
Poner una etiqueta a cada punto de la foto
- La segmentación es ponerle una etiqueta a cada punto de la foto, uno por uno. El resultado es una imagen de etiquetas del mismo tamaño que la original.
- A diferencia de envolver con un recuadro, no se mezcla fondo: se puede recortar la forma exacta del objeto.
- El resultado cambia según si se trata como un solo bloque por categoría o se separa cada individuo por su cuenta.
- La imagen que se achicó capa tras capa se vuelve a agrandar, y se combina con la imagen fina de una etapa anterior para conservar los bordes.
- Como una persona tiene que dibujar el contorno punto por punto al preparar los datos, es la tarea que más trabajo exige.
Contenido
1La analogía
Pones una planta en maceta frente a una luz fuerte y en la pared de atrás se forma una silueta negra. Si miras bien la pared, cada punto queda separado sin excepción entre "esto es la planta" y "esto es la pared": incluso los huecos entre las hojas dejan pasar el color de la pared, y hasta el espacio angosto debajo de la maceta queda del lado de la planta.
Es muy distinto a tapar la planta con una tabla cuadrada del tamaño justo para cubrirla. Con la tabla, también queda tapada la pared vacía junto a la planta; la silueta, en cambio, cubre exactamente lo que ocupa la planta y nada más.
Claro que tampoco es perfecta. En las puntas finas o temblorosas de las hojas, el borde se vuelve borroso y ya no queda claro hasta dónde llega la planta. Y si hay dos macetas una detrás de la otra, la silueta las une en un solo bloque, así que para contar cuántas hay hace falta otro truco.
2En detalle
Se le pone una etiqueta a cada punto
El resultado de la segmentación no son unos cuantos recuadros, sino una imagen completa. Tiene el mismo ancho y alto que la foto original, y en cada casilla hay un número. Ese número es el código de la etiqueta: la zona de una persona puede ser 1, la del cielo 2, la de un árbol 3, y así.
Si se pinta esta imagen con colores, se ve la foto dividida en zonas de color bien marcadas. La función que difumina solo el fondo en una videollamada, o la que cambia el color del cielo en una foto, usan justo esta imagen de etiquetas. Al recortar según la forma exacta del objeto, se logran cosas que un recuadro no puede hacer.
Es un escalón más arriba que la clasificación de imágenes, que pone una sola etiqueta por foto, y que la detección de objetos, que marca cada objeto con un recuadro. Cuanto más precisión gana, más pesado se vuelve el cálculo y más cuesta preparar los datos de entrenamiento.
Se achica y después se vuelve a agrandar
Hay un problema. Al apilar capas mientras se recorre la foto, la imagen se va achicando. En la imagen achicada queda "qué había", pero se difumina "en qué punto exacto estaba". Y como la segmentación tiene que responder punto por punto, hace falta volver al tamaño original.
Por eso se usa una estructura que baja reduciendo a la mitad y después sube agrandando al doble. Al subir, no se agranda sin más: se vuelve a combinar, en cada nivel, con la imagen fina que se guardó al bajar por ese mismo nivel. Es como reponer la posición que se difuminó con el contorno nítido que conservó una capa inferior. Sin esta forma de trabajar, los bordes salen romos.
Un bloque, o uno por uno
Aun dentro de la segmentación hay dos caminos. Uno solo distingue el tipo: aunque haya tres bicicletas en la foto, las tres se pintan del mismo color, "bicicleta". Si las ruedas se superponen, no se sabe dónde termina la primera bicicleta.
El otro separa cada individuo por su cuenta: la primera bicicleta y la segunda quedan con etiquetas distintas. Cuando hace falta contar cuántos objetos hay, o borrar solo uno, hace falta este segundo camino. Y hay un método mixto: lo que no se puede contar, como el cielo o la calle, se pinta solo por tipo, y lo que sí se puede contar se separa por individuo.
El punto difícil es siempre el borde
El lugar donde la segmentación falla más seguido no es adentro del objeto, sino el borde. Un mechón de pelo, el hueco entre hojas, un vaso de vidrio semitransparente, la punta de un dedo que se movió y salió borrosa: en esos puntos, donde no queda claro si es objeto o fondo, el resultado sale desprolijo. Por eso, cuando activas el desenfoque de fondo en una videollamada, la línea del hombro suele quedar dentada.
Quien prepara los datos de entrenamiento sufre en los mismos lugares. Un recuadro se arrastra dos veces con el mouse y ya está, pero trazar un contorno lleva varios minutos por foto. Por eso preparar una sola foto cuesta decenas de veces más que en la clasificación. Últimamente, herramientas que trazan solo el contorno cuando la persona hace clic en un solo punto están reduciendo mucho ese esfuerzo.
3Con más precisión
La segmentación es un problema que clasifica cada punto de la foto en una de las etiquetas definidas de antemano. La salida es un mapa de etiquetas con el mismo ancho y alto que el original, y el rendimiento se mide comparando, etiqueta por etiqueta, cuánto se superpone la zona predicha con la zona correcta, y promediando. En el método que además separa individuos, cada individuo se compara por separado.
La analogía de la silueta también tiene sus costuras. La silueta se forma porque la luz queda bloqueada, así que sale unida de manera natural, pero la segmentación juzga cada punto por su cuenta. Por eso a veces un punto suelto en medio del objeto salta con una etiqueta distinta, como una mancha. Ese es el motivo por el que después se suele pulir el resultado para quitar esas manchas sueltas.
Además, la silueta es de un solo color, negro, pero la segmentación reparte varias etiquetas distintas. En un vidrio semitransparente o una malla, donde dos cosas se ven superpuestas, elegir una sola etiqueta se vuelve dudoso. Por eso también existe un método aparte que responde con un porcentaje de cuánto se mezcla el fondo.
4Pruébalo
- Selfie Segmentation (segmentación de selfies) ailearn.space Al encender la cámara web, ves en tiempo real cómo se separan lo que está delante y el fondo
- Segment Anything Playground (separación de objetos en imágenes y video) ailearn.space Haz clic en cualquier punto de la foto y se recorta solo el contorno del objeto que está ahí
5Malentendidos comunes
Es fácil pensar que la segmentación siempre es mejor que la detección de objetos, pero en realidad exige mucho más cálculo y preparación de datos, así que si solo hace falta la posición, un recuadro alcanza.
Es fácil creer que el resultado dibuja el contorno del objeto como una línea, pero en realidad no es una línea, sino una etiqueta por cada punto, así que el borde no siempre queda parejo y a veces quedan manchas sueltas.
Es fácil pensar que pintar un mismo tipo también permite saber cuántos hay, pero en realidad, con el método que solo distingue el tipo, los objetos pegados se ven forzosamente como uno solo.
7Resumen en una línea
En resumenLa segmentación le pone una etiqueta a cada punto de la foto para recortar el objeto con su forma exacta, y es más precisa que un recuadro a cambio de exigir mucho más cálculo y preparación de datos.
¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02