Visión y audio Básico

Detección de objetosObject Detection

Encontrar cada objeto de una foto y marcarlo con un recuadro

Puntos clave
  • La detección de objetos es encontrar varios objetos en una sola foto y ponerle a cada uno un recuadro y una etiqueta.
  • Cada respuesta trae cuatro cosas juntas: qué es, dónde está, qué tan grande, y qué tan seguro está el modelo.
  • Como el mismo objeto suele salir cubierto por varios recuadros superpuestos, siempre hace falta un paso que los ordene y deje solo uno.
  • Es un escalón más arriba que la clasificación de imágenes, que solo pone una etiqueta a toda la foto.
  • Los métodos actuales son tan rápidos que funcionan en tiempo real, incluso con la cámara web.
Contenido

1La analogía

En la mesa de una librería, los libros están amontonados sin orden. Para hacer inventario no alcanza con decir "esto es la mesa de libros": hay que meter una cinta de color en el lugar de cada libro. Cinta azul para novelas, cinta verde para libros de cocina. Al terminar, se ve de un vistazo que hay tres libros de cocina en un lado de la mesa y dos novelas en la esquina izquierda.

La persona que coloca las cintas no elige solo lo que está clarísimo. También pone una cinta en lo dudoso, y si después ve dos o tres cintas encimadas en el mismo libro, deja solo la que mejor encaja y saca el resto. A un libro medio tapado, borroso, también le pone una cinta, pero anota "no estoy seguro".

Poner un solo cartel de "mesa de libros" y meter una cinta en cada libro son tareas completamente distintas en esfuerzo. Eso, poner las cintas, es justamente lo que hace la detección de objetos.

2En detalle

Varios objetos a la vez, en una sola pasada

La clasificación de imágenes da una sola respuesta por foto. En la detección de objetos, ni siquiera está definido cuántas respuestas van a salir: puede que no haya ningún objeto, o pueden salir veinte. Ese "no se sabe cuántos hay" es justo lo que hace mucho más difícil el problema.

Los métodos actuales dividen la foto en una cuadrícula y le preguntan a cada casilla, todas al mismo tiempo, "¿hay algo aquí?". Como se recorre la foto entera una sola vez y se reciben las respuestas de todas las casillas a la vez, el proceso es muy rápido. Es decenas de veces más veloz que los métodos antiguos, que buscaban los objetos uno por uno, y por eso ahora es posible que un recuadro siga a un objeto en un video de la cámara web.

Otro truco es preparar de antemano, en cada casilla, varios recuadros de muestra de distintos tamaños: uno alargado, uno achatado, uno casi cuadrado, y ajustar y mover cada uno un poco hasta que encaje con el objeto real. Encaja mucho mejor que dibujar el recuadro desde cero.

Cada respuesta trae cuatro cosas juntas

Una línea de resultado de la detección de objetos se ve algo así: "gato, arriba a la izquierda, ciento veinte de ancho por noventa de alto, seguridad 0.87". A diferencia de la clasificación, que solo da una etiqueta, aquí vienen juntas también la posición y el tamaño.

La seguridad es un valor que conviene vigilar de cerca. Si se muestran todos los recuadros, hasta los de baja seguridad, la pantalla queda cubierta de recuadros. Por eso solo se dejan los que superan cierto nivel: subir el umbral deja la pantalla más limpia, pero se pierden objetos borrosos; bajarlo atrapa más objetos, pero también agarra cosas que no son nada. Cuando en una herramienta de prueba ves un recuadro que aparece y desaparece parpadeando, es porque la seguridad está oscilando cerca de ese umbral.

Ordena los recuadros superpuestos

Casi nunca sale un solo recuadro por objeto. Como varias casillas vecinas ven el mismo objeto y cada una propone su propio recuadro, antes de ordenar la pantalla queda llena de recuadros parecidos, uno sobre otro.

Por eso primero se deja el recuadro con más seguridad y se borran los que se superponen mucho con él. Sobre lo que queda, se repite: dejar el que tenga más seguridad y borrar lo que se le superpone. También se puede ajustar cuánto solapamiento se tolera; si se pone muy estricto, a veces se borra por completo uno de dos objetos que están pegados uno junto al otro. Cuando en una foto de mucha gente desaparecen algunas personas, suele pasar justo en este paso.

Qué es lo difícil

Los objetos pequeños son especialmente complicados. A medida que la imagen se achica capa tras capa, un objeto lejano queda reducido a apenas unas pocas casillas y su rastro se pierde. Por eso se agrega el truco de mirar a la vez una imagen grande y una pequeña para decidir.

Los objetos tapados también son difíciles. Hasta una persona duda hasta dónde dibujar el recuadro de una silla medio escondida. Si quien preparó los datos de entrenamiento no sigue siempre el mismo criterio, el modelo también se confunde. Y, como en la clasificación de imágenes, un objeto que no está en la lista jamás va a aparecer: por más raro que sea lo que le muestres a la cámara web, si no está en lo que el modelo aprendió, la pantalla se queda callada.

3Con más precisión

La detección de objetos es un problema que, a partir de una sola foto, devuelve varios resultados formados por cuatro coordenadas del recuadro, una etiqueta y una seguridad. El rendimiento suele medirse comparando cuánto se superpone el recuadro predicho con el recuadro correcto, y contando como acierto cuando esa superposición pasa cierto nivel. Se mide etiqueta por etiqueta y luego se promedia todo en un solo número.

Los datos de entrenamiento también son mucho más pesados que en la clasificación. Hay que dibujar un recuadro y ponerle nombre a cada objeto de cada foto, así que preparar una sola foto exige varias veces más trabajo humano.

La analogía de la mesa de libros también tiene sus costuras. Una persona ve un libro y le pone una cinta, pero el modelo no reconoce los objetos de a uno: primero propone de golpe miles de recuadros candidatos en toda la foto y después los filtra. Los pocos recuadros limpios que se ven al final son el resultado de ese filtrado. Además, una persona hojea los libros aunque estén amontonados, pero el modelo juzga solo con lo que se ve en pantalla, así que le cuesta más con los objetos tapados.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la detección de objetos calca la forma exacta del objeto, pero en realidad solo da un recuadro alineado con los ejes, y dentro de ese recuadro entra también algo de fondo.

  • Es fácil creer que si no aparece un recuadro es porque no hay objeto, pero en realidad puede que solo se haya filtrado por no llegar al umbral de seguridad, aunque sí había un candidato.

  • Es fácil pensar que los recuadros en pantalla son todo lo que produjo el modelo, pero en realidad son solo lo que queda después de ordenar los recuadros superpuestos.

7Resumen en una línea

En resumenLa detección de objetos encuentra varios objetos en una foto y le pone a cada uno un recuadro, una etiqueta y una seguridad, y ordenar los recuadros superpuestos forma parte del mismo paquete.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02