Visión y audio Básico

Estimación de posePose Estimation

Marcar con puntos las articulaciones para descubrir la postura

Puntos clave
  • La estimación de pose es marcar con un punto el lugar de articulaciones como hombro, codo y rodilla, en una foto o video.
  • Cada punto son dos coordenadas sobre la pantalla. La postura se arma con la posición de los puntos y cuánto se dobla entre uno y otro.
  • Qué punto se une con cuál sigue una tabla de conexión fijada de antemano. Por eso nunca la punta de un brazo termina unida a un tobillo.
  • Si hay varias personas en la escena, hace falta además una etapa aparte para agrupar los puntos según a quién pertenecen.
  • Las articulaciones tapadas también se marcan por suposición, a partir de los puntos vecinos, y siempre viene con un número de cuánto se confía.
Contenido

1La analogía

Los maniquíes de tienda tienen hombros, codos, cintura y rodillas hechos para girar. Cuando alguien viste al maniquí y le arma una postura, lo único que hace es girar cada articulación al ángulo que quiere. Sea el brazo levantado o el cuerpo apoyado de lado, la postura queda decidida por dónde quedaron las articulaciones y cuánto se doblaron entre sí.

La estimación de pose hace este trabajo al revés. Recibe una foto donde la postura ya está armada y, para deducir dónde debieron estar las articulaciones para que se vea así, marca los puntos hacia atrás. En vez de girar un maniquí para armar la postura, mira la postura ya hecha y adivina dónde estaban las articulaciones.

Uniendo los puntos marcados en el orden fijado, queda un esqueleto de unos pocos palitos. Sin color de ropa, sin fondo, con solo el lugar de las articulaciones: ese esqueleto es el resultado que entrega la estimación de pose.

2En detalle

Primero se fija en una lista qué lugares marcar

La estimación de pose no marca puntos en cualquier parte. Nariz, dos ojos, dos hombros, dos codos, dos muñecas, dos caderas, dos rodillas, dos tobillos: los lugares a marcar están en una lista fijada de antemano. La lista habitual ronda los diecisiete puntos, y hay listas de más de treinta que suman nudillos de los dedos o la punta del pie.

Que la lista esté fija significa que el resultado siempre tiene la misma forma: cualquier foto que entre, vuelve la misma cantidad de puntos, y qué número corresponde al codo izquierdo también es siempre igual. Así, el programa que recibe el resultado puede confiar en que "el tercer punto es el hombro" y seguir calculando desde ahí.

Lo que hace el modelo se parece a recorrer la foto asignando a cada lugar un puntaje de "qué tan probable es que aquí esté el hombro izquierdo", elegir el más alto, marcar ahí un punto, y pasar al siguiente lugar de la lista.

El orden para unir los puntos ya está trazado

Con los puntos sueltos es difícil leer la postura. Por eso, qué par debe unirse —hombro con codo, codo con muñeca— está fijado en una tabla. Siguiendo esa tabla se dibujan las líneas y aparece la forma del esqueleto.

Con las líneas se puede medir el ángulo. Cuánto se abre la línea de hombro a codo respecto de la de codo a muñeca dice si el brazo está estirado o doblado, y lo mismo con la rodilla o la espalda. Las apps que corrigen la postura al hacer ejercicio dicen "tenés la cintura muy inclinada" gracias a este ángulo.

Aunque el tamaño del cuerpo y la distancia a la cámara cambien de persona a persona, el ángulo no cambia tanto. Por eso, al comparar posturas, se usa más la relación de ángulos y proporciones entre puntos que la posición de un punto en sí.

Con varias personas hace falta agrupar los puntos

Si hay dos personas paradas en la escena, salen cuatro puntos de hombro y cuatro de rodilla. Si esos puntos no se agrupan según a quién pertenecen, sale el resultado disparatado de unir el hombro de una persona con la muñeca de otra en un mismo esqueleto.

Hay dos maneras de agrupar. Una es buscar primero el cuadro de cada persona y marcar los puntos por separado dentro de cada uno: prolijo con poca gente, pero lento a medida que crece. La otra es marcar de una vez todos los puntos de la escena y después decidir cuáles pertenecen a un mismo cuerpo, algo que no pierde tanta velocidad con mucha gente.

Cuando dos personas se superponen o se cruzan de brazos, este agrupamiento se tambalea. Ahí es donde aparecen errores como contar mal cuántas personas hay o que algunos puntos se peguen a la persona de al lado.

Las articulaciones tapadas también se marcan por suposición

Aunque una pierna quede tapada por un escritorio, en el resultado igual aparece un punto de rodilla, porque casi siempre se completan todos los lugares de la lista. Un lugar que no se ve se marca donde es probable que esté, usando como base la disposición de los puntos visibles, algo posible porque el entrenamiento le dio al modelo la proporción del cuerpo y el rango en que se doblan las articulaciones.

A cambio, el modelo entrega junto a cada punto un número de confianza. Un hombro bien visible tiene un valor alto; una rodilla tapada, uno bajo. Si se ignora este número y se confía por igual en todos los puntos, salen juicios equivocados. Los servicios reales no dibujan en pantalla, ni usan en el cálculo, los puntos con un valor por debajo de cierto nivel.

En video, a veces se afina el punto mirando también los cuadros anteriores y siguientes. Si un punto salta de golpe en un cuadro, comparándolo con la posición de los cuadros vecinos y suavizándolo, el esqueleto tiembla menos.

3Con más precisión

Lo que entrega la estimación de pose es la coordenada horizontal y vertical de cada articulación, más un valor de confianza. Si solo da la coordenada plana se llama estimación bidimensional; si además agrega qué tan lejos está de la cámara, tridimensional. Esta última es ambigua con una sola cámara para la distancia hacia adelante, así que se resuelve con varias cámaras o agregando supuestos sobre la proporción del cuerpo.

El cálculo suele armar primero un mapa que llena cada casilla con "qué tan probable es que aquí esté el codo izquierdo", como si fuera brillo, y elegir después el punto más brillante, más que marcar un punto directo.

También hay un punto donde la analogía se queda corta. Las articulaciones del maniquí están de verdad ahí y solo giran en direcciones fijas, pero la estimación de pose no ve la articulación directamente: adivina el lugar solo a partir del brillo y las texturas de la pantalla. Por eso, en situaciones poco frecuentes en el entrenamiento —ropa holgada, poca luz, alguien acostado de costado— puede marcar un punto donde no hay ninguna articulación. El maniquí no dobla el brazo hacia atrás, pero el resultado de la estimación a veces sale con un ángulo que un cuerpo humano no puede alcanzar.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que la estimación de pose también averigua quién es la persona, pero en realidad solo marca el lugar de las articulaciones y no tiene relación con la identidad. Con solo los puntos es difícil distinguir si es la misma persona.

  • Es fácil creer que si hay un punto marcado, ahí hay una articulación, pero en realidad los lugares tapados también se completan por suposición, así que hay que mirar también el valor de confianza.

  • Es fácil suponer que también sale el significado del movimiento, pero en realidad solo sale la posición del punto; un juicio como "está saludando con la mano" lo hace una etapa siguiente que recibe esos puntos.

7Resumen en una línea

En resumenLa estimación de pose marca con puntos el lugar de las articulaciones en la foto y los une en el orden fijado, y así convierte la postura en unos pocos puntos y líneas.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02