Visión y audio Intermedio

Reconocimiento de accionesAction Recognition

Ver una secuencia de cuadros para descubrir qué acción es

Puntos clave
  • El reconocimiento de acciones no mira una sola foto: une varios cuadros seguidos y les pone nombre a qué acción es.
  • La misma postura puede ser una acción distinta según lo que pasó antes y después. Si se invierte el orden, el significado también se invierte.
  • Lo más difícil no es el veredicto, sino decidir dónde empieza y dónde termina un movimiento.
  • Su papel es distinto al de anotar posiciones. Lee un flujo ya anotado y le pone un nombre.
  • El fondo y los objetos cercanos a veces ayudan como pista, pero también pueden convertirse en un atajo engañoso.
Contenido

1La analogía

Con una sola foto del balón subiendo por encima del pie, es difícil saber qué está pasando. Si recién se lo pateó, si el pie se levantó para patearlo, o si ya se lo pateó y ahora el pie está bajando: nada de eso queda en la foto.

Si se miran unos instantes seguidos, aparece una historia. Cuando se ve la secuencia completa —el pie sube, el balón salta, el pie baja— recién ahí se convierte en "lo pateó". Un sentido que no estaba en ningún cuadro suelto nace del orden.

Si se invierte el orden, el significado también se da vuelta. Encadenar los mismos tres cuadros al revés se convierte en la escena de un balón que cae sobre el pie. Contar cuántas veces se pateó es igual: hay que decidir dónde cortar cada subida y bajada para que recién ahí aparezca un número.

2En detalle

Con un solo cuadro no se sabe

Acá se separan la clasificación de imágenes y el reconocimiento de acciones. Con una sola foto ya se puede reconocer el objeto "balón". Pero "patear" no es un objeto, sino un cambio que ocurre en el tiempo, así que no entra en un solo cuadro.

Pensar en sentarse y en pararse lo deja claro. Una foto que corta el instante intermedio es idéntica en las dos acciones. Mirando solo el ángulo de la rodilla nunca se sabe cuál de las dos es; hay que ver si el cuadro anterior mostraba a la persona parada o sentada.

Por eso el reconocimiento de acciones siempre recibe varios cuadros como un solo bloque. Suele meter de golpe entre uno y tres segundos, es decir, varias decenas de cuadros.

¿Cómo se agrupan varios cuadros?

Se usan sobre todo dos caminos. Uno recibe el video tal cual y busca patrones tratando el tiempo como un eje más, además del ancho y el alto. Puede usar toda la información visible en pantalla, como el color de la ropa o la forma de un objeto, así que es detallado, pero el cálculo es pesado.

El otro camino primero saca la posición de las articulaciones y la convierte en un registro de puntos, y juzga mirando solo ese flujo de números. Al desaparecer la ropa y el fondo, es mucho más liviano y no se altera aunque cambie la luz o el color de la ropa. A cambio, descarta por completo información como qué tiene la persona en la mano.

Algunas herramientas combinan los dos: usan la vista completa para captar el movimiento general y el flujo de articulaciones para confirmar el detalle.

Hay que cortar dónde empieza y termina un movimiento

Ponerle nombre a un video ya recortado de tres segundos es relativamente fácil. Lo verdaderamente difícil es tomar un video de varios minutos, tal cual, y marcar "de acá a acá es una vez".

El inicio y el fin de una acción tampoco coinciden bien entre distintas personas. Ya varía si el movimiento preparatorio de levantar el pie para patear el balón cuenta como parte de la acción o no. Si cada persona que arma los datos de referencia traza el límite de forma distinta, el modelo también aprende de manera confusa.

Por eso las funciones que cuentan repeticiones fallan más seguido de lo que parece. Es común que cuenten una vez como dos, o que junten en una sola dos repeticiones muy seguidas.

El fondo como atajo

Si para enseñar la brazada de nadar solo se juntan videos filmados en una pileta, el modelo aprende el truco de responder "nadando" con solo ver el color del agua. Aunque la persona esté parada quieta junto al agua, sale como nadando. El resultado tiene buena nota en la prueba, pero no sirve en la vida real.

Este atajo aparece cuando los datos de referencia están sesgados hacia un solo lado. Se reduce filmando la misma acción en varios lugares distintos, o borrando el fondo y dejando solo el flujo de las articulaciones para entrenar. Por eso importa revisar en qué se fijó el modelo para acertar.

La misma acción varía de persona a persona

La forma de patear el balón cambia según la persona y según el día. La altura del pie y el ritmo son distintos, y quien es zurdo o diestro queda invertido de izquierda a derecha. Según si la cámara filma de costado o de frente, la dirección del movimiento en pantalla también cambia por completo.

Por eso se enseña una misma acción con varias personas, varios ángulos y varias velocidades. A veces también se agregan copias del video invertidas de izquierda a derecha o un poco aceleradas. Mostrar este rango amplio es lo que permite ponerle el mismo nombre a la acción de alguien que el modelo nunca vio antes.

3Con más precisión

El reconocimiento de acciones es un problema de clasificación que recibe un bloque de cuadros como entrada. Al trabajar con el video en sí, extrae rasgos en tres direcciones —ancho, alto y tiempo—; al trabajar con coordenadas de articulaciones, usa una estructura que mira a la vez la conexión entre puntos y el orden temporal. Ponerle nombre a un fragmento ya recortado y encontrar el fragmento dentro de un video largo se tratan como problemas distintos, y el segundo es mucho más difícil.

También hay un punto donde la analogía se queda corta. Quien ve patear el balón puede decir "esto es algo nuevo" incluso ante un movimiento que nunca vio, pero el reconocimiento de acciones solo elige entre los nombres fijados durante el entrenamiento. Una acción que no está en la lista igual termina metida en algún lugar de esa lista. Además, una persona juzga viendo juntos el objeto —el balón— y el movimiento del pie, pero el método que solo mira el flujo de las articulaciones no ve el objeto para nada, así que no distingue entre imitar el gesto con las manos vacías y patear de verdad.

4Pruébalo

5Malentendidos comunes

  • Es fácil pensar que con una sola foto ya se puede saber la acción, pero en realidad hay muchas acciones, como sentarse o pararse, que solo se distinguen mirando lo que pasó antes y después.

  • Es fácil creer que con captar la postura ya termina el reconocimiento de acciones, pero en realidad hace falta leer de nuevo cómo cambian esas posturas capturadas a lo largo del tiempo para que reciban un nombre.

  • Es fácil suponer que contar repeticiones es una función sencilla, pero en realidad, como el inicio y el fin de una repetición no coinciden ni entre personas, se equivoca con frecuencia.

7Resumen en una línea

En resumenEl reconocimiento de acciones agrupa una secuencia de cuadros en un solo bloque y le pone nombre a la acción, y el sentido no nace de un cuadro sino del orden entre los cuadros.

¿Has visto un error o tienes una analogía mejor? Sugerir una corrección · Última actualización2026-09-02