La estimación de pose en AutoScript Sync
Cuando AutoScript Sync crea un funscript, la estimación de pose la hace un modelo YOLOv8-pose que se ejecuta en tu PC. Encuentra a cada persona en un fotograma muestreado y le coloca 17 puntos clave. Un rastreador sigue a esas personas de fotograma en fotograma y convierte su movimiento en señales de posición candidatas. La pose es opcional: es una candidata entre varias, y sin un modelo de pose el motor funciona solo con el flujo óptico.
Comprobado con el código de la aplicación el 21 de septiembre de 2026.
Qué modelo usa cada nivel de Accuracy
Hay cuatro tamaños de YOLOv8-pose. La aplicación descarga el pequeño automáticamente; los demás se obtienen desde el selector Download best de la aplicación, que recomienda el modelo grande en una GPU y el pequeño en una CPU.
| Modelo | Tamaño | Elegido para, en una GPU con CUDA |
|---|---|---|
yolov8n-pose (nano) | ~13 MB | Fast |
yolov8s-pose (pequeño) | ~45 MB | Balanced; la descarga predeterminada |
yolov8m-pose (mediano) | ~99 MB | Segunda opción para Balanced y High cuando su primera opción no está instalada |
yolov8l-pose (grande) | ~168 MB | High |
Esta correspondencia se aplica con Auto-pick model tier from Accuracy activado, que es lo predeterminado. La aplicación solo puede elegir un modelo que ya esté instalado, así que en una instalación predeterminada todos los niveles usan el modelo pequeño hasta que descargues otros. En una CPU los límites son deliberados: Fast usa solo el nano, y Balanced y High usan como mucho el pequeño. También puedes indicar tú mismo a la aplicación un archivo de modelo.
Lo que ve el modelo: 17 puntos clave por persona
Por defecto, la pose se ejecuta en cada fotograma muestreado, sobre la misma imagen de análisis de 320 px de ancho que usa el resto del motor. Ese fotograma se ajusta con bandas (letterbox) al tamaño de entrada del modelo: un modelo ONNX usa el tamaño con el que se exportó (640 px en las exportaciones estándar), y un modelo .pt ejecutado mediante el paquete Ultralytics incluido trabaja a 320 px.
Se conserva cada persona detectada con una confianza superior a 0,35, con los 17 puntos clave COCO estándar: puntos de la cabeza, hombros, codos, muñecas, caderas, rodillas y tobillos. La frecuencia con la que se ejecuta la pose es un intervalo en config.json (pose_every_n), fijado de fábrica en cada fotograma muestreado.
Cómo mantiene las identidades el rastreador de personas
Las detecciones solo son útiles si se sigue a la misma persona a lo largo de una escena. AutoScript Sync usa para ello su propio rastreador, no uno de serie. Empareja a las personas entre fotogramas por la distancia entre los centros de sus recuadros y por el tamaño del recuadro, tomando primero la coincidencia más cercana.
A partir de las personas seguidas construye varias señales candidatas: el movimiento vertical de las caderas y el movimiento relativo de pares de regiones del cuerpo (caderas con caderas, cabeza con caderas, manos con caderas), cada uno dividido por el tamaño del cuerpo. Cada candidata se puntúa según tres criterios:
- cuánto se repite: la proporción de su potencia en su pico más fuerte entre 0,2 y 4 Hz;
- cobertura: en qué parte de la escena se midió realmente, y cualquier valor por debajo del 40% puntúa cero;
- amplitud: cuánto se mueve.
La candidata con mejor puntuación gana por separado en cada capítulo de escena, así que un cambio de postura entre escenas puede cambiar qué señal de región del cuerpo aporta la pose.
Qué aporta la pose al script
La pose no escribe el script por sí sola. La traza de posición final se construye a partir del flujo óptico sujeto a un ancla, y la pose es una de las candidatas a ancla junto con el centro de la región en movimiento y la profundidad. Solo puede convertirse en el ancla única elegida para un vídeo cuando cubre al menos el 25% del vídeo y su puntuación ponderada por calidad es más de 0,6 veces la puntuación del centro de la región. Cuando no es elegida, sigue alimentando la mezcla predeterminada muestra a muestra de todos los canales legibles, y esa mezcla solo se usa si puntúa al menos tan bien como el canal elegido. Las puntuaciones de la elección de cada candidata se escriben en los metadatos del script, para que puedas ver cuál ganó.
La pose también ayuda a etiquetar el tipo de movimiento. La geometría de los puntos clave y la posición de la cara se usan como indicios para la etiqueta de cada ventana de 2 segundos, y pueden anular o ajustar la decisión del clasificador.
No se ha demostrado cuánto mejora la pose la traza de recorridos. En una película de prueba, activar o desactivar la pose solo movió la concordancia de recorridos (F1) con nuestro script de referencia entre 0,607 y 0,610, por debajo de la diferencia de 0,01 que el desarrollador considera significativa (el ruido entre ejecuciones era de unos ±0,005). Esa referencia era la salida del motor guiada por un recuadro de seguimiento dibujado a mano, no un script hecho a mano, y no se ha registrado ninguna comparación de los modelos de pose ligero y pesado en cuanto a precisión de recorridos.
Ejecución en la GPU y el recurso a la CPU
Los modelos de pose se ejecutan localmente como ONNX a través de ONNX Runtime, o como archivos .pt a través del conjunto Ultralytics y PyTorch incluido. La aceleración es solo NVIDIA CUDA; no hay aceleración AMD ni Intel para los modelos, y no se usa TensorRT.
ONNX Runtime puede cargarse en la CPU sin avisar cuando CUDA no se puede usar, así que la aplicación comprueba qué proveedor obtuvo realmente una sesión en lugar de suponerlo. Si se pidió una GPU con CUDA pero no se puede usar, la pose recurre a la CPU y la aplicación informa del proveedor en uso. El botón Check GPU hace esta comprobación cuando lo pides; los ms/fotograma que muestra son la autoprueba del propio modelo de pose, no la velocidad de un análisis completo.
Por defecto, la aplicación también desactiva el autoajuste de cuDNN para que la inferencia en GPU dé los mismos números en cada ejecución, a costa de algo de velocidad. Eso no garantiza un script idéntico al regenerar, porque la aplicación aprende entre ejecuciones.
Límites
- Cuerpos ocultos. Un punto clave que el modelo no puede ver no se mide. Una señal candidata medida en menos del 40% de una escena puntúa cero, y la pose no puede convertirse en el ancla elegida por debajo del 25% de cobertura del vídeo, así que en escenas muy ocultas el script se apoya en cambio en el flujo óptico y el centro de la región.
- Fotogramas abarrotados. El rastreador empareja a las personas solo por la posición y el tamaño del recuadro. No tiene modelo de apariencia, así que cuando las personas se solapan o se cruzan, las identidades pueden intercambiarse entre fotogramas.
- Figuras pequeñas. La pose se ejecuta sobre el fotograma de análisis de 320 px, así que una persona que ocupa una parte pequeña de un plano abierto deja al modelo pocos píxeles con los que trabajar.
- Velocidad. La pose ha sido la mayor parte del tiempo de análisis en las mediciones del desarrollador, por eso los niveles eligen modelos más pequeños para Fast y limitan el tamaño del modelo en una CPU.
Preguntas
¿Necesito un modelo de pose para hacer un script?
No. Sin él, el motor funciona solo con el flujo óptico y la línea de estado Inference lo indica. El modelo de pose pequeño se descarga automáticamente salvo que desactives las descargas automáticas.
¿Debo descargar el modelo de pose grande?
En una GPU NVIDIA, Download best lo recomienda y High lo usará. No hemos medido si hace mejores scripts que el modelo pequeño, así que es una opción, no una solución.
¿La pose funciona en una tarjeta gráfica AMD o Intel?
Sin aceleración. Los modelos de IA solo usan NVIDIA CUDA; en otro hardware la pose se ejecuta en la CPU, lo cual funciona pero es mucho más lento.
¿El modelo de pose envía algo por internet?
No. Se ejecuta en tu PC, y los módulos de análisis de la aplicación no contienen código de red. Solo la descarga del modelo en sí necesita internet.
Sigue leyendo
- Cómo funciona la generación de funscript con IAEl proceso completo y dónde encaja la pose en él.
- Seguimiento de movimiento por flujo ópticoLa señal con la que se compara la pose.
- Estimación de profundidad con MiDaSEl otro modelo opcional y el eje que recupera.
- Ejecutar AutoScript Sync en WindowsGPU, CPU, qué incluye el instalador y dónde se guardan los modelos.
Pruébalo con tus propios vídeos
La prueba dura un día y se ejecuta en tu propio PC; tus vídeos se analizan localmente y nunca se suben.