L'estimation de pose dans AutoScript Sync
Quand AutoScript Sync crée un funscript, l'estimation de pose est faite par un modèle YOLOv8-pose qui tourne sur votre PC. Il trouve chaque personne dans une image échantillonnée et place 17 points clés sur elle. Un traqueur suit ces personnes d'une image à l'autre et transforme leur mouvement en signaux de position candidats. La pose est optionnelle : c'est un candidat parmi d'autres, et sans modèle de pose le moteur fonctionne sur le flux optique seul.
Vérifié par rapport au code de l'application le 21 septembre 2026.
Quel modèle utilise chaque niveau d'Accuracy
Il existe quatre tailles de YOLOv8-pose. L'application télécharge automatiquement le petit ; les autres s'obtiennent via le sélecteur Download best intégré à l'application, qui recommande le grand modèle sur un GPU et le petit sur un CPU.
| Modèle | Taille | Choisi pour, sur un GPU CUDA |
|---|---|---|
yolov8n-pose (nano) | ~13 Mo | Fast |
yolov8s-pose (petit) | ~45 Mo | Balanced ; le téléchargement par défaut |
yolov8m-pose (moyen) | ~99 Mo | Deuxième choix pour Balanced et High quand leur premier choix n'est pas installé |
yolov8l-pose (grand) | ~168 Mo | High |
Cette correspondance s'applique quand Auto-pick model tier from Accuracy est activé, ce qui est le cas par défaut. L'application ne peut choisir qu'un modèle déjà installé, donc sur une installation par défaut tous les niveaux utilisent le petit modèle tant que vous n'en téléchargez pas d'autres. Sur un CPU, les plafonds sont volontaires : Fast utilise uniquement nano, et Balanced et High utilisent au plus le petit modèle. Vous pouvez aussi indiquer vous-même un fichier de modèle à l'application.
Ce que voit le modèle : 17 points clés par personne
La pose est calculée par défaut sur chaque image échantillonnée, sur la même image d'analyse de 320 px de large que le reste du moteur. Cette image est mise en letterbox à la taille d'entrée du modèle : un modèle ONNX utilise la taille avec laquelle il a été exporté (640 px pour les exports standard), et un modèle .pt exécuté par le paquet Ultralytics intégré travaille en 320 px.
Chaque personne détectée avec une confiance supérieure à 0,35 est conservée, avec les 17 points clés COCO standard : points de la tête, épaules, coudes, poignets, hanches, genoux et chevilles. La fréquence de la pose est un pas défini dans config.json (pose_every_n), réglé d'origine sur chaque image échantillonnée.
Comment le traqueur de personnes conserve les identités
Les détections ne servent que si la même personne est suivie tout au long d'une scène. AutoScript Sync utilise pour cela son propre traqueur, pas un traqueur tout fait. Il associe les personnes d'une image à l'autre selon la distance entre les centres de leurs cadres et la taille des cadres, en prenant d'abord la correspondance la plus proche.
À partir des personnes suivies, il construit plusieurs signaux candidats : le mouvement vertical des hanches, et le mouvement relatif de paires de régions du corps (hanches à hanches, tête à hanches, mains à hanches), chacun divisé par la taille du corps. Chaque candidat est noté sur trois critères :
- la force de sa répétition : la part de sa puissance dans son pic le plus fort entre 0,2 et 4 Hz ;
- la couverture : la part de la scène sur laquelle il a réellement été mesuré, tout ce qui est sous 40 % recevant zéro ;
- l'amplitude : à quel point il bouge.
Le candidat le mieux noté l'emporte séparément pour chaque chapitre de scène, donc un changement de position entre les scènes peut changer le signal de région du corps apporté par la pose.
Ce que la pose apporte au script
La pose n'écrit pas le script à elle seule. La courbe de position finale est construite à partir du flux optique tenu à un point d'ancrage, et la pose est l'un des candidats d'ancrage, avec le centre de la zone en mouvement et la profondeur. Elle ne peut devenir l'ancrage unique élu pour une vidéo que si elle couvre au moins 25 % de la vidéo et que son score pondéré par la qualité dépasse 0,6 fois le score du centre de la zone. Quand elle n'est pas élue, elle alimente quand même le mélange par défaut, échantillon par échantillon, de tous les canaux lisibles, et ce mélange n'est utilisé que s'il obtient un score au moins aussi bon que le canal élu. Les scores d'élection de chaque candidat sont inscrits dans les métadonnées du script, pour que vous puissiez voir lequel l'a emporté.
La pose aide aussi à étiqueter le type de mouvement. La géométrie des points clés et la position du visage servent d'indices pour l'étiquette de chaque fenêtre de 2 secondes, et peuvent remplacer ou ajuster la décision du classifieur.
L'amélioration apportée par la pose à la courbe des mouvements n'a pas été démontrée. Sur un film de test, activer ou désactiver la pose n'a fait varier la concordance des mouvements (F1) avec notre script de référence qu'entre 0,607 et 0,610, sous l'écart de 0,01 que le développeur considère comme significatif (le bruit d'un essai à l'autre était d'environ ±0,005). Cette référence était une sortie du moteur guidée par un cadre de suivi tracé à la main, pas un script fait à la main, et aucune comparaison des modèles de pose léger et lourd sur la précision des mouvements n'a été enregistrée.
Exécution sur le GPU, et repli sur le CPU
Les modèles de pose tournent localement au format ONNX via ONNX Runtime, ou en fichiers .pt via la pile Ultralytics et PyTorch intégrée. L'accélération est uniquement NVIDIA CUDA ; il n'y a pas d'accélération AMD ou Intel pour les modèles, et TensorRT n'est pas utilisé.
ONNX Runtime peut se charger discrètement sur le CPU quand CUDA n'est pas utilisable, donc l'application vérifie quel fournisseur une session a réellement obtenu plutôt que de le supposer. Si un GPU CUDA a été demandé mais ne peut pas être utilisé, la pose se rabat sur le CPU et l'application indique le fournisseur utilisé. Le bouton Check GPU lance cette vérification à la demande ; les ms/image qu'il affiche sont l'autotest du modèle de pose lui-même, pas la vitesse d'une analyse complète.
Par défaut, l'application désactive aussi l'autoréglage de cuDNN pour que l'inférence GPU donne les mêmes chiffres d'un essai à l'autre, au prix d'un peu de vitesse. Cela ne garantit pas un script identique à la régénération, car l'application apprend entre les essais.
Limites
- Corps masqués. Un point clé que le modèle ne voit pas n'est pas mesuré. Un signal candidat mesuré sur moins de 40 % d'une scène reçoit zéro, et la pose ne peut pas devenir l'ancrage élu en dessous de 25 % de couverture de la vidéo, donc dans les scènes très masquées le script s'appuie plutôt sur le flux optique et le centre de la zone.
- Images chargées. Le traqueur associe les personnes uniquement par position et taille du cadre. Il n'a pas de modèle d'apparence, donc quand des personnes se chevauchent ou se croisent, les identités peuvent être échangées d'une image à l'autre.
- Petites silhouettes. La pose tourne sur l'image d'analyse de 320 px, donc une personne qui n'occupe qu'une petite partie d'un plan large laisse peu de pixels au modèle.
- Vitesse. La pose représente la plus grande part du temps d'analyse dans les mesures du développeur, c'est pourquoi les niveaux choisissent des modèles plus petits pour Fast et plafonnent la taille du modèle sur un CPU.
Questions
Ai-je besoin d'un modèle de pose pour créer un script ?
Non. Sans modèle, le moteur fonctionne sur le flux optique seul et la ligne d'état Inference l'indique. Le petit modèle de pose est téléchargé automatiquement, sauf si vous désactivez les téléchargements automatiques.
Dois-je télécharger le grand modèle de pose ?
Sur un GPU NVIDIA, Download best le recommande et High l'utilisera. Nous n'avons pas mesuré s'il produit de meilleurs scripts que le petit modèle : c'est un choix, pas une solution.
La pose fonctionne-t-elle sur une carte graphique AMD ou Intel ?
Sans accélération. Les modèles d'IA utilisent uniquement NVIDIA CUDA ; sur un autre matériel, la pose tourne sur le CPU, ce qui fonctionne mais bien plus lentement.
Le modèle de pose envoie-t-il quelque chose en ligne ?
Non. Il tourne sur votre PC, et les modules d'analyse de l'application ne contiennent aucun code réseau. Seul le téléchargement du modèle lui-même nécessite Internet.
À lire ensuite
- Comment fonctionne la génération de funscript par IALe pipeline complet, et la place de la pose dans celui-ci.
- Suivi de mouvement par flux optiqueLe signal auquel la pose est comparée.
- Estimation de profondeur avec MiDaSL'autre modèle optionnel, et l'axe qu'il retrouve.
- Utiliser AutoScript Sync sous WindowsGPU, CPU, ce qu'apporte l'installateur et où se trouvent les modèles.
Essayez-le sur vos propres vidéos
L'essai dure une journée et tourne sur votre propre PC ; vos vidéos sont analysées localement et jamais envoyées en ligne.