La stima della posa in AutoScript Sync
Quando AutoScript Sync crea un funscript, la stima della posa è affidata a un modello YOLOv8-pose che gira sul tuo PC. Trova ogni persona in un fotogramma campionato e vi colloca 17 punti chiave. Un tracker segue quelle persone da un fotogramma all'altro e trasforma il loro movimento in segnali di posizione candidati. La posa è opzionale: è un candidato tra diversi, e senza un modello di posa il motore lavora solo con il flusso ottico.
Verificato sul codice dell'app il 21 settembre 2026.
Quale modello usa ogni livello di Accuracy
Esistono quattro dimensioni di YOLOv8-pose. L'app scarica automaticamente quello piccolo; gli altri si ottengono dal selettore Download best dell'app, che consiglia il modello grande su una GPU e quello piccolo su una CPU.
| Modello | Dimensione | Scelto per, su una GPU CUDA |
|---|---|---|
yolov8n-pose (nano) | ~13 MB | Fast |
yolov8s-pose (piccolo) | ~45 MB | Balanced; il download predefinito |
yolov8m-pose (medio) | ~99 MB | Seconda scelta per Balanced e High quando la loro prima scelta non è installata |
yolov8l-pose (grande) | ~168 MB | High |
Questa corrispondenza vale con Auto-pick model tier from Accuracy attivato, che è il predefinito. L'app può scegliere solo un modello già installato, quindi con un'installazione predefinita ogni livello usa il modello piccolo finché non ne scarichi altri. Su una CPU i limiti sono voluti: Fast usa solo nano, e Balanced e High usano al massimo il modello piccolo. Puoi anche indicare tu all'app un file di modello.
Cosa vede il modello: 17 punti chiave per persona
Per impostazione predefinita la posa gira su ogni fotogramma campionato, sulla stessa immagine di analisi larga 320 px usata dal resto del motore. Quel fotogramma viene adattato con bande (letterbox) alla dimensione di input del modello: un modello ONNX usa la dimensione con cui è stato esportato (640 px per le esportazioni standard), e un modello .pt eseguito tramite il pacchetto Ultralytics incluso lavora a 320 px.
Ogni persona rilevata con una confidenza superiore a 0,35 viene mantenuta, con i 17 punti chiave COCO standard: punti della testa, spalle, gomiti, polsi, fianchi, ginocchia e caviglie. La frequenza con cui gira la posa è un passo in config.json (pose_every_n), impostato di serie su ogni fotogramma campionato.
Come il tracker delle persone mantiene le identità
I rilevamenti sono utili solo se la stessa persona viene seguita per tutta la scena. AutoScript Sync usa per questo un tracker proprio, non uno già pronto. Abbina le persone tra i fotogrammi in base alla distanza tra i centri dei loro riquadri e alla dimensione dei riquadri, prendendo per primo l'abbinamento più vicino.
Dalle persone tracciate costruisce diversi segnali candidati: il movimento verticale dei fianchi e il movimento relativo di coppie di regioni del corpo (fianchi con fianchi, testa con fianchi, mani con fianchi), ciascuno diviso per la dimensione del corpo. Ogni candidato riceve un punteggio su tre aspetti:
- quanto si ripete: la quota della sua potenza nel picco più forte tra 0,2 e 4 Hz;
- copertura: per quanta parte della scena è stato effettivamente misurato, con punteggio zero sotto il 40%;
- ampiezza: quanto si muove.
Il candidato con il punteggio migliore vince separatamente per ogni capitolo della scena, quindi un cambio di posizione tra una scena e l'altra può cambiare il segnale della regione del corpo fornito dalla posa.
Cosa aggiunge la posa allo script
La posa non scrive lo script da sola. La traccia di posizione finale è costruita dal flusso ottico tenuto agganciato a un'ancora, e la posa è una delle candidate ad ancora insieme al centro della regione in movimento e alla profondità. Può diventare l'unica ancora eletta per un video solo quando copre almeno il 25% del video e il suo punteggio ponderato per qualità è superiore a 0,6 volte il punteggio del centro della regione. Quando non viene eletta alimenta comunque la miscela predefinita, campione per campione, di tutti i canali leggibili, e quella miscela viene usata solo se ottiene un punteggio almeno pari a quello del canale eletto. I punteggi dell'elezione di ogni candidato vengono scritti nei metadati dello script, così puoi vedere chi ha vinto.
La posa aiuta anche a etichettare il tipo di movimento. La geometria dei punti chiave e la posizione del volto sono usate come indizi per l'etichetta di ogni finestra di 2 secondi, e possono prevalere sulla decisione del classificatore o correggerla.
Quanto la posa migliori la traccia delle corse non è stato dimostrato. Su un film di prova, attivare o disattivare la posa ha spostato la concordanza delle corse (F1) con il nostro script di riferimento solo tra 0,607 e 0,610, sotto la differenza di 0,01 che lo sviluppatore considera significativa (il rumore tra un'esecuzione e l'altra era di circa ±0,005). Quel riferimento era un output del motore guidato da un riquadro di tracciamento disegnato a mano, non uno script fatto a mano, e non è stato registrato alcun confronto tra i modelli di posa leggeri e pesanti sull'accuratezza delle corse.
Esecuzione sulla GPU e ripiego sulla CPU
I modelli di posa girano in locale come ONNX tramite ONNX Runtime, oppure come file .pt tramite lo stack Ultralytics e PyTorch incluso. L'accelerazione è solo NVIDIA CUDA; non c'è accelerazione AMD o Intel per i modelli, e TensorRT non viene usato.
ONNX Runtime può caricarsi silenziosamente sulla CPU quando CUDA non è utilizzabile, quindi l'app controlla quale provider ha effettivamente ottenuto una sessione invece di presumerlo. Se è stata richiesta una GPU CUDA ma non può essere usata, la posa ripiega sulla CPU e l'app riporta il provider in uso. Il pulsante Check GPU esegue questo controllo su richiesta; i ms/fotogramma che mostra sono l'autotest del modello di posa, non la velocità di un'analisi completa.
Per impostazione predefinita l'app disattiva anche l'autotuning di cuDNN, così l'inferenza su GPU dà gli stessi numeri da un'esecuzione all'altra, a un certo costo in velocità. Questo non garantisce uno script identico rigenerando, perché l'app impara tra un'esecuzione e l'altra.
Limiti
- Corpi nascosti. Un punto chiave che il modello non vede non viene misurato. Un segnale candidato misurato per meno del 40% di una scena ottiene punteggio zero, e la posa non può diventare l'ancora eletta sotto il 25% di copertura del video, quindi nelle scene molto coperte lo script si appoggia invece sul flusso ottico e sul centro della regione.
- Fotogrammi affollati. Il tracker abbina le persone solo in base alla posizione e alla dimensione del riquadro. Non ha un modello dell'aspetto, quindi quando le persone si sovrappongono o si incrociano, le identità possono essere scambiate tra un fotogramma e l'altro.
- Figure piccole. La posa gira sul fotogramma di analisi da 320 px, quindi una persona che occupa una piccola parte di un'inquadratura larga dà al modello pochi pixel con cui lavorare.
- Velocità. Nelle misurazioni dello sviluppatore la posa è stata la quota maggiore del tempo di analisi, ed è per questo che i livelli scelgono modelli più piccoli per Fast e limitano la dimensione del modello su una CPU.
Domande
Mi serve un modello di posa per creare uno script?
No. Senza di esso il motore lavora solo con il flusso ottico e la riga di stato Inference lo indica. Il modello di posa piccolo viene scaricato automaticamente, a meno che tu non disattivi i download automatici.
Dovrei scaricare il modello di posa grande?
Su una GPU NVIDIA, Download best lo consiglia e High lo userà. Non abbiamo misurato se produce script migliori del modello piccolo, quindi è una scelta, non una soluzione.
La posa gira su una scheda grafica AMD o Intel?
Non accelerata. I modelli di IA usano solo NVIDIA CUDA; su altro hardware la posa gira sulla CPU, il che funziona ma è molto più lento.
Il modello di posa invia qualcosa online?
No. Gira sul tuo PC, e i moduli di analisi dell'app non contengono codice di rete. Solo il download del modello richiede internet.
Da leggere dopo
- Come funziona la generazione di funscript con IAL'intera pipeline, e dove si colloca la posa.
- Tracciamento del movimento con flusso otticoIl segnale con cui viene confrontata la posa.
- Stima della profondità con MiDaSL'altro modello opzionale, e l'asse che recupera.
- Usare AutoScript Sync su WindowsGPU, CPU, cosa porta il programma di installazione e dove si trovano i modelli.
Provalo sui tuoi video
La prova dura un giorno e gira sul tuo PC; i tuoi video vengono analizzati in locale e non vengono mai caricati online.