L'IA dentro AutoScript Sync

Un funscript con IA nasce da diverse parti che lavorano insieme, tutte sul tuo PC. Una mappa di calore del movimento trova dove si svolge l'azione, il flusso ottico misura come si muove, modelli opzionali di posa e profondità aggiungono i punti chiave del corpo e una lettura di avvicinamento o allontanamento, un piccolo classificatore etichetta ogni finestra di 2 secondi per tipo di movimento, e un livellatore fonde tutto in un'unica curva di posizione. Impara dalle tue etichette e modifiche, e un'etichetta che imposti tu prevale sempre sulla sua ipotesi.

Verificato sul codice dell'app il 21 settembre 2026. Descrive la versione 2.121.1, la versione attuale.

Cosa apporta ciascuna parte

Ogni fotogramma campionato viene prima ridotto a 320 px di larghezza (i video VR vengono prima raddrizzati in una vista piatta di un occhio). Ricerca della regione, flusso, posa e profondità lavorano tutti su quel fotogramma piccolo.

Trovare l'azione: una mappa di calore della salienza del movimento

Senza una regione indicata da te, il motore tiene una mappa di calore dei punti in cui avviene il movimento, sfumando via via il movimento più vecchio, poi prende l'area connessa più calda e la allarga del 15%. È quell'area a essere misurata. Puoi sostituirla con un riquadro (Set Motion Region…) o con un riquadro mobile che trascini mentre il video scorre (Live Track). L'app registra anche quale punto chiave del corpo seguono i tuoi riquadri, così può proporre regioni sui nuovi video.

Misurare il movimento: flusso ottico DIS

Il flusso ottico stima come si è mosso ogni pixel tra due fotogrammi. Il motore predefinito usa il flusso denso DIS di OpenCV, più un passaggio più veloce a metà risoluzione che verifica se il flusso è affidabile. In High misura anche la regione tracciata a 640 px, per i video piatti larghi almeno così. Entrambi girano sulla CPU. La traccia di posizione viene integrata dalla velocità del flusso. Il flusso ottico in dettaglio.

Seguire le persone: YOLOv8-pose e il tracker delle persone

Se è installato un modello di posa (il download predefinito è YOLOv8 small-pose, circa 45 MB), trova ogni persona sopra una confidenza di 0,35 con 17 punti chiave del corpo. Un tracker abbina le persone da un fotogramma all'altro in base a posizione e dimensione del riquadro, costruisce segnali di movimento candidati da coppie di regioni del corpo e tiene quello con il ritmo più chiaro in ogni scena. La posa è opzionale: senza, il motore lavora solo con il flusso e lo indica nella sua riga di stato Inference. La stima della posa in dettaglio.

Vedere avvicinamento e allontanamento: profondità MiDaS

Il flusso ottico piatto non vede il movimento verso la camera o lontano da essa. I modelli di profondità MiDaS v2.1 (small, circa 64 MB, è il predefinito; large, circa 397 MB, è pensato per una GPU) stimano la profondità relativa su un fotogramma campionato ogni due, come media sui pixel in movimento nella regione. Questo diventa un ulteriore segnale di posizione candidato. Se il modello impiega più di 3 secondi per fotogramma, la profondità viene disattivata per quell'elaborazione. La stima della profondità in dettaglio.

Testimoni in background: vettori di movimento e audio

Su un thread in background, l'app legge i vettori di movimento compressi del video stesso e un inviluppo del volume a 50 Hz della colonna sonora, ciascuno entro un budget di tempo, quindi sui film lunghi possono coprirne solo una parte. Aiutano a decidere quali tratti meritano uno sguardo più attento, e l'audio tiene il movimento dei vuoti riempiti a tempo con il battito.

Etichettare il movimento: il classificatore del tipo di movimento

La timeline viene divisa in finestre di 2 secondi. Ogni finestra è descritta da sei caratteristiche del movimento e assegnata a uno di quattro tipi di scena generici da un piccolo modello di regressione logistica che si addestra mentre usi l'app. Gli indizi dalla geometria dei punti chiave della posa e dalla posizione del viso, attivi per impostazione predefinita, possono sostituire o correggere la sua decisione. Un passaggio di Viterbi poi leviga le etichette tra finestre vicine, così il tipo non oscilla avanti e indietro.

L'etichetta decide come viene modellato il movimento di quella finestra. Ogni tipo ha un profilo di modellazione, che parte neutro e cambia il risultato solo dopo che glielo insegni con le tue modifiche.

Le tue etichette prevalgono sempre. Un'etichetta che imposti e che copre almeno mezza finestra sostituisce la risposta del classificatore per quella finestra, e il passaggio di levigatura lascia stare le finestre insegnate.

Fondere tutto in un'unica curva

Il flusso dice quanto velocemente si muovono le cose; gli altri segnali dicono dove si trovano. Il motore integra la velocità del flusso in una traccia di posizione e la fonde con un'ancora in un filtro di Kalman con un livellatore Rauch-Tung-Striebel (RTS), che scorre l'intero video in avanti e poi all'indietro, così ogni punto beneficia di ciò che è venuto dopo.

L'ancora viene scelta per ogni video. Centro della regione, posa e profondità competono tra loro, e il segnale della posa può vincere solo se copre almeno un quarto del video e ottiene un punteggio sufficiente. Per impostazione predefinita il vincitore viene poi sostituito da una miscela di tutti i segnali leggibili, campione per campione, ma solo se la miscela ottiene un punteggio almeno pari. I punteggi di questa competizione vengono scritti nei metadati dello script, dove Report Studio può tracciarne il grafico.

Dove il tracciamento si interrompe, il vuoto viene riempito con un movimento ritmico che prosegue dalle corse circostanti, e viene registrata la quota della timeline riempita invece che misurata. I punti vengono poi posizionati a ogni cambio di direzione, con un'ampiezza della corsa che segue la velocità sullo schermo attraverso la curva di intensità (Smoothed per impostazione predefinita).

Come impara

Dalle tue modifiche
Quando salvi uno script generato dall'IA che hai modificato (Ctrl+S o Save As), l'app impara una scala della profondità della corsa e uno scostamento di posizione per ogni tipo di movimento dalle finestre che hai cambiato.
Dalle tue etichette
Teach class su un tratto selezionato della timeline lo etichetta. La tua etichetta sostituisce la risposta del classificatore per quelle finestre.
Tra un video e l'altro (apprendimento dal corpus)
Attivo per impostazione predefinita. Ogni generazione con IA può conservare fino a 40 esempi da quel video, e le elaborazioni successive li usano per riprendere il tracciamento. Quindi il risultato dipende in parte da ciò che hai analizzato prima.
Durante un'elaborazione (auto-apprendimento)
Attivo per impostazione predefinita in modalità automatica: il motore impara anche da solo durante ogni elaborazione.
AI Bulk Learn
Nel menu File. Analizza una cartella senza creare script, campiona brevi finestre (per impostazione predefinita 30 finestre di 4 secondi per video) e mette in coda quelle su cui il classificatore non sa decidere, da farti etichettare con la tastiera. Check my labels segnala le etichette che sembrano sbagliate rispetto agli indizi del movimento, e l'addestramento usa solo etichette umane.

Rigenerare lo stesso video con le stesse impostazioni di analisi riutilizza l'analisi del movimento fatta in precedenza nella sessione (gli ultimi tre video, in memoria), poi rifà solo le etichette e ricostruisce lo script, quindi riprovare dopo averlo istruito è quasi istantaneo.

Dove gira

Sul tuo PC. I modelli di posa e di profondità girano tramite ONNX Runtime o PyTorch, su una scheda grafica NVIDIA tramite CUDA quando è disponibile, altrimenti sulla CPU. Se chiedi la GPU e non può essere usata, ripiegano sulla CPU e l'app indica quale è davvero in uso; il pulsante Check GPU ti dice se l'analisi avviene sulla scheda grafica. Il flusso ottico gira sempre sulla CPU. Non c'è accelerazione AMD o Intel per i modelli di IA, e TensorRT non viene usato.

Per impostazione predefinita l'app disattiva una funzione di ottimizzazione automatica della GPU, così i modelli danno gli stessi numeri a ogni esecuzione, a un certo costo in velocità. Gli script possono comunque differire tra un'elaborazione e l'altra perché l'app continua a imparare. GPU, CPU e installazione su Windows descrive i requisiti.

Cosa sbaglia ancora l'IA

Lo sviluppatore confronta il motore con script scritti a mano. Su un piccolo insieme di clip, quel confronto mostra dove è carente. È un controllo interno, non un benchmark, quindi non ne ricaviamo alcun punteggio.

  • Cambi di direzione persi. Alcune inversioni che una persona scripta non compaiono nel risultato dell'IA, in ogni film testato.
  • Corse troppo piccole nelle scene veloci. L'ampiezza delle corse è più o meno giusta nei film più lenti e decisamente troppo piccola in quelli veloci. Meno fotogrammi campionati peggiorano le cose.
  • Movimento dove non ce n'è. Dentro l'azione, il motore spesso continua a produrre corse in tratti che una persona lascerebbe fermi. Esiste un filtro che terrebbe fermi quei tratti, ma è disattivato per impostazione predefinita.
  • Errori sul tipo di scena. Le decisioni del classificatore hanno un'accuratezza limitata. Etichetta le finestre che sbaglia; le tue etichette prevalgono.
  • Riempito, non misurato. Dove il tracciamento si perde, la curva viene riempita seguendo il ritmo invece di essere letta dal video. Il report di qualità mostra in che misura.

Non pubblichiamo una cifra di tempi o di accuratezza perché nessuna è ancora stata misurata rispetto a script indipendenti fatti a mano su una scala che ci sentiremmo di garantire. La pagina dei benchmark spiega cosa è stato misurato e cosa no.

Domande

L'IA invia i miei video a un server per elaborarli?

No. Ogni modello gira sul tuo PC e il codice di analisi non effettua chiamate di rete. Internet serve per scaricare i modelli, controllare gli aggiornamenti, la licenza e il cloud dell'Autoblow AI Ultra, che riceve lo script ma mai il video.

Quali modelli vengono scaricati?

Per impostazione predefinita YOLOv8 small-pose e MiDaS small, circa 109 MB in tutto. Il pulsante Download best nell'app offre modelli di posa più grandi (fino a YOLOv8 large, circa 168 MB) e ne consiglia uno adatto a una GPU o a una CPU.

Posso disattivare l'IA?

Togliendo la spunta a "Use adaptive AI engine", il pulsante Generate passa a un motore di base che segue il movimento verticale principale con il flusso ottico Farneback sui fotogrammi a piena risoluzione. La casella viene spuntata di nuovo a ogni avvio, e Batch Generate Folder e Generate + Play usano sempre il motore di IA.

Migliora più lo uso?

Cambia con l'uso: le tue etichette, le modifiche salvate e gli esempi che conserva dai video precedenti alimentano tutti le elaborazioni successive. Non abbiamo misurato quanto questo migliori i risultati, quindi non dichiariamo alcun numero.

Da leggere dopo

Guarda l'IA al lavoro sui tuoi video

La prova gratuita sblocca tutte le funzioni per un giorno; una licenza costa £14.99 una volta e non è legata a una versione.