Stima della profondità: l'asse che un video piatto nasconde
Un video è piatto, quindi il movimento dritto verso la camera o via da essa si vede appena come movimento sullo schermo. La stima della profondità per i funscript colma quel vuoto: AutoScript Sync esegue sul tuo PC un modello MiDaS che stima quanto è vicina ogni parte del fotogramma, e segue come questo cambia nella regione in movimento. Il risultato è un ulteriore segnale di posizione candidato. La profondità è opzionale, e lo script resta costruito sul flusso ottico.
Verificato sul codice dell'app il 21 settembre 2026.
Perché la profondità conta
Il flusso ottico misura come le cose si muovono attraverso l'immagine: su, giù, sinistra, destra. Quando una corsa segue la linea di vista della camera, come nei filmati in soggettiva (POV), l'oggetto in movimento soprattutto si ingrandisce e si rimpicciolisce invece di attraversare l'inquadratura. Il flusso ne vede pochissimo. Un modello di profondità legge gli stessi fotogrammi come vicino e lontano, quindi una corsa lungo quell'asse compare invece come un cambio di profondità.
Quale modello MiDaS viene usato
AutoScript Sync usa modelli di profondità MiDaS v2.1 in formato ONNX. Danno una profondità relativa, cioè più vicino e più lontano all'interno di un'immagine, non distanze in centimetri.
| Modello | Dimensione | Usato |
|---|---|---|
| MiDaS small | ~64 MB | Fast e Balanced, e ogni livello su una CPU. Il download predefinito. |
| MiDaS large | ~397 MB | High, solo su una GPU CUDA, se l'hai scaricato. È consigliata una GPU. |
Questa scelta la fa Auto-pick model tier from Accuracy, attivo per impostazione predefinita, e può scegliere solo un modello già installato. Il motore accetta qualsiasi modello ONNX di profondità relativa che gli indichi, ma MiDaS è l'unico che l'app propone di scaricare.
Come la profondità diventa un segnale
La profondità viene stimata su un fotogramma campionato ogni due, sull'immagine di analisi larga 320 px, e mediata sui pixel che si stanno effettivamente muovendo dentro la regione tracciata. Il risultato si affianca al centro della regione e ai punti chiave della posa come ancora candidata per la traccia di posizione. Se il modello di profondità impiega più di 3 secondi per fotogramma, il motore disattiva la profondità per il resto dell'esecuzione invece di lasciare che un modello lento blocchi l'intero lavoro.
Una sola scala di profondità per video, non per fotogramma
L'output di un modello di profondità non ha unità fisse: ogni fotogramma torna con una scala propria. Se ogni fotogramma viene normalizzato per conto suo, la scala stessa cambia da un fotogramma all'altro, e quel cambiamento sembra movimento. AutoScript Sync invece fissa una sola scala per tutto il video, a partire da percentili robusti delle letture di profondità, così un cambiamento nel numero significa un cambiamento nella scena.
| Misura | Scala per fotogramma | Scala per video |
|---|---|---|
| Correlazione tra fotogrammi dei cambi di profondità | 0.594 | 0.963 |
| Passi con un'inversione di direzione spuria | 42% | 2% |
È una misurazione ingegneristica ristretta rispetto all'output grezzo del modello, fatta dallo sviluppatore il 10 settembre 2026. Mostra che la scala per video impedisce al segnale di profondità di contraddirsi; non misura quanto è accurato lo script finito.
Impostazioni che influiscono sulla profondità
Due cursori nelle impostazioni della corsa hanno "Depth" nel nome. Solo Depth priority cambia l'analisi; Depth emphasis modella la lunghezza della corsa sulla via verso un dispositivo e non coinvolge il modello MiDaS. Nessuno dei due attiva o disattiva il modello di profondità; questo dipende dal fatto che un modello di profondità sia installato e scelto.
- Depth priority
- Da 30 a 90, predefinito 85. Stabilisce quanto della traccia di posizione viene dalla velocità misurata anziché dall'ancora di posizione, di cui la profondità è una candidata: più alto il valore, meno peso riceve l'ancora. Il suggerimento dell'app descrive la velocità come ciò che porta l'ampiezza della corsa e l'ancora come ciò che ferma la deriva ma appiattisce la profondità, e consiglia di abbassarla a 45–65 se uno script sembra troppo frenetico o troppo profondo. Cambia l'analisi, quindi richiede una rigenerazione.
- Depth emphasis
- Da 100% a 200%, predefinito 100% (neutro). Le corse profonde percorrono proporzionalmente più strada. Modella la copia inviata a un dispositivo, quindi invia di nuovo lo script dopo averla cambiata; il file salvato non cambia. Nell'app rilasciata questa modellazione per il dispositivo si applica al caricamento sull'Autoblow AI Ultra; l'applicazione ai dispositivi Intiface, e la sua inclusione in Export Script (as played), arrivano nel prossimo aggiornamento.
Quanto costa la profondità
La profondità gira su una GPU NVIDIA tramite CUDA quando è disponibile, altrimenti sulla CPU; l'app riporta quale sta effettivamente usando. Un commento nel codice dal PC di prova con RTX 5080 indica MiDaS small a circa 25,8 ms per chiamata sulla GPU contro 234 ms sulla CPU. Eseguirla su un fotogramma campionato ogni due anziché su tutti dimezza quel lavoro. Sulla GPU, il pool di memoria CUDA del modello di profondità è limitato a 4 GB.
Non abbiamo pubblicato quale quota di un'analisi completa richieda la profondità, perché nessuna tabella di misurazioni sostiene la stima di lavoro. La pagina dei benchmark elenca cosa è stato misurato.
Limiti
- Relativa, non assoluta. MiDaS dice più vicino o più lontano, non quanto lontano. L'ampiezza della corsa viene comunque dalla traccia fusa, non dalla sola profondità.
- Mediata sulla regione in movimento. La profondità viene mediata su ogni pixel in movimento nella regione tracciata, quindi altri movimenti al suo interno finiscono nella media insieme alla corsa. Disegnare tu la regione con Set Motion Region… o Live Track la restringe.
- Più pesante non significa provato migliore. Non è stato registrato alcun confronto tra MiDaS small e MiDaS large sull'accuratezza delle corse.
- L'ampiezza delle corse resta un punto debole. Rispetto alle clip di prova scriptate a mano dallo sviluppatore, le corse del motore sui due film più veloci erano un quarto e la metà dell'ampiezza di quelle dell'umano. Non c'è una misurazione registrata dell'errore di profondità in unità assolute.
Domande
Mi serve un modello di profondità?
No. Senza, il motore lavora con il flusso ottico, il centro della regione e la posa se installata. MiDaS small viene scaricato automaticamente, a meno che tu non disattivi i download automatici.
Dovrei prendere MiDaS large?
Solo se usi High su una GPU NVIDIA; non viene usato su una CPU né agli altri livelli. Non abbiamo misurato se produce script migliori di MiDaS small.
Uno script sembra troppo profondo o troppo frenetico. È colpa della profondità?
Potrebbe essere l'equilibrio tra velocità e ancora. Prova Depth priority tra 45 e 65 e rigenera. Se le corse sembrano semplicemente troppo lunghe sul dispositivo, Depth emphasis al 100% è neutro.
La stima della profondità funziona sui video VR?
I filmati VR vengono prima raddrizzati in una normale vista prospettica di un occhio, e la profondità gira su quella vista come su qualsiasi altro filmato. Il rilevamento del layout è euristico, basato su alcuni fotogrammi campionati.
Da leggere dopo
- Come funziona la generazione di funscript con IAL'intera pipeline, dalla decodifica al dispositivo.
- Come il flusso ottico legge il movimentoIl segnale di velocità con cui viene confrontata la profondità.
- La stima della posa in AutoScript SyncL'altro modello opzionale e candidato ad ancora.
- Cosa contribuisce ogni parte dell'IAI modelli visti dal lato del prodotto, e come l'app impara dalle modifiche.
Provalo sui tuoi video
La prova dura un giorno e gira sul tuo PC; i tuoi video vengono analizzati in locale e non vengono mai caricati online.