Estimation de profondeur : l'axe qu'une vidéo plate masque
Une vidéo est plate, donc un mouvement droit vers la caméra ou à l'opposé se voit à peine comme un mouvement à l'écran. L'estimation de profondeur pour funscripts comble ce manque : AutoScript Sync fait tourner sur votre PC un modèle MiDaS qui estime la proximité de chaque partie de l'image, et suit comment elle évolue dans la zone en mouvement. Le résultat est un signal de position candidat de plus. La profondeur est optionnelle, et le script reste construit sur le flux optique.
Vérifié par rapport au code de l'application le 21 septembre 2026.
Pourquoi la profondeur compte
Le flux optique mesure comment les choses se déplacent dans l'image : haut, bas, gauche, droite. Quand un mouvement suit l'axe de visée de la caméra, comme dans les vidéos en point de vue (POV), l'objet en mouvement grossit et rétrécit surtout, au lieu de traverser l'image. Le flux en voit très peu. Un modèle de profondeur lit les mêmes images en termes de proche et de lointain, donc un mouvement le long de cet axe apparaît plutôt comme un changement de profondeur.
Quel modèle MiDaS est utilisé
AutoScript Sync utilise les modèles de profondeur MiDaS v2.1 au format ONNX. Ils donnent une profondeur relative, c'est-à-dire plus proche et plus loin au sein d'une même image, pas des distances en centimètres.
| Modèle | Taille | Utilisé |
|---|---|---|
| MiDaS small | ~64 Mo | Fast et Balanced, et tous les niveaux sur un CPU. Le téléchargement par défaut. |
| MiDaS large | ~397 MB | High, uniquement sur un GPU CUDA, si vous l'avez téléchargé. Un GPU est conseillé. |
Ce choix est fait par Auto-pick model tier from Accuracy, activé par défaut, et il ne peut choisir qu'un modèle déjà installé. Le moteur accepte n'importe quel modèle ONNX de profondeur relative que vous lui indiquez, mais MiDaS est le seul que l'application propose de télécharger.
Comment la profondeur devient un signal
La profondeur est calculée sur une image échantillonnée sur deux, sur l'image d'analyse de 320 px de large, et moyennée sur les pixels qui bougent réellement dans la zone suivie. Le résultat rejoint le centre de la zone et les points clés de pose comme candidat d'ancrage pour la courbe de position. Si le modèle de profondeur prend plus de 3 secondes par image, le moteur désactive la profondeur pour le reste de ce traitement plutôt que de laisser un modèle lent retarder tout le travail.
Une seule échelle de profondeur par vidéo, pas par image
La sortie d'un modèle de profondeur n'a pas d'unité fixe : chaque image revient avec sa propre échelle. Si chaque image est normalisée séparément, l'échelle elle-même varie d'une image à l'autre, et cette variation ressemble à un mouvement. AutoScript Sync fixe plutôt une seule échelle pour toute la vidéo, à partir de percentiles robustes des mesures de profondeur, pour qu'un changement de valeur corresponde à un changement dans la scène.
| Mesure | Échelle par image | Échelle par vidéo |
|---|---|---|
| Corrélation d'une image à l'autre des variations de profondeur | 0.594 | 0.963 |
| Pas avec une inversion de direction parasite | 42% | 2% |
Il s'agit d'une mesure technique étroite, par rapport à la sortie brute du modèle, faite par le développeur le 10 septembre 2026. Elle montre que la mise à l'échelle par vidéo empêche le signal de profondeur de se contredire ; ce n'est pas une mesure de la précision du script final.
Les réglages qui agissent sur la profondeur
Deux curseurs des réglages de mouvement ont « depth » dans leur nom. Seul Depth priority modifie l'analyse ; Depth emphasis agit sur l'amplitude des mouvements lors de l'envoi à un appareil et ne fait pas intervenir le modèle MiDaS. Aucun des deux n'active ni ne désactive le modèle de profondeur ; cela dépend de la présence d'un modèle de profondeur installé et choisi.
- Depth priority
- De 30 à 90, 85 par défaut. Il fixe la part de la courbe de position qui vient de la vitesse mesurée plutôt que du point d'ancrage de position, dont la profondeur est l'un des candidats : plus la valeur est élevée, moins l'ancrage a de poids. L'infobulle de l'application décrit la vitesse comme porteuse de l'amplitude des mouvements, et l'ancrage comme ce qui empêche la dérive mais aplatit la profondeur ; elle suggère de le baisser à 45–65 si un script semble trop agité ou trop profond. Il modifie l'analyse, il faut donc régénérer.
- Depth emphasis
- De 100 % à 200 %, 100 % par défaut (neutre). Les mouvements profonds vont proportionnellement plus loin. Il agit sur la copie envoyée à un appareil, donc renvoyez le script après l'avoir modifié ; le fichier enregistré n'est pas modifié. Dans l'application publiée, cette mise en forme s'applique à l'envoi vers l'Autoblow AI Ultra ; son application aux appareils Intiface, ainsi que son intégration à Export Script (as played), arrivent avec la prochaine mise à jour.
Ce que coûte la profondeur
La profondeur tourne sur un GPU NVIDIA via CUDA quand il y en a un, et sur le CPU sinon ; l'application indique lequel elle utilise réellement. Un commentaire du code issu du PC de test RTX 5080 donne environ 25,8 ms par appel pour MiDaS small sur le GPU, contre 234 ms sur le CPU. Le calcul sur une image échantillonnée sur deux plutôt que sur chacune divise ce travail par deux. Sur le GPU, la réserve de mémoire CUDA du modèle de profondeur est plafonnée à 4 Go.
Nous n'avons pas publié la part du temps d'analyse totale que prend la profondeur, car aucun tableau de mesures ne soutient l'estimation de travail. La page des benchmarks liste ce qui a été mesuré.
Limites
- Relative, pas absolue. MiDaS dit plus proche ou plus loin, pas à quelle distance. L'amplitude des mouvements vient toujours de la courbe fusionnée, pas de la profondeur seule.
- Moyennée sur la zone en mouvement. La profondeur est moyennée sur chaque pixel en mouvement de la zone suivie, donc tout autre mouvement dans cette zone est mélangé au mouvement principal. Tracer votre propre zone avec Set Motion Region… ou Live Track la resserre.
- Plus lourd n'est pas prouvé meilleur. Aucune comparaison de MiDaS small et MiDaS large sur la précision des mouvements n'a été enregistrée.
- L'amplitude des mouvements reste une faiblesse. Comparés aux extraits de test scriptés à la main par le développeur, les mouvements du moteur sur les deux films les plus rapides faisaient un quart et la moitié de la taille de ceux de l'humain. Il n'existe aucune mesure validée de l'erreur de profondeur en unités absolues.
Questions
Ai-je besoin d'un modèle de profondeur ?
Non. Sans modèle, le moteur travaille à partir du flux optique, du centre de la zone et de la pose si elle est installée. MiDaS small est téléchargé automatiquement, sauf si vous désactivez les téléchargements automatiques.
Dois-je prendre MiDaS large ?
Seulement si vous utilisez High sur un GPU NVIDIA ; il n'est pas utilisé sur un CPU ni aux autres niveaux. Nous n'avons pas mesuré s'il produit de meilleurs scripts que MiDaS small.
Un script semble trop profond ou trop agité. Est-ce la profondeur ?
Cela peut venir de l'équilibre entre vitesse et ancrage. Essayez Depth priority entre 45 et 65 et régénérez. Si les mouvements semblent simplement trop longs sur l'appareil, Depth emphasis à 100 % est neutre.
L'estimation de profondeur fonctionne-t-elle sur les vidéos VR ?
Les images VR sont d'abord redressées en une vue en perspective normale d'un seul œil, et la profondeur tourne sur cette vue comme sur n'importe quelle autre vidéo. La détection du format est heuristique, basée sur quelques images échantillonnées.
À lire ensuite
- Comment fonctionne la génération de funscript par IALe pipeline complet, du décodage à l'appareil.
- Comment le flux optique lit le mouvementLe signal de vitesse auquel la profondeur est comparée.
- L'estimation de pose dans AutoScript SyncL'autre modèle optionnel et candidat d'ancrage.
- Ce qu'apporte chaque partie IALes modèles vus côté produit, et comment l'application apprend de vos modifications.
Essayez-le sur vos propres vidéos
L'essai dure une journée et tourne sur votre propre PC ; vos vidéos sont analysées localement et jamais envoyées en ligne.