Estimation de profondeur : l'axe qu'une vidéo plate masque

Une vidéo est plate, donc un mouvement droit vers la caméra ou à l'opposé se voit à peine comme un mouvement à l'écran. L'estimation de profondeur pour funscripts comble ce manque : AutoScript Sync fait tourner sur votre PC un modèle MiDaS qui estime la proximité de chaque partie de l'image, et suit comment elle évolue dans la zone en mouvement. Le résultat est un signal de position candidat de plus. La profondeur est optionnelle, et le script reste construit sur le flux optique.

Vérifié par rapport au code de l'application le 21 septembre 2026.

Pourquoi la profondeur compte

Le flux optique mesure comment les choses se déplacent dans l'image : haut, bas, gauche, droite. Quand un mouvement suit l'axe de visée de la caméra, comme dans les vidéos en point de vue (POV), l'objet en mouvement grossit et rétrécit surtout, au lieu de traverser l'image. Le flux en voit très peu. Un modèle de profondeur lit les mêmes images en termes de proche et de lointain, donc un mouvement le long de cet axe apparaît plutôt comme un changement de profondeur.

Across-the-frame motion versus motion toward the camera Left: a stroke across the frame moves a long way on screen, which optical flow measures. Right: a stroke toward the camera barely moves on screen but changes depth, which the depth model measures. Across the frame Toward the camera Large on-screen shift: flow reads it Grows, barely moves: depth reads it Dashed: position at the start of a stroke. Teal: position at the end.
Un même mouvement peut correspondre à un long déplacement dans l'image ou presque à aucun, selon sa direction par rapport à la caméra.

Quel modèle MiDaS est utilisé

AutoScript Sync utilise les modèles de profondeur MiDaS v2.1 au format ONNX. Ils donnent une profondeur relative, c'est-à-dire plus proche et plus loin au sein d'une même image, pas des distances en centimètres.

Modèles de profondeur MiDaS et quand chacun est utilisé
ModèleTailleUtilisé
MiDaS small~64 MoFast et Balanced, et tous les niveaux sur un CPU. Le téléchargement par défaut.
MiDaS large~397 MBHigh, uniquement sur un GPU CUDA, si vous l'avez téléchargé. Un GPU est conseillé.

Ce choix est fait par Auto-pick model tier from Accuracy, activé par défaut, et il ne peut choisir qu'un modèle déjà installé. Le moteur accepte n'importe quel modèle ONNX de profondeur relative que vous lui indiquez, mais MiDaS est le seul que l'application propose de télécharger.

Comment la profondeur devient un signal

La profondeur est calculée sur une image échantillonnée sur deux, sur l'image d'analyse de 320 px de large, et moyennée sur les pixels qui bougent réellement dans la zone suivie. Le résultat rejoint le centre de la zone et les points clés de pose comme candidat d'ancrage pour la courbe de position. Si le modèle de profondeur prend plus de 3 secondes par image, le moteur désactive la profondeur pour le reste de ce traitement plutôt que de laisser un modèle lent retarder tout le travail.

Une seule échelle de profondeur par vidéo, pas par image

La sortie d'un modèle de profondeur n'a pas d'unité fixe : chaque image revient avec sa propre échelle. Si chaque image est normalisée séparément, l'échelle elle-même varie d'une image à l'autre, et cette variation ressemble à un mouvement. AutoScript Sync fixe plutôt une seule échelle pour toute la vidéo, à partir de percentiles robustes des mesures de profondeur, pour qu'un changement de valeur corresponde à un changement dans la scène.

Mise à l'échelle de la profondeur par image ou par vidéo, mesurée sur 150 images d'un film
MesureÉchelle par imageÉchelle par vidéo
Corrélation d'une image à l'autre des variations de profondeur0.5940.963
Pas avec une inversion de direction parasite42%2%

Il s'agit d'une mesure technique étroite, par rapport à la sortie brute du modèle, faite par le développeur le 10 septembre 2026. Elle montre que la mise à l'échelle par vidéo empêche le signal de profondeur de se contredire ; ce n'est pas une mesure de la précision du script final.

Les réglages qui agissent sur la profondeur

Deux curseurs des réglages de mouvement ont « depth » dans leur nom. Seul Depth priority modifie l'analyse ; Depth emphasis agit sur l'amplitude des mouvements lors de l'envoi à un appareil et ne fait pas intervenir le modèle MiDaS. Aucun des deux n'active ni ne désactive le modèle de profondeur ; cela dépend de la présence d'un modèle de profondeur installé et choisi.

Depth priority
De 30 à 90, 85 par défaut. Il fixe la part de la courbe de position qui vient de la vitesse mesurée plutôt que du point d'ancrage de position, dont la profondeur est l'un des candidats : plus la valeur est élevée, moins l'ancrage a de poids. L'infobulle de l'application décrit la vitesse comme porteuse de l'amplitude des mouvements, et l'ancrage comme ce qui empêche la dérive mais aplatit la profondeur ; elle suggère de le baisser à 45–65 si un script semble trop agité ou trop profond. Il modifie l'analyse, il faut donc régénérer.
Depth emphasis
De 100 % à 200 %, 100 % par défaut (neutre). Les mouvements profonds vont proportionnellement plus loin. Il agit sur la copie envoyée à un appareil, donc renvoyez le script après l'avoir modifié ; le fichier enregistré n'est pas modifié. Dans l'application publiée, cette mise en forme s'applique à l'envoi vers l'Autoblow AI Ultra ; son application aux appareils Intiface, ainsi que son intégration à Export Script (as played), arrivent avec la prochaine mise à jour.

Ce que coûte la profondeur

La profondeur tourne sur un GPU NVIDIA via CUDA quand il y en a un, et sur le CPU sinon ; l'application indique lequel elle utilise réellement. Un commentaire du code issu du PC de test RTX 5080 donne environ 25,8 ms par appel pour MiDaS small sur le GPU, contre 234 ms sur le CPU. Le calcul sur une image échantillonnée sur deux plutôt que sur chacune divise ce travail par deux. Sur le GPU, la réserve de mémoire CUDA du modèle de profondeur est plafonnée à 4 Go.

Nous n'avons pas publié la part du temps d'analyse totale que prend la profondeur, car aucun tableau de mesures ne soutient l'estimation de travail. La page des benchmarks liste ce qui a été mesuré.

Limites

  • Relative, pas absolue. MiDaS dit plus proche ou plus loin, pas à quelle distance. L'amplitude des mouvements vient toujours de la courbe fusionnée, pas de la profondeur seule.
  • Moyennée sur la zone en mouvement. La profondeur est moyennée sur chaque pixel en mouvement de la zone suivie, donc tout autre mouvement dans cette zone est mélangé au mouvement principal. Tracer votre propre zone avec Set Motion Region… ou Live Track la resserre.
  • Plus lourd n'est pas prouvé meilleur. Aucune comparaison de MiDaS small et MiDaS large sur la précision des mouvements n'a été enregistrée.
  • L'amplitude des mouvements reste une faiblesse. Comparés aux extraits de test scriptés à la main par le développeur, les mouvements du moteur sur les deux films les plus rapides faisaient un quart et la moitié de la taille de ceux de l'humain. Il n'existe aucune mesure validée de l'erreur de profondeur en unités absolues.

Questions

Ai-je besoin d'un modèle de profondeur ?

Non. Sans modèle, le moteur travaille à partir du flux optique, du centre de la zone et de la pose si elle est installée. MiDaS small est téléchargé automatiquement, sauf si vous désactivez les téléchargements automatiques.

Dois-je prendre MiDaS large ?

Seulement si vous utilisez High sur un GPU NVIDIA ; il n'est pas utilisé sur un CPU ni aux autres niveaux. Nous n'avons pas mesuré s'il produit de meilleurs scripts que MiDaS small.

Un script semble trop profond ou trop agité. Est-ce la profondeur ?

Cela peut venir de l'équilibre entre vitesse et ancrage. Essayez Depth priority entre 45 et 65 et régénérez. Si les mouvements semblent simplement trop longs sur l'appareil, Depth emphasis à 100 % est neutre.

L'estimation de profondeur fonctionne-t-elle sur les vidéos VR ?

Les images VR sont d'abord redressées en une vue en perspective normale d'un seul œil, et la profondeur tourne sur cette vue comme sur n'importe quelle autre vidéo. La détection du format est heuristique, basée sur quelques images échantillonnées.

À lire ensuite

Essayez-le sur vos propres vidéos

L'essai dure une journée et tourne sur votre propre PC ; vos vidéos sont analysées localement et jamais envoyées en ligne.