Tiefenschätzung: die Achse, die ein flaches Video verbirgt

Ein Video ist flach, daher zeigt sich Bewegung direkt zur Kamera hin oder von ihr weg auf dem Bildschirm kaum als Bewegung. Die Tiefenschätzung für Funscripts schließt diese Lücke: AutoScript Sync lässt auf deinem PC ein MiDaS-Modell laufen, das schätzt, wie nah jeder Teil des Bildes ist, und verfolgt, wie sich das im bewegten Bereich ändert. Das Ergebnis ist ein weiteres Kandidatensignal für die Position. Tiefe ist optional, und das Skript baut weiterhin auf optischem Fluss auf.

Am 21. September 2026 mit dem Code der App abgeglichen.

Warum Tiefe wichtig ist

Optischer Fluss misst, wie sich Dinge über das Bild bewegen: hoch, runter, links, rechts. Wenn ein Hub entlang der Blickachse der Kamera verläuft, wie bei POV-Aufnahmen, wird das bewegte Objekt hauptsächlich größer und kleiner, statt sich über das Bild zu bewegen. Davon sieht der Fluss sehr wenig. Ein Tiefenmodell liest dieselben Bilder als nah und fern, sodass ein Hub entlang dieser Achse stattdessen als Tiefenänderung erscheint.

Across-the-frame motion versus motion toward the camera Left: a stroke across the frame moves a long way on screen, which optical flow measures. Right: a stroke toward the camera barely moves on screen but changes depth, which the depth model measures. Across the frame Toward the camera Large on-screen shift: flow reads it Grows, barely moves: depth reads it Dashed: position at the start of a stroke. Teal: position at the end.
Dieselbe Hublänge kann eine lange Bewegung über das Bild sein oder fast keine, je nachdem, in welche Richtung sie relativ zur Kamera verläuft.

Welches MiDaS-Modell verwendet wird

AutoScript Sync nutzt MiDaS-v2.1-Tiefenmodelle im ONNX-Format. Sie liefern relative Tiefe, also näher und weiter innerhalb eines Bildes, keine Entfernungen in Zentimetern.

MiDaS-Tiefenmodelle und wann welches verwendet wird
ModellGrößeVerwendet
MiDaS small~64 MBFast und Balanced sowie jede Stufe auf einer CPU. Der Standard-Download.
MiDaS large~397 MBHigh, nur auf einer CUDA-GPU und nur, wenn du es heruntergeladen hast. Eine GPU wird empfohlen.

Diese Wahl trifft Auto-pick model tier from Accuracy, das standardmäßig eingeschaltet ist, und es kann nur ein bereits installiertes Modell wählen. Die Engine akzeptiert jedes ONNX-Modell für relative Tiefe, auf das du sie verweist, aber MiDaS ist das einzige, das die App zum Download anbietet.

Wie aus Tiefe ein Signal wird

Die Tiefe wird auf jedem zweiten abgetasteten Bild geschätzt, auf dem 320 px breiten Analysebild, und über die Pixel gemittelt, die sich innerhalb des verfolgten Bereichs tatsächlich bewegen. Das Ergebnis gesellt sich zur Bereichsmitte und den Pose-Keypoints als Ankerkandidat für die Positionskurve. Wenn das Tiefenmodell mehr als 3 Sekunden pro Bild braucht, schaltet die Engine die Tiefe für den Rest dieses Durchlaufs ab, statt ein langsames Modell den ganzen Auftrag aufhalten zu lassen.

Eine Tiefenskala pro Video, nicht pro Bild

Die Ausgabe eines Tiefenmodells hat keine festen Einheiten: Jedes Bild kommt auf seiner eigenen Skala zurück. Wird jedes Bild einzeln normalisiert, verschiebt sich die Skala selbst von Bild zu Bild, und diese Verschiebung sieht wie Bewegung aus. AutoScript Sync legt stattdessen eine Skala für das ganze Video fest, aus robusten Perzentilen der Tiefenwerte, sodass eine Änderung der Zahl eine Änderung in der Szene bedeutet.

Tiefenskalierung pro Bild gegenüber pro Video, gemessen an 150 Bildern eines Films
MessgrößePro Bild skaliertPro Video skaliert
Korrelation der Tiefenänderungen von Bild zu Bild0.5940.963
Schritte mit einer falschen Richtungsumkehr42%2%

Das ist eine eng gefasste technische Messung gegen die Rohausgabe des Modells, vorgenommen vom Entwickler am 10. September 2026. Sie zeigt, dass die Skalierung pro Video verhindert, dass sich das Tiefensignal selbst widerspricht; sie ist kein Maß dafür, wie genau das fertige Skript ist.

Einstellungen, die die Tiefe formen

Zwei Schieberegler in den Hubeinstellungen haben Tiefe im Namen. Nur Depth priority ändert die Analyse; Depth emphasis formt die Hublänge auf dem Weg zu einem Gerät und hat nichts mit dem MiDaS-Modell zu tun. Keiner der beiden schaltet das Tiefenmodell ein oder aus; das hängt davon ab, ob ein Tiefenmodell installiert und gewählt ist.

Depth priority
30 bis 90, Standard 85. Legt fest, wie viel der Positionskurve aus der gemessenen Geschwindigkeit stammt statt aus dem Positionsanker, für den die Tiefe ein Kandidat ist: Je höher der Wert, desto weniger Gewicht bekommt der Anker. Der Tooltip der App beschreibt die Geschwindigkeit als Träger der Hubgröße und den Anker als das, was die Drift stoppt, aber die Tiefe abflacht, und schlägt vor, den Wert auf 45–65 zu senken, wenn sich ein Skript unruhig oder zu tief anfühlt. Er ändert die Analyse, braucht also eine Neugenerierung.
Depth emphasis
100 % bis 200 %, Standard 100 % (neutral). Tiefe Hübe gehen proportional weiter. Formt die Kopie, die an ein Gerät gesendet wird, also sende das Skript nach einer Änderung erneut; die gespeicherte Datei wird nicht verändert. In der veröffentlichten App gilt diese Geräteformung für den Upload an den Autoblow AI Ultra; die Anwendung auf Intiface-Geräte und das Einbacken in Export Script (as played) kommen mit dem nächsten Update.

Was die Tiefe kostet

Die Tiefe läuft auf einer NVIDIA-GPU über CUDA, wenn eine verfügbar ist, sonst auf der CPU; die App meldet, was sie tatsächlich nutzt. Ein Code-Kommentar vom RTX-5080-Test-PC beziffert MiDaS small auf etwa 25,8 ms pro Aufruf auf der GPU gegenüber 234 ms auf der CPU. Die Ausführung auf jedem zweiten statt jedem abgetasteten Bild halbiert diese Arbeit. Auf der GPU ist der CUDA-Speicherpool des Tiefenmodells auf 4 GB begrenzt.

Wir haben nicht veröffentlicht, welchen Anteil einer ganzen Analyse die Tiefe ausmacht, weil hinter der Arbeitsschätzung keine Messtabelle steht. Die Benchmark-Seite listet auf, was gemessen wurde.

Grenzen

  • Relativ, nicht absolut. MiDaS sagt näher oder weiter, nicht wie weit. Die Hubgröße stammt weiterhin aus der verschmolzenen Kurve, nicht aus der Tiefe allein.
  • Über den bewegten Bereich gemittelt. Die Tiefe wird über jedes bewegte Pixel im verfolgten Bereich gemittelt, daher wird andere Bewegung darin mit dem Hub zusammen gemittelt. Einen eigenen Bereich mit Set Motion Region… oder Live Track zu ziehen, grenzt ihn ein.
  • Schwerer ist nicht nachweislich besser. Ein Vergleich von MiDaS small mit MiDaS large hinsichtlich der Hubgenauigkeit wurde nicht festgehalten.
  • Die Hubgröße ist weiterhin eine Schwäche. Gegenüber den von Hand geskripteten Testclips des Entwicklers waren die Hübe der Engine bei den beiden schnellsten Filmen ein Viertel bzw. die Hälfte so groß wie die des Menschen. Es gibt keine festgehaltene Messung des Tiefenfehlers in absoluten Einheiten.

Fragen

Brauche ich ein Tiefenmodell?

Nein. Ohne eines arbeitet die Engine mit optischem Fluss, der Bereichsmitte und, falls installiert, Pose. MiDaS small wird automatisch heruntergeladen, sofern du automatische Downloads nicht abschaltest.

Sollte ich MiDaS large holen?

Nur wenn du High auf einer NVIDIA-GPU nutzt; auf einer CPU oder in den anderen Stufen wird es nicht verwendet. Wir haben nicht gemessen, ob es bessere Skripte erzeugt als MiDaS small.

Ein Skript fühlt sich zu tief oder zu unruhig an. Liegt das an der Tiefe?

Es kann am Gleichgewicht zwischen Geschwindigkeit und Anker liegen. Probier Depth priority zwischen 45 und 65 und generiere neu. Wenn sich die Hübe auf dem Gerät einfach zu lang anfühlen: Depth emphasis bei 100 % ist neutral.

Funktioniert die Tiefenschätzung bei VR-Video?

VR-Material wird zuerst in eine normale perspektivische Ansicht eines Auges entzerrt, und die Tiefe läuft auf dieser Ansicht wie bei jedem anderen Material. Die Layout-Erkennung ist heuristisch und beruht auf einigen abgetasteten Bildern.

Weiterlesen

Probier es mit deinen eigenen Videos

Die Testversion dauert einen Tag und läuft auf deinem eigenen PC; deine Videos werden lokal analysiert und nie hochgeladen.