Die KI in AutoScript Sync
Ein KI-Funscript entsteht aus mehreren Teilen, die zusammenarbeiten und alle auf deinem PC laufen. Eine Bewegungs-Heatmap findet, wo die Action ist, optischer Fluss misst, wie sie sich bewegt, optionale Pose- und Tiefenmodelle ergänzen Körper-Keypoints und einen Messwert zur Kamera hin oder weg, ein kleiner Klassifikator bestimmt für jedes 2-Sekunden-Fenster die Bewegungsart, und ein Glätter verschmilzt alles zu einer Positionskurve. Sie lernt aus deinen Labels und Bearbeitungen, und ein Label, das du setzt, hat immer Vorrang vor ihrer eigenen Vermutung.
Am 21. September 2026 mit dem Code der App abgeglichen. Beschreibt Version 2.121.1, die aktuelle Version.
Was jeder Teil beiträgt
Jeder abgetastete Frame wird zuerst auf 320 px Breite verkleinert (VR-Material wird vorher zu einer flachen Ansicht eines Auges entzerrt). Bereichssuche, Fluss, Pose und Tiefe arbeiten alle mit diesem kleinen Frame.
Die Action finden: eine Bewegungs-Salienz-Heatmap
Ohne einen Bereich von dir führt die Engine eine Heatmap davon, wo Bewegung passiert, lässt ältere Bewegung dabei verblassen, nimmt dann den heißesten zusammenhängenden Bereich und erweitert ihn um 15 %. Dieser Bereich wird gemessen. Du kannst ihn mit einem Rahmen (Set Motion Region…) oder einem beweglichen Rahmen, den du während der Wiedergabe ziehst (Live Track), übersteuern. Die App merkt sich außerdem, welchem Körper-Keypoint deine Rahmen folgen, damit sie bei neuen Videos Bereiche vorschlagen kann.
Bewegung messen: DIS-Optical-Flow
Optischer Fluss schätzt, wie sich jedes Pixel zwischen zwei Frames bewegt hat. Die Standard-Engine nutzt den dichten DIS-Flow von OpenCV, dazu einen schnelleren Durchgang mit halber Auflösung, der prüft, ob dem Fluss zu trauen ist. Auf High misst sie den getrackten Bereich außerdem mit 640 px, bei flachem Video, das mindestens so breit ist. Beide laufen auf der CPU. Aus der Flussgeschwindigkeit wird der Positionsverlauf integriert. Optischer Fluss im Detail.
Personen folgen: YOLOv8-Pose und der Personen-Tracker
Ist ein Pose-Modell installiert (der Standard-Download ist YOLOv8 small-pose, etwa 45 MB), findet es jede Person über 0,35 Konfidenz mit 17 Körper-Keypoints. Ein Tracker ordnet Personen von Frame zu Frame nach Position und Größe des Rahmens zu, baut aus Paaren von Körperregionen Kandidaten-Bewegungssignale und behält in jeder Szene das mit dem klarsten Rhythmus. Pose ist optional: Ohne läuft die Engine nur mit Fluss und zeigt das in ihrer Statuszeile Inference an. Posenschätzung im Detail.
Zur Kamera hin und weg sehen: MiDaS-Tiefe
Flacher optischer Fluss kann Bewegung zur Kamera hin oder von ihr weg nicht sehen. MiDaS-v2.1-Tiefenmodelle (small, etwa 64 MB, ist der Standard; large, etwa 397 MB, ist für eine GPU gedacht) schätzen auf jedem zweiten abgetasteten Frame die relative Tiefe, gemittelt über die bewegten Pixel im Bereich. Daraus wird ein weiteres Kandidaten-Positionssignal. Braucht das Modell mehr als 3 Sekunden pro Frame, wird Tiefe für diesen Durchlauf abgeschaltet. Tiefenschätzung im Detail.
Zeugen im Hintergrund: Bewegungsvektoren und Audio
In einem Hintergrund-Thread liest die App die eigenen Kompressions-Bewegungsvektoren des Videos und eine 50-Hz-Lautstärkehüllkurve der Tonspur, jeweils mit einem Zeitbudget — bei langen Filmen decken sie also womöglich nur einen Teil ab. Sie helfen zu entscheiden, welche Abschnitte einen genaueren Blick verdienen, und das Audio hält aufgefüllte Bewegung im Takt des Beats.
Die Bewegung benennen: der Bewegungsart-Klassifikator
Die Timeline wird in 2-Sekunden-Fenster geteilt. Jedes Fenster wird durch sechs Bewegungsmerkmale beschrieben und von einem kleinen logistischen Regressionsmodell, das trainiert, während du die App nutzt, einem von vier groben Szenentypen zugeordnet. Hinweise aus der Geometrie der Pose-Keypoints und der Gesichtsposition, standardmäßig aktiv, können seine Entscheidung übersteuern oder anpassen. Ein Viterbi-Durchgang glättet die Labels danach über benachbarte Fenster, damit der Typ nicht hin und her springt.
Das Label entscheidet, wie die Bewegung in diesem Fenster geformt wird. Jeder Typ hat ein Formprofil, das neutral beginnt und die Ausgabe erst verändert, nachdem du es durch deine Bearbeitungen angelernt hast.
Deine Labels haben immer Vorrang. Ein von dir gesetztes Label, das mindestens ein halbes Fenster abdeckt, ersetzt für dieses Fenster die Antwort des Klassifikators, und der Glättungsdurchgang lässt angelernte Fenster in Ruhe.
Alles zu einer Kurve verschmelzen
Der Fluss sagt, wie schnell sich etwas bewegt; die anderen Signale sagen, wo etwas ist. Die Engine integriert die Flussgeschwindigkeit zu einem Positionsverlauf und verschmilzt ihn mit einem Anker in einem Kalman-Filter mit Rauch-Tung-Striebel-Glätter (RTS), der vorwärts und dann rückwärts über das ganze Video läuft, sodass jeder Punkt von dem profitiert, was danach kam.
Der Anker wird pro Video gewählt. Die Mitte des Bereichs, Pose und Tiefe treten jeweils gegeneinander an, und das Pose-Signal kann nur gewinnen, wenn es mindestens ein Viertel des Videos abdeckt und gut genug abschneidet. Standardmäßig wird der Gewinner dann Sample für Sample durch eine Mischung aller lesbaren Signale ersetzt — aber nur, wenn die Mischung mindestens genauso gut abschneidet. Die Werte aus diesem Wettbewerb werden in die Metadaten des Skripts geschrieben, wo Report Studio sie grafisch darstellen kann.
Wo das Tracking aussetzt, wird die Lücke mit rhythmischer Bewegung gefüllt, die von den umgebenden Hüben fortgeführt wird, und der Anteil der Timeline, der aufgefüllt statt gemessen wurde, wird festgehalten. Dann werden bei jedem Richtungswechsel Punkte gesetzt, wobei die Hubgröße über die Intensitätskurve (standardmäßig Smoothed) der Geschwindigkeit auf dem Bildschirm folgt.
Wie es lernt
- Aus deinen Bearbeitungen
- Wenn du ein bearbeitetes, von der KI erzeugtes Skript speicherst (Strg+S oder Save As), lernt die App aus den geänderten Fenstern für jede Bewegungsart einen Hubtiefen-Faktor und einen Positionsversatz.
- Aus deinen Labels
- Teach class auf einem ausgewählten Timeline-Abschnitt versieht ihn mit einem Label. Dein Label ersetzt für diese Fenster die Antwort des Klassifikators.
- Über Videos hinweg (Korpus-Lernen)
- Standardmäßig aktiv. Jede KI-Generierung kann bis zu 40 Beispiele aus diesem Video behalten, und spätere Durchläufe nutzen sie, um das Tracking wieder aufzunehmen. Die Ausgabe hängt also teilweise davon ab, was du vorher analysiert hast.
- Innerhalb eines Durchlaufs (Selbstlernen)
- Im automatischen Modus standardmäßig aktiv: Die Engine lernt während jedes Durchlaufs auch selbst.
- AI Bulk Learn
- Im File-Menü. Es durchsucht einen Ordner, ohne Skripte zu erstellen, tastet kurze Fenster ab (standardmäßig 30 Fenster à 4 Sekunden pro Video) und stellt die, bei denen sich der Klassifikator nicht entscheiden kann, in eine Warteschlange, damit du sie per Tastatur labelst. Check my labels markiert Labels, die im Vergleich zu den Bewegungshinweisen falsch aussehen, und angelernt wird nur mit menschlichen Labels.
Generierst du dasselbe Video mit denselben Analyse-Einstellungen neu, wird die Bewegungsanalyse von vorhin in dieser Sitzung wiederverwendet (die letzten drei Videos, im Arbeitsspeicher); dann werden nur die Labels neu vergeben und das Skript neu gebaut — ein neuer Versuch nach dem Anlernen geht also fast sofort.
Wo es läuft
Auf deinem PC. Die Pose- und Tiefenmodelle laufen über ONNX Runtime oder PyTorch, auf einer NVIDIA-Grafikkarte über CUDA, wenn eine vorhanden ist, sonst auf der CPU. Wenn du die GPU verlangst und sie nicht genutzt werden kann, weichen sie auf die CPU aus, und die App meldet, was wirklich genutzt wird; die Schaltfläche Check GPU sagt dir, ob die Analyse auf der Grafikkarte läuft. Optischer Fluss läuft immer auf der CPU. Für die KI-Modelle gibt es keine AMD- oder Intel-Beschleunigung, und TensorRT wird nicht genutzt.
Standardmäßig schaltet die App eine automatische GPU-Optimierung ab, damit die Modelle bei jedem Durchlauf dieselben Zahlen liefern, auf Kosten von etwas Geschwindigkeit. Skripte können sich zwischen Durchläufen trotzdem unterscheiden, weil die App weiterlernt. GPU, CPU und Installation unter Windows behandelt die Anforderungen.
Was die KI noch falsch macht
Der Entwickler vergleicht die Engine mit von Hand geschriebenen Skripten. Bei einer kleinen Auswahl von Clips zeigt dieser Vergleich, wo sie zu kurz greift. Es ist eine interne Prüfung, kein Benchmark, deshalb nennen wir daraus keinen Wert.
- Verpasste Richtungswechsel. Manche Umkehrpunkte, die eine Person skriptet, fehlen in der Ausgabe der KI — bei jedem getesteten Film.
- Zu kleine Hübe bei schnellen Szenen. Die Hubgröße stimmt bei langsameren Filmen ungefähr und ist bei schnellen viel zu klein. Weniger abgetastete Frames verschlimmern das.
- Bewegung, wo keine ist. Innerhalb der Action erzeugt die Engine oft weiter Hübe über Strecken, die eine Person ruhig lassen würde. Eine Sperre, die diese Abschnitte anhalten würde, existiert, ist aber standardmäßig aus.
- Fehler beim Szenentyp. Die Entscheidungen des Klassifikators sind in ihrer Genauigkeit begrenzt. Label die Fenster, die er falsch einordnet; deine Labels übersteuern ihn.
- Aufgefüllt, nicht gemessen. Wo das Tracking verloren geht, wird die Kurve mit Rhythmus gefüllt statt aus dem Video gelesen. Der Qualitätsbericht zeigt, wie viel.
Wir veröffentlichen keinen Zeit- oder Genauigkeitswert, weil noch keiner an unabhängigen handgemachten Skripten in einem Umfang gemessen wurde, hinter dem wir stehen würden. Die Benchmark-Seite legt dar, was gemessen wurde und was nicht.
Fragen
Schickt die KI meine Videos zur Verarbeitung an einen Server?
Nein. Jedes Modell läuft auf deinem PC, und der Analysecode macht keine Netzwerkaufrufe. Das Internet wird für Modell-Downloads, die Update-Prüfung, die Lizenzierung und die Cloud des Autoblow AI Ultra genutzt, die das Skript erhält, aber nie das Video.
Welche Modelle werden heruntergeladen?
Standardmäßig YOLOv8 small-pose und MiDaS small, zusammen etwa 109 MB. Die Schaltfläche Download best in der App bietet größere Pose-Modelle an (bis YOLOv8 large, etwa 168 MB) und empfiehlt eines passend zu GPU oder CPU.
Kann ich die KI abschalten?
Entfernst du das Häkchen bei "Use adaptive AI engine", schaltet die Schaltfläche Generate auf eine einfache Engine um, die der Haupt-Vertikalbewegung mit Farneback-Optical-Flow auf Frames in voller Auflösung folgt. Das Häkchen wird bei jedem Start wieder gesetzt, und Batch Generate Folder sowie Generate + Play nutzen immer die KI-Engine.
Wird es besser, je mehr ich es nutze?
Es verändert sich mit der Nutzung: Deine Labels, gespeicherte Bearbeitungen und die Beispiele, die es aus früheren Videos behält, fließen alle in spätere Durchläufe ein. Wie sehr das die Ergebnisse verbessert, haben wir nicht gemessen, also nennen wir keine Zahl.
Weiterlesen
- Der Technologie-BereichTechnische Details zu Pose, Fluss, Tiefe und Drift-Korrektur.
- Vom Video zum Skript, Schritt für SchrittWas mit deiner Datei passiert und wo das Ergebnis gespeichert wird.
- Der Funscript-Generator von AutoScript SyncWas du bekommst, wie du ihn nutzt, Geräte, Preis und Testversion.
- Der Modell-Leitfaden auf der StartseitePose- und Tiefenstufen im Vergleich.
Sieh der KI bei deinen eigenen Videos bei der Arbeit zu
Die kostenlose Testversion schaltet einen Tag lang jede Funktion frei; eine Lizenz kostet einmalig £14.99 und ist nicht an eine Version gebunden.