Posenschätzung in AutoScript Sync
Wenn AutoScript Sync ein Funscript erstellt, übernimmt ein YOLOv8-Pose-Modell auf deinem PC die Posenschätzung. Es findet jede Person in einem abgetasteten Bild und setzt 17 Keypoints auf sie. Ein Tracker verfolgt diese Personen von Bild zu Bild und macht aus ihrer Bewegung Kandidaten für Positionssignale. Pose ist optional: Sie ist ein Kandidat unter mehreren, und ohne Pose-Modell läuft die Engine nur mit optischem Fluss.
Am 21. September 2026 mit dem Code der App abgeglichen.
Welches Modell jede Accuracy-Stufe nutzt
Es gibt vier Größen von YOLOv8-Pose. Die App lädt die kleine automatisch herunter; die anderen kommen über die In-App-Auswahl Download best, die auf einer GPU das große Modell und auf einer CPU das kleine empfiehlt.
| Modell | Größe | Gewählt für, auf einer CUDA-GPU |
|---|---|---|
yolov8n-pose (nano) | ~13 MB | Fast |
yolov8s-pose (small) | ~45 MB | Balanced; der Standard-Download |
yolov8m-pose (medium) | ~99 MB | Zweite Wahl für Balanced und High, wenn deren erste Wahl nicht installiert ist |
yolov8l-pose (large) | ~168 MB | High |
Diese Zuordnung gilt, wenn Auto-pick model tier from Accuracy eingeschaltet ist, was der Standard ist. Die App kann nur ein bereits installiertes Modell wählen, daher läuft bei einer Standardinstallation jede Stufe mit dem kleinen Modell, bis du andere herunterlädst. Auf einer CPU sind die Obergrenzen gewollt: Fast nutzt nur nano, und Balanced und High nutzen höchstens das kleine Modell. Du kannst die App auch selbst auf eine Modelldatei verweisen.
Was das Modell sieht: 17 Keypoints pro Person
Pose läuft standardmäßig auf jedem abgetasteten Bild, auf demselben 320 px breiten Analysebild, das der Rest der Engine nutzt. Dieses Bild wird mit Balken auf die Eingabegröße des Modells gebracht: Ein ONNX-Modell nutzt die Größe, mit der es exportiert wurde (640 px bei den Standard-Exporten), und ein .pt-Modell, das über das mitgelieferte Ultralytics-Paket läuft, arbeitet mit 320 px.
Jede mit mehr als 0,35 Konfidenz erkannte Person wird behalten, mit den 17 Standard-COCO-Keypoints: Kopfpunkte, Schultern, Ellbogen, Handgelenke, Hüften, Knie und Knöchel. Wie oft Pose läuft, ist ein Schrittwert in config.json (pose_every_n), ab Werk auf jedes abgetastete Bild gesetzt.
Wie der Personen-Tracker Identitäten hält
Erkennungen sind nur nützlich, wenn dieselbe Person durch eine Szene verfolgt wird. AutoScript Sync nutzt dafür einen eigenen Tracker, keinen fertigen. Er ordnet Personen zwischen Bildern anhand des Abstands ihrer Box-Mittelpunkte und der Box-Größe zu und nimmt dabei zuerst den nächstgelegenen Treffer.
Aus den verfolgten Personen baut er mehrere Kandidatensignale: die vertikale Bewegung der Hüften und die relative Bewegung von Paaren von Körperregionen (Hüfte zu Hüfte, Kopf zu Hüfte, Hände zu Hüfte), jeweils geteilt durch die Körpergröße. Jeder Kandidat wird nach drei Kriterien bewertet:
- wie stark er sich wiederholt: der Anteil seiner Leistung in seinem stärksten Peak zwischen 0,2 und 4 Hz;
- Abdeckung: für wie viel der Szene er tatsächlich gemessen wurde, wobei alles unter 40 % mit null bewertet wird;
- Amplitude: wie stark er sich bewegt.
Der Kandidat mit der besten Bewertung gewinnt für jedes Szenenkapitel separat, sodass ein Positionswechsel zwischen Szenen ändern kann, welches Körperregion-Signal die Pose beisteuert.
Was Pose zum Skript beiträgt
Pose schreibt das Skript nicht allein. Die endgültige Positionskurve wird aus optischem Fluss gebildet, der an einem Anker gehalten wird, und Pose ist einer der Ankerkandidaten neben der Mitte des bewegten Bereichs und der Tiefe. Sie kann nur dann zum einzigen gewählten Anker eines Videos werden, wenn sie mindestens 25 % des Videos abdeckt und ihre qualitätsgewichtete Bewertung mehr als das 0,6-Fache der Bewertung der Bereichsmitte beträgt. Wird sie nicht gewählt, fließt sie trotzdem in die standardmäßige Mischung pro Abtastung aus allen lesbaren Kanälen ein, und diese Mischung wird nur verwendet, wenn sie mindestens so gut abschneidet wie der gewählte Kanal. Die Wahlergebnisse für jeden Kandidaten werden in die Metadaten des Skripts geschrieben, sodass du sehen kannst, was gewonnen hat.
Pose hilft auch beim Labeln des Bewegungstyps. Keypoint-Geometrie und Gesichtsposition dienen als Hinweise für das Label jedes 2-Sekunden-Fensters und können die Entscheidung des Klassifikators überstimmen oder anpassen.
Wie sehr Pose die Hubkurve verbessert, ist nicht belegt. Bei einem Testfilm veränderte das Ein- oder Ausschalten der Pose die Hub-Übereinstimmung (F1) mit unserem Referenzskript nur zwischen 0,607 und 0,610, unterhalb der Differenz von 0,01, die der Entwickler als aussagekräftig betrachtet (das Rauschen zwischen Durchläufen lag bei etwa ±0,005). Diese Referenz war Engine-Ausgabe, gelenkt durch einen von Hand gezeichneten Tracking-Rahmen, kein handgemachtes Skript, und ein Vergleich des leichten und des schweren Pose-Modells hinsichtlich der Hubgenauigkeit wurde nicht festgehalten.
Ausführung auf der GPU und der CPU-Fallback
Pose-Modelle laufen lokal als ONNX über ONNX Runtime oder als .pt-Dateien über den mitgelieferten Ultralytics- und PyTorch-Stack. Beschleunigung gibt es nur mit NVIDIA CUDA; für die Modelle gibt es keine AMD- oder Intel-Beschleunigung, und TensorRT wird nicht verwendet.
ONNX Runtime kann stillschweigend auf der CPU laden, wenn CUDA nicht nutzbar ist, deshalb prüft die App, welchen Provider eine Sitzung tatsächlich bekommen hat, statt es anzunehmen. Wenn eine CUDA-GPU angefordert wurde, aber nicht genutzt werden kann, weicht Pose auf die CPU aus, und die App meldet den verwendeten Provider. Die Schaltfläche Check GPU führt diese Prüfung auf Wunsch aus; der angezeigte ms/Bild-Wert ist der Selbsttest des Pose-Modells, nicht die Geschwindigkeit einer ganzen Analyse.
Standardmäßig schaltet die App außerdem das cuDNN-Autotuning ab, damit die GPU-Inferenz von Durchlauf zu Durchlauf dieselben Zahlen liefert, auf Kosten von etwas Geschwindigkeit. Das garantiert kein identisches Skript bei erneuter Generierung, weil die App zwischen den Durchläufen lernt.
Grenzen
- Verdeckte Körper. Ein Keypoint, den das Modell nicht sieht, wird nicht gemessen. Ein Kandidatensignal, das für weniger als 40 % einer Szene gemessen wurde, bekommt null Punkte, und Pose kann unter 25 % Abdeckung des Videos nicht zum gewählten Anker werden, daher stützt sich das Skript in stark verdeckten Szenen stattdessen auf optischen Fluss und die Bereichsmitte.
- Volle Bilder. Der Tracker ordnet Personen nur nach Box-Position und -Größe zu. Er hat kein Erscheinungsmodell, daher können Identitäten zwischen Bildern vertauscht werden, wenn sich Personen überlappen oder kreuzen.
- Kleine Figuren. Pose läuft auf dem 320-px-Analysebild, daher gibt eine Person, die nur einen kleinen Teil einer Totalen ausfüllt, dem Modell wenige Pixel zum Arbeiten.
- Geschwindigkeit. Pose war in den Messungen des Entwicklers der größte Anteil der Analysezeit, weshalb die Stufen für Fast kleinere Modelle wählen und die Modellgröße auf einer CPU begrenzen.
Fragen
Brauche ich ein Pose-Modell, um ein Skript zu erstellen?
Nein. Ohne eines läuft die Engine nur mit optischem Fluss, und die Statuszeile Inference sagt das. Das kleine Pose-Modell wird automatisch heruntergeladen, sofern du automatische Downloads nicht abschaltest.
Soll ich das große Pose-Modell herunterladen?
Auf einer NVIDIA-GPU empfiehlt Download best es, und High nutzt es. Wir haben nicht gemessen, ob es bessere Skripte macht als das kleine Modell, es ist also eine Wahl, keine Lösung.
Läuft Pose auf einer AMD- oder Intel-Grafikkarte?
Nicht beschleunigt. KI-Modelle nutzen nur NVIDIA CUDA; auf anderer Hardware läuft Pose auf der CPU, was funktioniert, aber viel langsamer ist.
Sendet das Pose-Modell irgendetwas ins Internet?
Nein. Es läuft auf deinem PC, und die Analysemodule der App enthalten keinen Netzwerkcode. Nur der Download des Modells selbst braucht Internet.
Weiterlesen
- Wie die Funscript-Generierung mit KI funktioniertDie ganze Pipeline und wo Pose darin sitzt.
- Motion-Tracking per optischem FlussDas Signal, gegen das Pose abgewogen wird.
- Tiefenschätzung mit MiDaSDas andere optionale Modell und die Achse, die es zurückgewinnt.
- AutoScript Sync unter Windows betreibenGPU, CPU, was der Installer mitbringt und wo die Modelle liegen.
Probier es mit deinen eigenen Videos
Die Testversion dauert einen Tag und läuft auf deinem eigenen PC; deine Videos werden lokal analysiert und nie hochgeladen.