So messen wir Qualität und Tempo der Generierung
Das ist die Methode hinter jedem Funscript-Benchmark, den wir veröffentlichen: wie ein generiertes Skript gegen eine Referenz bewertet wird, woher die Referenzskripte stammen, und der eine Geschwindigkeitswert, den wir haben. Auf dieser Seite gibt es noch keine Genauigkeitstabelle. Die erste gegen handgemachte Skripte bewertete Charge liegt vor, und eine zweite, zurückgehaltene Charge kommt, bevor irgendein Genauigkeitswert veröffentlicht wird.
Am 21. September 2026 mit den Messwerkzeugen und Aufzeichnungen des Projekts abgeglichen.
Wie ein Skript bewertet wird
Ein Funscript ist eine Liste von Positionen über die Zeit. Die Bewertung beginnt bei seinen Wendepunkten: jeder Stelle, an der das Skript aufhört, sich in eine Richtung zu bewegen, und beginnt, sich in die andere zu bewegen. Die Wendepunkte des generierten Skripts werden mit denen des Referenzskripts über denselben Videoabschnitt verglichen.
- Zuordnung
- Ein generierter Wendepunkt zählt als Treffer, wenn er innerhalb von ±150 ms eines Referenz-Wendepunkts liegt. Alles, was weiter entfernt ist, ist auf der einen Seite ein Fehlen und auf der anderen ein zusätzlicher Wendepunkt.
- F1
- Eine Zahl, die kombiniert, wie viele der Referenz-Wendepunkte gefunden wurden und wie viele der generierten Wendepunkte echt waren. 1.0 bedeutet, dass jeder Wendepunkt zugeordnet und keiner erfunden wurde; fehlende und zusätzliche Wendepunkte senken den Wert beide.
- Timing-Fehler
- Nur für die zugeordneten Wendepunkte: wie weit die beiden Wendepunkte in Millisekunden auseinanderliegen, angegeben als Median und 90. Perzentil. Kein Mittelwert und kein 95. Perzentil wird berechnet. Nicht zugeordnete Wendepunkte fließen nicht in diesen Wert ein, daher muss ein Timing-Fehler immer zusammen mit dem F1 gelesen werden, zu dem er gehört: Ein niedriger Timing-Fehler bei niedrigem F1 beschreibt nur die Wendepunkte, die gefunden wurden.
- Verhältnis der Hubgröße
- Die mittlere Hublänge (Median) des generierten Skripts geteilt durch die mittlere Hublänge (Median) der Referenz, ohne Zuordnung. 1.0 bedeutet im Schnitt Hübe der richtigen Größe; unter 1.0 bedeutet zu kleine Hübe.
- Wenderate und Leerlaufbewegung
- Gegenüber handgemachten Skripten zählen wir außerdem die Richtungswechsel pro Sekunde und wie stark sich das Skript in Abschnitten weiterbewegt, die der Skriptersteller als ohne Action markiert hat.
Wiederholte Durchläufe mit denselben Einstellungen an einem Film schwankten um etwa ±0,005 F1, daher behandeln wir jeden Unterschied unter 0,01 F1 zwischen zwei Versionen oder Einstellungen als Rauschen.
Woher die Referenzskripte stammen
Eine Bewertung ist nur so gut wie das Skript, mit dem verglichen wird, und den größten Teil der Projektgeschichte war dieses Skript nicht unabhängig.
Bis 19. September 2026: Live-Track-Referenzen
Jeder F1-, Timing- und Hubgrößenwert, der vor dem 19. September 2026 erfasst wurde, verglich die Engine mit Live-Track-Referenzen. Diese waren die eigene Ausgabe der Engine vom 22. August 2026, gelenkt von einer Person, die einen Tracking-Rahmen zog, keine von Hand erstellten Skripte. Eine neue Version kann von ihnen abweichen, weil sie schlechter ist – oder weil sie besser ist als die Engine, die sie erzeugt hat. Diese Vergleiche können also eine schlechte Änderung stoppen, aber keine Verbesserung bestätigen, und jeder Wert daraus lässt sich nur als Übereinstimmung mit unseren Referenzen beschreiben, nie als Genauigkeit gegenüber handgemachten Skripten. Der Timing-Wert „27 ms“, der auf dieser Website stand, stammt aus einem solchen Vergleich.
Seit 19. September 2026: blind von Hand geskriptete Clips
Die Referenz stammt jetzt aus kurzen Clips, die nach einem Blindprotokoll von Hand geskriptet wurden:
- Aus den Testfilmen werden 12 Sekunden lange Clips an Stellen geschnitten, die ein fester Zufalls-Seed auswählt. Jeder bekommt einen zufälligen Namen und hat keinen Ton, keinen Titel und keinen Timecode.
- Der Schlüssel, aus welchem Film jeder Clip stammt, wird getrennt aufbewahrt und während des Skriptens nicht geöffnet, und die Reihenfolge beim Skripten mischt die Filme.
- Der Skriptersteller erstellt für jeden Clip von Hand ein Funscript und folgt dabei schriftlichen Regeln, die festgeschrieben wurden, bevor der erste Clip geskriptet wurde.
- Nur die mittleren 8 Sekunden jedes Clips werden bewertet; die 2 Sekunden an jedem Ende nicht.
- Das Skript der Engine für denselben Abschnitt wird mit den obigen Maßen gegen das handgemachte bewertet.
Als Prüfung der Referenz selbst stimmte die Hubrate des Skripterstellers bei 7 der 9 geprüften Clips auf etwa 0,1 Hz genau mit der dominanten Bewegungsfrequenz des Videos überein.
Die erste Charge, 28 Clips aus fünf Filmen, bewertet am 19. September 2026, hat zwei Einschränkungen, die wir offen nennen. Sie wurde von einer einzigen Person geskriptet, dem Entwickler. Und die Clips stammen aus denselben fünf Filmen, an denen die Standardeinstellungen abgestimmt wurden, daher ist nichts darin zurückgehalten. Es ist eine Erkundungscharge: gut, um Schwächen zu finden, nicht für eine Schlagzeilenzahl.
Die eine Geschwindigkeitsmessung
Wir haben einen aktuellen Geschwindigkeitswert, von einem PC. Lies ihn mit allen Bedingungen zusammen:
| Bedingung | Wert |
|---|---|
| Hardware | Grafikkarte NVIDIA RTX 5080, Prozessor Intel i7-13700K |
| Genauigkeitsstufe | Balanced, mit den Standardwerten einer Neuinstallation (Posenmodell YOLOv8s, Tiefenmodell MiDaS small, jedes 3. Bild analysiert) |
| Build | Standardwerte von Version 2.121.2, aus dem Quellcode ausgeführt, nicht die installierte App. 2.121.2 ist gebaut, aber nicht veröffentlicht; Kunden nutzen 2.121.1 |
| Filme | 5 Filme, 32–39 Minuten lang, 29–60 fps, 1080p und 2160p |
| Aufwand pro analysiertem Bild | 26.3–36.7 ms |
| Zeit pro Film | 8,2–28,5 Minuten |
| Wann | Um den 15. September 2026 |
Auf diesem PC dauerte die Analyse bei jedem der fünf Filme kürzer als das Abspielen. Da Balanced jedes 3. Bild analysiert, hat ein Film mit 60 fps pro Minute doppelt so viele Bilder zu analysieren wie einer mit 30 fps und kostet ungefähr doppelt so viel. Die tatsächliche Dauer hängt außerdem davon ab, was der PC sonst noch tut: Dieselben Filme dauerten deutlich länger, wenn sich die Durchläufe mit anderer Arbeit überschnitten.
In den Aufzeichnungen des Projekts sind nur die obigen Bereiche erhalten; die Aufschlüsselung pro Film wurde für diesen Durchlauf nicht aufbewahrt, daher ordnen wir keine Zeit einem bestimmten Film zu.
Das ist kein Versprechen für deinen PC. Es sagt nichts über andere Grafikkarten, über den Betrieb nur auf dem Prozessor oder über die Stufen High und Fast aus.
Was noch nicht gemessen ist
- Andere Grafikkarten. Nur die RTX 5080 wurde gemessen. Für Mittelklasse-Karten gibt es keinen Wert.
- Nur Prozessor. Die App läuft ohne NVIDIA-Grafikkarte, langsamer, aber das wurde nicht gemessen.
- Die Stufen High und Fast mit den heutigen Einstellungen. Für keine von beiden gibt es eine aktuelle Zeitmessung.
- Die installierte App. Jede bisherige Messung lief aus dem Quellcode, nicht aus dem Installer-Build.
- Timing-Fehler gegenüber handgemachten Skripten. Für die von Hand geskriptete Charge gibt es F1, Wenderate, Hubgröße und Leerlaufbewegung, aber noch keinen Timing-Fehler in Millisekunden.
- Gerätelatenz und Drift in echten Sitzungen. Nichts erfasst, wie genau ein Gerät dem Video tatsächlich folgt: keine gemessene Round-Trip-Latenz, keine Drift und kein Startversatz für den Autoblow AI Ultra, und nichts davon für Intiface-Geräte oder DeoVR. Die Drift-Schwellen, die in So korrigiert die App die Autoblow-Drift beschrieben sind, sind Zielwerte der App, keine Messergebnisse. Nur der Autoblow AI Ultra wurde an echter Hardware getestet; The Handy, Kiiroo, Lovense und OSR2/SR6 wurden nur gegen simulierte Geräte getestet.
- Eine zurückgehaltene Genauigkeitscharge. Es wurde noch keine Charge von Clips aus Filmen bewertet, an denen die Einstellungen nie abgestimmt wurden.
- Klassifizierung der Bewegungsart in der Standard-App. Ihre Genauigkeit auf den Merkmalen, die die laufende App nutzt, wurde nie gemessen.
Wann Ergebnisse veröffentlicht werden
Die erste von Hand geskriptete Charge ist bewertet. Sie hat uns gezeigt, wo die Engine schwach ist: Sie macht in schnellen Szenen weniger Wendepunkte als der Skriptersteller, ihre Hübe fallen in den schnellsten zu klein aus, und sie bewegt sich in Abschnitten ohne Action weiter. Ihre F1- oder Hubgrößenwerte nennen wir nicht als Genauigkeitswert, weil die Clips aus den Filmen stammen, an denen die Standardwerte abgestimmt wurden, und es nur einen Skriptersteller gab.
Bevor irgendein Genauigkeitswert auf diese Website kommt, wird eine zurückgehaltene Charge aus Filmen geschnitten, an denen die Einstellungen nicht abgestimmt wurden, und auf dieselbe Weise bewertet. Wenn es so weit ist, zeigt diese Seite die Zahlen mit der obigen Methode, der Anzahl der Clips und Filme und wer sie geskriptet hat. Jeder später ergänzte Geschwindigkeitswert trägt dieselben Bedingungen wie der obige: Grafikkarte, Stufe, Bildrate, Auflösung und Build. Einen Termin haben wir nicht festgelegt.
Fragen
Was ist aus dem „mittleren Timing-Fehler von 27 ms“ geworden?
Er wurde gegen die Live-Track-Referenzen gemessen, die Ausgabe der Engine waren, und er zählte nur Wendepunkte, die innerhalb von ±150 ms zugeordnet wurden. Mit den aktuellen Balanced-Standardwerten ergibt dieselbe Messung 21–35 ms pro Film, aber das ist Übereinstimmung mit unseren eigenen Referenzen, keine Genauigkeit gegenüber einem handgemachten Skript. Ein Timing-Fehler gegenüber handgemachten Skripten wurde noch nicht berechnet.
Wie schnell wird es auf meinem PC sein?
Das können wir noch nicht sagen. Die einzige Messung stammt von einer RTX 5080, auf der 32–39 Minuten lange Filme in Balanced 8,2–28,5 Minuten brauchten. Für keine andere Grafikkarte und nicht für den Prozessor allein haben wir einen Wert. Mit der kostenlosen Testversion kannst du es auf deiner eigenen Hardware messen.
Warum die von Hand geskripteten Ergebnisse nicht jetzt veröffentlichen?
Weil die Charge zu schmal ist, um als Genauigkeitswert zu gelten: ein Skriptersteller und Clips aus denselben Filmen, an denen die Standardwerte abgestimmt wurden. Eine zurückgehaltene Charge behebt das zweite Problem; sie kommt zuerst.
Ändert die Einstellung Accuracy die Qualität?
Sie ändert, wie viele Bilder analysiert werden: High jedes 2. Bild, Balanced jedes 3., Fast jedes 4. Bei einem Film Anfang September 2026, mit der damaligen Engine und den damaligen High-Einstellungen und gegen die Live-Track-Referenzen bewertet, erreichte Fast etwa die Hälfte des F1 von High (0,316 gegenüber 0,605). Vergleiche zwischen den Stufen mit aktuellen Einstellungen gegenüber handgemachten Skripten wurden nicht durchgeführt.
Weiterlesen
- So funktioniert die EnginePose, optischer Fluss und Tiefe, und was jedes davon zu einem Skript beiträgt.
- Drift-KorrekturWie die Wiedergabe auf einem Autoblow AI Ultra im Takt des Videos gehalten wird, und was daran gemessen ist und was nicht.
- Report StudioSieh dir den Bericht deiner eigenen Generierung im Browser an.
- Lokale VerarbeitungDie hier gemessene Analyse läuft auf deinem PC.
Miss es mit deinen eigenen Videos
Die Testversion ist die vollständige App für einen Tag, sodass du eine Generierung auf deinem eigenen PC messen und die Skripte selbst beurteilen kannst.