L'IA d'AutoScript Sync
Un funscript IA naît de plusieurs éléments qui travaillent ensemble, tous sur votre PC. Une carte de chaleur du mouvement trouve où se situe l'action, le flux optique mesure comment elle bouge, des modèles optionnels de pose et de profondeur ajoutent les points clés du corps et une mesure vers/à l'opposé de la caméra, un petit classifieur étiquette chaque fenêtre de 2 secondes selon le type de mouvement, et un lisseur fusionne le tout en une seule courbe de position. Il apprend de vos étiquettes et modifications, et une étiquette que vous posez l'emporte toujours sur sa propre supposition.
Vérifié par rapport au code de l'application le 21 septembre 2026. Décrit la version 2.121.1, la version actuelle.
Ce qu'apporte chaque élément
Chaque image échantillonnée est d'abord réduite à 320 px de large (les vidéos VR sont d'abord redressées en une vue plane d'un œil). La recherche de zone, le flux, la pose et la profondeur travaillent tous sur cette petite image.
Trouver l'action : une carte de chaleur de saillance du mouvement
Sans zone fournie par vous, le moteur tient une carte de chaleur des endroits où le mouvement se produit, en atténuant progressivement le mouvement ancien, puis prend la zone connexe la plus chaude et l'élargit de 15 %. C'est cette zone qui est mesurée. Vous pouvez la remplacer par un cadre fixe (Set Motion Region…) ou par un cadre mobile que vous déplacez pendant la lecture (Live Track). L'application enregistre aussi quel point clé du corps suivent vos cadres, pour pouvoir proposer des zones sur de nouvelles vidéos.
Mesurer le mouvement : le flux optique DIS
Le flux optique estime comment chaque pixel s'est déplacé entre deux images. Le moteur par défaut utilise le flux dense DIS d'OpenCV, plus une passe plus rapide à demi-résolution qui vérifie si le flux est fiable. En High, il mesure aussi la zone suivie à 640 px, pour les vidéos planes au moins aussi larges. Les deux tournent sur le CPU. C'est à partir de la vitesse du flux que la trace de position est intégrée. Le flux optique en détail.
Suivre les personnes : YOLOv8-pose et le suivi de personnes
Si un modèle de pose est installé (le téléchargement par défaut est YOLOv8 small-pose, environ 45 Mo), il détecte chaque personne au-dessus d'une confiance de 0,35 avec 17 points clés du corps. Un traqueur associe les personnes d'une image à l'autre selon la position et la taille du cadre, construit des signaux de mouvement candidats à partir de paires de régions du corps, et garde celui dont le rythme est le plus net dans chaque scène. La pose est optionnelle : sans elle, le moteur fonctionne sur le flux seul et l'indique dans sa ligne d'état Inference. L'estimation de pose en détail.
Voir vers l'avant et vers l'arrière : la profondeur MiDaS
Le flux optique plan ne voit pas le mouvement vers la caméra ou à l'opposé. Les modèles de profondeur MiDaS v2.1 (small, environ 64 Mo, par défaut ; large, environ 397 Mo, prévu pour un GPU) estiment la profondeur relative sur une image échantillonnée sur deux, moyennée sur les pixels en mouvement de la zone. Cela devient un signal de position candidat de plus. Si le modèle prend plus de 3 secondes par image, la profondeur est désactivée pour ce traitement. L'estimation de profondeur en détail.
Témoins d'arrière-plan : vecteurs de mouvement et audio
Sur un thread d'arrière-plan, l'application lit les vecteurs de mouvement compressés propres à la vidéo et une enveloppe de volume à 50 Hz de la bande son, chacun dans un budget de temps, si bien que sur les longs films ils peuvent n'en couvrir qu'une partie. Ils aident à décider quels passages méritent un examen plus attentif, et l'audio garde le mouvement comblé calé sur le rythme.
Étiqueter le mouvement : le classifieur de type de mouvement
La timeline est découpée en fenêtres de 2 secondes. Chaque fenêtre est décrite par six caractéristiques de mouvement et classée dans l'un de quatre grands types de scène par un petit modèle de régression logistique qui s'entraîne pendant que vous utilisez l'application. Des indices tirés de la géométrie des points clés de pose et de la position du visage, activés par défaut, peuvent remplacer ou ajuster sa décision. Une passe de Viterbi lisse ensuite les étiquettes entre fenêtres voisines, pour que le type ne bascule pas sans cesse.
L'étiquette détermine la façon dont le mouvement de cette fenêtre est façonné. Chaque type a un profil de façonnage, neutre au départ, qui ne modifie le résultat qu'une fois que vous l'avez entraîné par vos modifications.
Vos étiquettes l'emportent toujours. Une étiquette que vous posez et qui couvre au moins la moitié d'une fenêtre remplace la réponse du classifieur pour cette fenêtre, et la passe de lissage laisse intactes les fenêtres enseignées.
Tout fusionner en une seule courbe
Le flux indique à quelle vitesse les choses bougent ; les autres signaux indiquent où elles se trouvent. Le moteur intègre la vitesse du flux en une trace de position et la fusionne avec une ancre dans un filtre de Kalman avec un lisseur de Rauch-Tung-Striebel (RTS), qui parcourt toute la vidéo vers l'avant puis vers l'arrière, pour que chaque point profite de ce qui vient après lui.
L'ancre est choisie par vidéo. Le centre de la zone, la pose et la profondeur sont mis en concurrence, et le signal de pose ne peut gagner que s'il couvre au moins un quart de la vidéo et obtient un score suffisant. Par défaut, le gagnant est ensuite remplacé par un mélange de tous les signaux lisibles, échantillon par échantillon, mais seulement si ce mélange obtient un score au moins aussi bon. Les scores de cette mise en concurrence sont écrits dans les métadonnées du script, où Report Studio peut les tracer.
Là où le suivi décroche, le trou est comblé par un mouvement rythmique prolongé à partir des mouvements voisins, et la part de la timeline comblée plutôt que mesurée est enregistrée. Les points sont ensuite placés à chaque changement de direction, l'amplitude suivant la vitesse à l'écran à travers la courbe d'intensité (Smoothed par défaut).
Comment il apprend
- À partir de vos modifications
- Quand vous enregistrez un script généré par l'IA que vous avez modifié (Ctrl+S ou Save As), l'application apprend une échelle de profondeur de mouvement et un décalage de position pour chaque type de mouvement, à partir des fenêtres que vous avez changées.
- À partir de vos étiquettes
- Teach class sur un passage sélectionné de la timeline l'étiquette. Votre étiquette remplace la réponse du classifieur pour ces fenêtres.
- D'une vidéo à l'autre (apprentissage sur corpus)
- Activé par défaut. Chaque génération IA peut garder jusqu'à 40 exemples de cette vidéo, et les traitements suivants s'en servent pour retrouver le suivi. Le résultat dépend donc en partie de ce que vous avez analysé auparavant.
- Pendant un traitement (auto-apprentissage)
- Activé par défaut en mode automatique : le moteur s'entraîne aussi lui-même pendant chaque traitement.
- AI Bulk Learn
- Dans le menu File. Il parcourt un dossier sans créer de scripts, échantillonne de courtes fenêtres (par défaut 30 fenêtres de 4 secondes par vidéo) et met en file celles que le classifieur ne parvient pas à trancher, pour que vous les étiquetiez au clavier. Check my labels signale les étiquettes qui semblent contredire les indices de mouvement, et l'entraînement n'utilise que des étiquettes humaines.
Régénérer la même vidéo avec les mêmes réglages d'analyse réutilise l'analyse du mouvement faite plus tôt dans la session (les trois dernières vidéos, en mémoire), puis se contente de réétiqueter et de reconstruire le script : réessayer après un entraînement est donc quasi instantané.
Où il tourne
Sur votre PC. Les modèles de pose et de profondeur tournent via ONNX Runtime ou PyTorch, sur une carte graphique NVIDIA via CUDA quand il y en a une, sinon sur le CPU. Si vous demandez le GPU et qu'il ne peut pas être utilisé, ils se rabattent sur le CPU et l'application indique lequel est réellement utilisé ; le bouton Check GPU vous dit si l'analyse tourne sur la carte graphique. Le flux optique tourne toujours sur le CPU. Il n'y a pas d'accélération AMD ou Intel pour les modèles d'IA, et TensorRT n'est pas utilisé.
Par défaut, l'application désactive une fonction d'auto-réglage du GPU pour que les modèles donnent les mêmes chiffres d'un traitement à l'autre, au prix d'un peu de vitesse. Les scripts peuvent tout de même différer d'un traitement à l'autre, car l'application continue d'apprendre. GPU, CPU et installation sous Windows détaille la configuration requise.
Ce que l'IA rate encore
Le développeur compare le moteur à des scripts écrits à la main. Sur un petit ensemble de clips, cette comparaison montre là où il est en défaut. C'est une vérification interne, pas un benchmark, nous n'en tirons donc aucun score.
- Changements de direction manqués. Certains retournements qu'une personne scripte sont absents du résultat de l'IA, sur chaque film testé.
- Mouvements trop petits sur les scènes rapides. L'amplitude est à peu près juste sur les films lents et bien trop faible sur les rapides. Moins d'images échantillonnées aggravent le problème.
- Du mouvement là où il n'y en a pas. À l'intérieur de l'action, le moteur continue souvent de produire des mouvements pendant des passages qu'une personne laisserait immobiles. Un filtre qui maintiendrait ces passages au repos existe, mais il est désactivé par défaut.
- Erreurs de type de scène. Les décisions du classifieur ont une précision limitée. Étiquetez les fenêtres qu'il se trompe ; vos étiquettes l'emportent sur lui.
- Comblé, pas mesuré. Là où le suivi est perdu, la courbe est comblée par le rythme au lieu d'être lue dans la vidéo. Le rapport de qualité indique dans quelle proportion.
Nous ne publions aucun chiffre de durée ou de précision, car aucun n'a encore été mesuré par rapport à des scripts faits à la main indépendants, à une échelle que nous pourrions assumer. La page des benchmarks expose ce qui a été mesuré et ce qui ne l'a pas été.
Questions
L'IA envoie-t-elle mes vidéos à un serveur pour les traiter ?
Non. Chaque modèle tourne sur votre PC et le code d'analyse ne fait aucun appel réseau. Internet sert à télécharger les modèles, rechercher les mises à jour, gérer la licence et au cloud de l'Autoblow AI Ultra, qui reçoit le script mais jamais la vidéo.
Quels modèles sont téléchargés ?
Par défaut, YOLOv8 small-pose et MiDaS small, environ 109 Mo à eux deux. Le bouton Download best de l'application propose des modèles de pose plus gros (jusqu'à YOLOv8 large, environ 168 Mo) et en recommande un adapté à un GPU ou à un CPU.
Puis-je désactiver l'IA ?
Décocher « Use adaptive AI engine » fait passer le bouton Generate sur un moteur basique qui suit le mouvement vertical principal avec le flux optique Farneback sur des images en pleine résolution. La case est recochée à chaque lancement, et Batch Generate Folder et Generate + Play utilisent toujours le moteur d'IA.
S'améliore-t-il à l'usage ?
Il évolue avec l'usage : vos étiquettes, vos modifications enregistrées et les exemples qu'il garde des vidéos précédentes alimentent tous les traitements suivants. Nous n'avons pas mesuré dans quelle mesure cela améliore les résultats, nous n'avançons donc aucun chiffre.
À lire ensuite
- La section technologieDétails techniques sur la pose, le flux, la profondeur et la correction de dérive.
- De la vidéo au script, étape par étapeCe qui arrive à votre fichier et où le résultat est enregistré.
- Le générateur de funscript AutoScript SyncCe que vous obtenez, comment l'utiliser, appareils, prix et essai.
- Le guide des modèles sur la page d'accueilLes niveaux de pose et de profondeur côte à côte.
Regardez l'IA travailler sur vos propres vidéos
L'essai gratuit débloque toutes les fonctions pendant un jour ; une licence coûte £14.99 une fois et n'est pas liée à une version.