La IA dentro de AutoScript Sync
Un funscript con IA sale de varias partes que trabajan juntas, todas ejecutándose en tu PC. Un mapa de calor de movimiento encuentra dónde está la acción, el flujo óptico mide cómo se mueve, los modelos opcionales de pose y profundidad añaden puntos clave del cuerpo y una lectura de acercamiento o alejamiento, un pequeño clasificador etiqueta cada ventana de 2 segundos por tipo de movimiento, y un suavizador lo fusiona todo en una sola curva de posición. Aprende de tus etiquetas y ediciones, y una etiqueta que pongas tú siempre tiene prioridad sobre su propia suposición.
Comprobado con el código de la aplicación el 21 de septiembre de 2026. Describe la versión 2.121.1, la actual.
Lo que aporta cada parte
Cada fotograma muestreado se reduce primero a 320 px de ancho (el material de RV se corrige primero a una vista plana de un ojo). La búsqueda de región, el flujo, la pose y la profundidad trabajan todos sobre ese fotograma pequeño.
Encontrar la acción: un mapa de calor de relevancia del movimiento
Si no le das una región, el motor mantiene un mapa de calor de dónde ocurre el movimiento, desvaneciendo el movimiento más antiguo sobre la marcha, luego toma la zona conectada más caliente y la amplía un 15 %. Esa zona es la que se mide. Puedes sustituirla por un recuadro (Set Motion Region…) o por un recuadro móvil que arrastras mientras se reproduce el vídeo (Live Track). La aplicación también registra qué punto clave del cuerpo siguen tus recuadros, para poder proponer regiones en vídeos nuevos.
Medir el movimiento: flujo óptico DIS
El flujo óptico estima cómo se movió cada píxel entre dos fotogramas. El motor predeterminado usa el flujo denso DIS de OpenCV, más una pasada más rápida a media resolución que comprueba si el flujo es fiable. En High también mide la región seguida a 640 px, en vídeo plano que tenga al menos ese ancho. Ambos se ejecutan en la CPU. La traza de posición se integra a partir de la velocidad del flujo. El flujo óptico en detalle.
Seguir a las personas: YOLOv8-pose y el seguidor de personas
Si hay un modelo de pose instalado (la descarga predeterminada es YOLOv8 small-pose, de unos 45 MB), encuentra a cada persona con una confianza superior a 0,35 con 17 puntos clave del cuerpo. Un seguidor empareja a las personas de un fotograma a otro por la posición y el tamaño del recuadro, construye señales de movimiento candidatas a partir de pares de regiones del cuerpo y se queda con la de ritmo más claro en cada escena. La pose es opcional: sin ella, el motor funciona solo con el flujo y lo indica en su línea de estado Inference. La estimación de pose en detalle.
Ver el acercamiento y el alejamiento: profundidad MiDaS
El flujo óptico plano no puede ver el movimiento hacia la cámara o alejándose de ella. Los modelos de profundidad MiDaS v2.1 (small, de unos 64 MB, es el predeterminado; large, de unos 397 MB, está pensado para una GPU) estiman la profundidad relativa en uno de cada dos fotogramas muestreados, promediada sobre los píxeles en movimiento de la región. Eso se convierte en otra señal de posición candidata. Si el modelo tarda más de 3 segundos por fotograma, la profundidad se desactiva para esa ejecución. La estimación de profundidad en detalle.
Testigos en segundo plano: vectores de movimiento y audio
En un hilo en segundo plano, la aplicación lee los vectores de movimiento comprimidos del propio vídeo y una envolvente de volumen a 50 Hz de la banda sonora, cada uno con un presupuesto de tiempo, así que en películas largas puede que solo cubran una parte. Ayudan a decidir qué tramos merecen un examen más detallado, y el audio mantiene el movimiento de relleno al compás del ritmo.
Etiquetar el movimiento: el clasificador de tipo de movimiento
La línea de tiempo se divide en ventanas de 2 segundos. Cada ventana se describe con seis características de movimiento y se asigna a uno de cuatro tipos de escena generales mediante un pequeño modelo de regresión logística que se entrena mientras usas la aplicación. Los indicios de la geometría de los puntos clave de pose y de la posición de la cara, activados por defecto, pueden anular o ajustar su decisión. Después, una pasada de Viterbi suaviza las etiquetas entre ventanas vecinas, para que el tipo no salte de un lado a otro.
La etiqueta decide cómo se da forma al movimiento de esa ventana. Cada tipo tiene un perfil de forma, que empieza neutro y solo cambia el resultado después de que se lo enseñes con tus ediciones.
Tus etiquetas siempre prevalecen. Una etiqueta que pongas y que cubra al menos media ventana sustituye la respuesta del clasificador para esa ventana, y la pasada de suavizado deja en paz las ventanas enseñadas.
Fusionarlo todo en una curva
El flujo dice lo rápido que se mueven las cosas; las demás señales dicen dónde están. El motor integra la velocidad del flujo en una traza de posición y la fusiona con un ancla en un filtro de Kalman con un suavizador Rauch-Tung-Striebel (RTS), que recorre el vídeo entero hacia delante y luego hacia atrás para que cada punto se beneficie de lo que vino después.
El ancla se elige para cada vídeo. El centro de la región, la pose y la profundidad compiten, y la señal de pose solo puede ganar si cubre al menos una cuarta parte del vídeo y puntúa lo suficiente. Por defecto, el ganador se sustituye después por una mezcla de todas las señales legibles, muestra a muestra, pero solo si la mezcla puntúa al menos igual de bien. Las puntuaciones de esta competición se escriben en los metadatos del script, donde Report Studio puede representarlas en gráficos.
Donde el seguimiento se pierde, el hueco se rellena con movimiento rítmico que continúa los recorridos de alrededor, y se registra la proporción de la línea de tiempo rellenada en lugar de medida. Después se colocan puntos en cada cambio de dirección, con un tamaño de recorrido que sigue la velocidad en pantalla a través de la curva de intensidad (Smoothed por defecto).
Cómo aprende
- De tus ediciones
- Cuando guardas un script generado por IA que has editado (Ctrl+S o Save As), la aplicación aprende una escala de profundidad de recorrido y un desplazamiento de posición para cada tipo de movimiento a partir de las ventanas que cambiaste.
- De tus etiquetas
- Teach class sobre un tramo seleccionado de la línea de tiempo lo etiqueta. Tu etiqueta sustituye la respuesta del clasificador para esas ventanas.
- Entre vídeos (aprendizaje de corpus)
- Activado por defecto. Cada generación con IA puede guardar hasta 40 ejemplos de ese vídeo, y las ejecuciones posteriores los usan para recuperar el seguimiento. Así que el resultado depende en parte de lo que hayas analizado antes.
- Dentro de una ejecución (autoaprendizaje)
- Activado por defecto en modo automático: el motor también se enseña a sí mismo durante cada ejecución.
- AI Bulk Learn
- En el menú File. Analiza una carpeta sin crear scripts, muestrea ventanas cortas (por defecto 30 ventanas de 4 segundos por vídeo) y pone en cola las que el clasificador no puede decidir, para que las etiquetes con el teclado. Check my labels marca las etiquetas que parecen incorrectas frente a los indicios de movimiento, y el aprendizaje usa solo etiquetas humanas.
Volver a generar el mismo vídeo con los mismos ajustes de análisis reutiliza el análisis de movimiento anterior de la sesión (los tres últimos vídeos, en memoria), y luego solo vuelve a etiquetar y reconstruye el script, así que volver a intentarlo después de enseñarle es casi instantáneo.
Dónde se ejecuta
En tu PC. Los modelos de pose y profundidad se ejecutan mediante ONNX Runtime o PyTorch, en una tarjeta gráfica NVIDIA mediante CUDA cuando hay una disponible y, si no, en la CPU. Si pides la GPU y no se puede usar, recurren a la CPU y la aplicación informa de cuál se está usando de verdad; el botón Check GPU te dice si el análisis se hace en la tarjeta gráfica. El flujo óptico siempre se ejecuta en la CPU. No hay aceleración AMD ni Intel para los modelos de IA, y no se usa TensorRT.
Por defecto, la aplicación desactiva una función de ajuste automático de la GPU para que los modelos den los mismos números en cada ejecución, a costa de algo de velocidad. Los scripts pueden seguir siendo distintos entre ejecuciones porque la aplicación sigue aprendiendo. GPU, CPU e instalación en Windows trata los requisitos.
En qué se sigue equivocando la IA
El desarrollador compara el motor con scripts escritos a mano. En un pequeño conjunto de clips, esa comparación muestra dónde se queda corto. Es una comprobación interna, no un benchmark, así que no damos ninguna puntuación basada en ella.
- Cambios de dirección perdidos. Algunas inversiones que una persona incluye en su script no aparecen en el resultado de la IA, en todas las películas probadas.
- Recorridos demasiado pequeños en escenas rápidas. El tamaño del recorrido es aproximadamente correcto en películas lentas y demasiado pequeño en las rápidas. Muestrear menos fotogramas lo empeora.
- Movimiento donde no lo hay. Dentro de la acción, el motor a menudo sigue generando recorridos en tramos que una persona dejaría quietos. Existe un filtro que mantendría esos tramos en reposo, pero está desactivado por defecto.
- Errores de tipo de escena. Las decisiones del clasificador tienen una precisión limitada. Etiqueta las ventanas en las que se equivoca; tus etiquetas se imponen.
- Rellenado, no medido. Donde se pierde el seguimiento, la curva se rellena con ritmo en lugar de leerse del vídeo. El informe de calidad muestra cuánto.
No publicamos ninguna cifra de tiempo ni de precisión porque todavía no se ha medido ninguna frente a scripts independientes hechos a mano a una escala que podamos respaldar. La página de benchmarks explica qué se ha medido y qué no.
Preguntas
¿La IA envía mis vídeos a un servidor para procesarlos?
No. Todos los modelos se ejecutan en tu PC y el código de análisis no hace llamadas de red. Internet se usa para descargar modelos, buscar actualizaciones, las licencias y la nube del Autoblow AI Ultra, que recibe el script pero nunca el vídeo.
¿Qué modelos se descargan?
Por defecto, YOLOv8 small-pose y MiDaS small, unos 109 MB en total. El botón Download best de la aplicación ofrece modelos de pose más grandes (hasta YOLOv8 large, de unos 168 MB) y recomienda uno adecuado para una GPU o una CPU.
¿Puedo desactivar la IA?
Desmarcar "Use adaptive AI engine" hace que el botón Generate use un motor básico que sigue el movimiento vertical principal con flujo óptico Farneback en fotogramas a resolución completa. La casilla vuelve a marcarse en cada inicio, y Batch Generate Folder y Generate + Play siempre usan el motor de IA.
¿Mejora cuanto más lo uso?
Cambia con el uso: tus etiquetas, las ediciones guardadas y los ejemplos que conserva de vídeos anteriores alimentan las ejecuciones posteriores. No hemos medido cuánto mejora eso los resultados, así que no damos ninguna cifra.
Sigue leyendo
- La sección de tecnologíaDetalles técnicos sobre pose, flujo, profundidad y corrección de deriva.
- Del vídeo al script, paso a pasoQué le pasa a tu archivo y dónde se guarda el resultado.
- El generador de funscript AutoScript SyncQué obtienes, cómo usarlo, dispositivos, precio y prueba.
- La guía de modelos de la página de inicioLos niveles de pose y profundidad, uno al lado del otro.
Mira cómo trabaja la IA con tus propios vídeos
La prueba gratuita desbloquea todas las funciones durante un día; una licencia cuesta £14.99 una sola vez y no está ligada a una versión.