Estimación de profundidad: el eje que oculta un vídeo plano
Un vídeo es plano, así que el movimiento directamente hacia la cámara o alejándose de ella apenas aparece como movimiento en pantalla. La estimación de profundidad para funscripts cubre ese hueco: AutoScript Sync ejecuta en tu PC un modelo MiDaS que estima lo cerca que está cada parte del fotograma y sigue cómo cambia eso en la región en movimiento. El resultado es una señal de posición candidata más. La profundidad es opcional, y el script se sigue construyendo sobre el flujo óptico.
Comprobado con el código de la aplicación el 21 de septiembre de 2026.
Por qué importa la profundidad
El flujo óptico mide cómo se mueven las cosas a lo largo de la imagen: arriba, abajo, izquierda, derecha. Cuando un recorrido va en la línea de visión de la cámara, como en las imágenes en primera persona (POV), el objeto en movimiento sobre todo crece y se encoge en lugar de desplazarse por el fotograma. El flujo ve muy poco de eso. Un modelo de profundidad lee los mismos fotogramas como cerca y lejos, así que un recorrido a lo largo de ese eje aparece en cambio como un cambio de profundidad.
Qué modelo MiDaS se usa
AutoScript Sync usa modelos de profundidad MiDaS v2.1 en formato ONNX. Dan profundidad relativa, es decir, más cerca y más lejos dentro de una misma imagen, no distancias en centímetros.
| Modelo | Tamaño | Se usa |
|---|---|---|
| MiDaS small | ~64 MB | Fast y Balanced, y todos los niveles en una CPU. La descarga predeterminada. |
| MiDaS large | ~397 MB | High, solo en una GPU con CUDA, si lo has descargado. Se recomienda una GPU. |
Esa elección la hace Auto-pick model tier from Accuracy, que está activado por defecto, y solo puede elegir un modelo ya instalado. El motor acepta cualquier modelo ONNX de profundidad relativa que le indiques, pero MiDaS es el único que la aplicación ofrece descargar.
Cómo se convierte la profundidad en una señal
La profundidad se infiere en uno de cada dos fotogramas muestreados, sobre la imagen de análisis de 320 px de ancho, y se promedia sobre los píxeles que realmente se mueven dentro de la región seguida. El resultado se une al centro de la región y a los puntos clave de la pose como ancla candidata para la traza de posición. Si el modelo de profundidad tarda más de 3 segundos por fotograma, el motor desactiva la profundidad durante el resto de esa ejecución en lugar de dejar que un modelo lento retrase todo el trabajo.
Una escala de profundidad por vídeo, no por fotograma
La salida de un modelo de profundidad no tiene unidades fijas: cada fotograma llega con su propia escala. Si cada fotograma se normaliza por separado, la propia escala cambia de un fotograma a otro, y ese cambio parece movimiento. AutoScript Sync fija en cambio una escala para todo el vídeo, a partir de percentiles robustos de las lecturas de profundidad, de modo que un cambio en el número significa un cambio en la escena.
| Medida | Escalado por fotograma | Escalado por vídeo |
|---|---|---|
| Correlación entre fotogramas de los cambios de profundidad | 0.594 | 0.963 |
| Pasos con un cambio de sentido espurio | 42% | 2% |
Es una medición técnica acotada frente a la salida en bruto del modelo, tomada por el desarrollador el 10 de septiembre de 2026. Muestra que el escalado por vídeo impide que la señal de profundidad se contradiga a sí misma; no es una medida de la precisión del script terminado.
Ajustes que dan forma a la profundidad
Dos controles deslizantes de los ajustes de recorrido llevan "Depth" en su nombre. Solo Depth priority cambia el análisis; Depth emphasis da forma a la longitud del recorrido de camino a un dispositivo y no interviene en el modelo MiDaS. Ninguno de los dos activa ni desactiva el modelo de profundidad; eso depende de si hay un modelo de profundidad instalado y elegido.
- Depth priority
- De 30 a 90, predeterminado 85. Fija qué parte de la traza de posición procede de la velocidad medida en lugar del ancla de posición, de la que la profundidad es una candidata: cuanto más alto el valor, menos peso recibe el ancla. La propia descripción emergente de la aplicación dice que la velocidad aporta el tamaño del recorrido y que el ancla detiene la deriva pero aplana la profundidad, y sugiere bajarlo a 45–65 si un script se siente demasiado agitado o demasiado profundo. Cambia el análisis, así que requiere regenerar.
- Depth emphasis
- Del 100% al 200%, predeterminado 100% (neutro). Los recorridos profundos llegan proporcionalmente más lejos. Da forma a la copia que se envía a un dispositivo, así que vuelve a enviar el script después de cambiarlo; el archivo guardado no se modifica. En la aplicación publicada, este ajuste para el dispositivo se aplica a la subida al Autoblow AI Ultra; aplicarlo a los dispositivos Intiface, e incorporarlo en Export Script (as played), llega en la próxima actualización.
Lo que cuesta la profundidad
La profundidad se ejecuta en una GPU NVIDIA mediante CUDA cuando hay una disponible, y en la CPU en caso contrario; la aplicación informa de cuál está usando realmente. Un comentario en el código, del PC de pruebas con RTX 5080, sitúa MiDaS small en unos 25,8 ms por llamada en la GPU frente a 234 ms en la CPU. Ejecutarlo en uno de cada dos fotogramas muestreados en lugar de en todos reduce ese trabajo a la mitad. En la GPU, el pool de memoria CUDA del modelo de profundidad está limitado a 4 GB.
No hemos publicado qué parte de un análisis completo ocupa la profundidad, porque ninguna tabla de mediciones respalda la estimación de trabajo. La página de pruebas de rendimiento enumera lo que se ha medido.
Límites
- Relativa, no absoluta. MiDaS dice más cerca o más lejos, no a qué distancia. El tamaño del recorrido sigue saliendo de la traza fusionada, no solo de la profundidad.
- Promediada sobre la región en movimiento. La profundidad se promedia sobre todos los píxeles en movimiento de la región seguida, así que cualquier otro movimiento dentro de ella se promedia junto con el recorrido. Dibujar tu propia región con Set Motion Region… o Live Track la acota.
- Más pesado no está demostrado que sea mejor. No se ha registrado ninguna comparación de MiDaS small frente a MiDaS large en precisión de recorridos.
- El tamaño del recorrido sigue siendo un punto débil. Frente a los clips de prueba con scripts hechos a mano por el desarrollador, los recorridos del motor en las dos películas más rápidas tenían una cuarta parte y la mitad del tamaño de los de la persona. No hay ninguna medición registrada del error de profundidad en unidades absolutas.
Preguntas
¿Necesito un modelo de profundidad?
No. Sin él, el motor trabaja con el flujo óptico, el centro de la región y la pose si está instalada. MiDaS small se descarga automáticamente salvo que desactives las descargas automáticas.
¿Debo descargar MiDaS large?
Solo si usas High en una GPU NVIDIA; no se usa en una CPU ni en los demás niveles. No hemos medido si produce mejores scripts que MiDaS small.
Un script se siente demasiado profundo o demasiado agitado. ¿Es por la profundidad?
Puede ser el equilibrio entre velocidad y ancla. Prueba Depth priority entre 45 y 65 y regenera. Si los recorridos simplemente se sienten demasiado largos en el dispositivo, Depth emphasis al 100% es neutro.
¿La estimación de profundidad funciona con vídeo de RV?
Las imágenes de RV se desdeforman primero a una vista en perspectiva normal de un solo ojo, y la profundidad se ejecuta sobre esa vista como con cualquier otra imagen. La detección del formato es heurística, basada en unos pocos fotogramas muestreados.
Sigue leyendo
- Cómo funciona la generación de funscript con IAEl proceso completo, de la decodificación al dispositivo.
- Cómo lee el movimiento el flujo ópticoLa señal de velocidad con la que se compara la profundidad.
- La estimación de pose en AutoScript SyncEl otro modelo opcional y candidato a ancla.
- Qué aporta cada parte de la IALa visión de producto de los modelos y cómo aprende la aplicación de las ediciones.
Pruébalo con tus propios vídeos
La prueba dura un día y se ejecuta en tu propio PC; tus vídeos se analizan localmente y nunca se suben.