Estimativa de profundidade: o eixo que um vídeo plano esconde
Um vídeo é plano, então o movimento direto em direção à câmera ou para longe dela quase não aparece como movimento na tela. A estimativa de profundidade para funscripts preenche essa lacuna: o AutoScript Sync roda no seu PC um modelo MiDaS que estima o quão perto está cada parte do quadro e acompanha como isso muda na região em movimento. O resultado é mais um sinal de posição candidato. A profundidade é opcional, e o script continua sendo construído sobre o fluxo óptico.
Conferido com o código do app em 21 de setembro de 2026.
Por que a profundidade importa
O fluxo óptico mede como as coisas se movem pela imagem: para cima, para baixo, para a esquerda, para a direita. Quando um curso corre ao longo da linha de visão da câmera, como em cenas POV, o objeto em movimento mais cresce e encolhe do que atravessa o quadro. O fluxo enxerga muito pouco disso. Um modelo de profundidade lê os mesmos quadros como perto e longe, então um curso nesse eixo aparece como uma mudança de profundidade.
Qual modelo MiDaS é usado
O AutoScript Sync usa modelos de profundidade MiDaS v2.1 em formato ONNX. Eles dão profundidade relativa, ou seja, mais perto e mais longe dentro de uma imagem, não distâncias em centímetros.
| Modelo | Tamanho | Usado |
|---|---|---|
| MiDaS small | ~64 MB | Fast e Balanced, e todos os níveis numa CPU. O download padrão. |
| MiDaS large | ~397 MB | High, apenas numa GPU CUDA, se você o tiver baixado. Recomenda-se uma GPU. |
Essa escolha é feita pelo Auto-pick model tier from Accuracy, que vem ativado por padrão, e ele só pode escolher um modelo já instalado. O motor aceita qualquer modelo ONNX de profundidade relativa que você indicar, mas o MiDaS é o único que o app oferece para download.
Como a profundidade vira um sinal
A profundidade é inferida a cada dois quadros amostrados, na imagem de análise de 320 px de largura, e tirada a média sobre os pixels que estão de fato se movendo dentro da região rastreada. O resultado se junta ao centro da região e aos pontos-chave da pose como âncora candidata para o traçado de posição. Se o modelo de profundidade levar mais de 3 segundos por quadro, o motor desliga a profundidade pelo resto daquela execução, em vez de deixar um único modelo lento travar o trabalho inteiro.
Uma escala de profundidade por vídeo, não por quadro
A saída de um modelo de profundidade não tem unidades fixas: cada quadro volta na sua própria escala. Se cada quadro for normalizado sozinho, a própria escala muda de quadro para quadro, e essa mudança parece movimento. O AutoScript Sync, em vez disso, define uma única escala para o vídeo inteiro, a partir de percentis robustos das leituras de profundidade, para que uma mudança no número signifique uma mudança na cena.
| Medida | Escala por quadro | Escala por vídeo |
|---|---|---|
| Correlação das mudanças de profundidade de um quadro para outro | 0.594 | 0.963 |
| Passos com uma inversão de direção espúria | 42% | 2% |
Esta é uma medição de engenharia restrita, feita contra a saída bruta do modelo, tirada pelo desenvolvedor em 10 de setembro de 2026. Ela mostra que a escala por vídeo impede o sinal de profundidade de se contradizer; não é uma medida de quão preciso é o script final.
Configurações que moldam a profundidade
Dois controles deslizantes nas configurações de curso têm "depth" no nome. Só o Depth priority muda a análise; o Depth emphasis molda o comprimento do curso no caminho até o dispositivo e não envolve o modelo MiDaS. Nenhum dos dois liga ou desliga o modelo de profundidade; isso depende de haver um modelo de profundidade instalado e escolhido.
- Depth priority
- 30 a 90, padrão 85. Define quanto do traçado de posição vem da velocidade medida, em vez da âncora de posição da qual a profundidade é uma candidata: quanto maior o valor, menos peso a âncora recebe. A própria dica do app descreve a velocidade como portadora do tamanho do curso e a âncora como o que impede o desvio, mas achata a profundidade, e sugere baixá-lo para 45–65 se um script parecer agitado ou fundo demais. Ele muda a análise, então exige gerar de novo.
- Depth emphasis
- 100% a 200%, padrão 100% (neutro). Cursos fundos vão proporcionalmente mais longe. Ele molda a cópia enviada a um dispositivo, então reenvie o script depois de mudá-lo; o arquivo salvo não é alterado. No app lançado, essa moldagem vale para o envio ao Autoblow AI Ultra; aplicá-la aos dispositivos do Intiface, e incorporá-la ao Export Script (as played), vem na próxima atualização.
Quanto custa a profundidade
A profundidade roda numa GPU NVIDIA via CUDA quando há uma disponível, e na CPU caso contrário; o app informa qual está realmente usando. Um comentário no código, do PC de teste com RTX 5080, coloca o MiDaS small em cerca de 25,8 ms por chamada na GPU contra 234 ms na CPU. Rodá-lo a cada dois quadros amostrados, em vez de em todos, corta esse trabalho pela metade. Na GPU, o pool de memória CUDA do modelo de profundidade é limitado a 4 GB.
Não publicamos qual parcela de uma análise inteira a profundidade ocupa, porque nenhuma tabela de medições sustenta a estimativa provisória. A página de benchmarks lista o que foi medido.
Limites
- Relativa, não absoluta. O MiDaS diz mais perto ou mais longe, não a que distância. O tamanho do curso continua vindo do traçado fundido, não só da profundidade.
- Média sobre a região em movimento. A profundidade é a média de todos os pixels em movimento na região rastreada, então outros movimentos dentro dela entram na média junto com o curso. Desenhar sua própria região com Set Motion Region… ou Live Track a estreita.
- Mais pesado não está provado ser melhor. Nenhuma comparação entre o MiDaS small e o MiDaS large quanto à precisão dos cursos foi registrada.
- O tamanho do curso ainda é um ponto fraco. Comparados com os clipes de teste roteirizados à mão pelo desenvolvedor, os cursos do motor nos dois filmes mais rápidos tiveram um quarto e metade do tamanho dos do humano. Não há nenhuma medição registrada do erro de profundidade em unidades absolutas.
Perguntas
Preciso de um modelo de profundidade?
Não. Sem ele, o motor trabalha a partir do fluxo óptico, do centro da região e da pose, se instalada. O MiDaS small é baixado automaticamente, a menos que você desative os downloads automáticos.
Devo baixar o MiDaS large?
Só se você roda High numa GPU NVIDIA; ele não é usado numa CPU nem nos outros níveis. Não medimos se ele produz scripts melhores que o MiDaS small.
Um script parece fundo demais ou agitado demais. É a profundidade?
Pode ser o equilíbrio entre velocidade e âncora. Experimente o Depth priority entre 45 e 65 e gere de novo. Se os cursos simplesmente parecerem longos demais no dispositivo, o Depth emphasis em 100% é neutro.
A estimativa de profundidade funciona em vídeo de RV?
Vídeos de RV são primeiro desentortados para uma vista em perspectiva normal de um olho, e a profundidade roda nessa vista como em qualquer outro vídeo. A detecção do layout é heurística, baseada em alguns quadros amostrados.
Leia a seguir
- Como funciona a geração de funscript com IAO pipeline completo, da decodificação ao dispositivo.
- Como o fluxo óptico lê o movimentoO sinal de velocidade com o qual a profundidade é comparada.
- Estimativa de pose no AutoScript SyncO outro modelo opcional e candidato a âncora.
- O que cada parte de IA contribuiA visão de produto dos modelos, e como o app aprende com as edições.
Experimente nos seus próprios vídeos
O teste dura um dia e roda no seu próprio PC; seus vídeos são analisados localmente e nunca são enviados.