Estimativa de profundidade: o eixo que um vídeo plano esconde

Um vídeo é plano, então o movimento direto em direção à câmera ou para longe dela quase não aparece como movimento na tela. A estimativa de profundidade para funscripts preenche essa lacuna: o AutoScript Sync roda no seu PC um modelo MiDaS que estima o quão perto está cada parte do quadro e acompanha como isso muda na região em movimento. O resultado é mais um sinal de posição candidato. A profundidade é opcional, e o script continua sendo construído sobre o fluxo óptico.

Conferido com o código do app em 21 de setembro de 2026.

Por que a profundidade importa

O fluxo óptico mede como as coisas se movem pela imagem: para cima, para baixo, para a esquerda, para a direita. Quando um curso corre ao longo da linha de visão da câmera, como em cenas POV, o objeto em movimento mais cresce e encolhe do que atravessa o quadro. O fluxo enxerga muito pouco disso. Um modelo de profundidade lê os mesmos quadros como perto e longe, então um curso nesse eixo aparece como uma mudança de profundidade.

Across-the-frame motion versus motion toward the camera Left: a stroke across the frame moves a long way on screen, which optical flow measures. Right: a stroke toward the camera barely moves on screen but changes depth, which the depth model measures. Across the frame Toward the camera Large on-screen shift: flow reads it Grows, barely moves: depth reads it Dashed: position at the start of a stroke. Teal: position at the end.
O mesmo comprimento de curso pode ser um movimento longo pela imagem ou quase nenhum, dependendo da direção em que ele corre em relação à câmera.

Qual modelo MiDaS é usado

O AutoScript Sync usa modelos de profundidade MiDaS v2.1 em formato ONNX. Eles dão profundidade relativa, ou seja, mais perto e mais longe dentro de uma imagem, não distâncias em centímetros.

Modelos de profundidade MiDaS e quando cada um é usado
ModeloTamanhoUsado
MiDaS small~64 MBFast e Balanced, e todos os níveis numa CPU. O download padrão.
MiDaS large~397 MBHigh, apenas numa GPU CUDA, se você o tiver baixado. Recomenda-se uma GPU.

Essa escolha é feita pelo Auto-pick model tier from Accuracy, que vem ativado por padrão, e ele só pode escolher um modelo já instalado. O motor aceita qualquer modelo ONNX de profundidade relativa que você indicar, mas o MiDaS é o único que o app oferece para download.

Como a profundidade vira um sinal

A profundidade é inferida a cada dois quadros amostrados, na imagem de análise de 320 px de largura, e tirada a média sobre os pixels que estão de fato se movendo dentro da região rastreada. O resultado se junta ao centro da região e aos pontos-chave da pose como âncora candidata para o traçado de posição. Se o modelo de profundidade levar mais de 3 segundos por quadro, o motor desliga a profundidade pelo resto daquela execução, em vez de deixar um único modelo lento travar o trabalho inteiro.

Uma escala de profundidade por vídeo, não por quadro

A saída de um modelo de profundidade não tem unidades fixas: cada quadro volta na sua própria escala. Se cada quadro for normalizado sozinho, a própria escala muda de quadro para quadro, e essa mudança parece movimento. O AutoScript Sync, em vez disso, define uma única escala para o vídeo inteiro, a partir de percentis robustos das leituras de profundidade, para que uma mudança no número signifique uma mudança na cena.

Escala de profundidade por quadro versus por vídeo, medida em 150 quadros de um filme
MedidaEscala por quadroEscala por vídeo
Correlação das mudanças de profundidade de um quadro para outro0.5940.963
Passos com uma inversão de direção espúria42%2%

Esta é uma medição de engenharia restrita, feita contra a saída bruta do modelo, tirada pelo desenvolvedor em 10 de setembro de 2026. Ela mostra que a escala por vídeo impede o sinal de profundidade de se contradizer; não é uma medida de quão preciso é o script final.

Configurações que moldam a profundidade

Dois controles deslizantes nas configurações de curso têm "depth" no nome. Só o Depth priority muda a análise; o Depth emphasis molda o comprimento do curso no caminho até o dispositivo e não envolve o modelo MiDaS. Nenhum dos dois liga ou desliga o modelo de profundidade; isso depende de haver um modelo de profundidade instalado e escolhido.

Depth priority
30 a 90, padrão 85. Define quanto do traçado de posição vem da velocidade medida, em vez da âncora de posição da qual a profundidade é uma candidata: quanto maior o valor, menos peso a âncora recebe. A própria dica do app descreve a velocidade como portadora do tamanho do curso e a âncora como o que impede o desvio, mas achata a profundidade, e sugere baixá-lo para 45–65 se um script parecer agitado ou fundo demais. Ele muda a análise, então exige gerar de novo.
Depth emphasis
100% a 200%, padrão 100% (neutro). Cursos fundos vão proporcionalmente mais longe. Ele molda a cópia enviada a um dispositivo, então reenvie o script depois de mudá-lo; o arquivo salvo não é alterado. No app lançado, essa moldagem vale para o envio ao Autoblow AI Ultra; aplicá-la aos dispositivos do Intiface, e incorporá-la ao Export Script (as played), vem na próxima atualização.

Quanto custa a profundidade

A profundidade roda numa GPU NVIDIA via CUDA quando há uma disponível, e na CPU caso contrário; o app informa qual está realmente usando. Um comentário no código, do PC de teste com RTX 5080, coloca o MiDaS small em cerca de 25,8 ms por chamada na GPU contra 234 ms na CPU. Rodá-lo a cada dois quadros amostrados, em vez de em todos, corta esse trabalho pela metade. Na GPU, o pool de memória CUDA do modelo de profundidade é limitado a 4 GB.

Não publicamos qual parcela de uma análise inteira a profundidade ocupa, porque nenhuma tabela de medições sustenta a estimativa provisória. A página de benchmarks lista o que foi medido.

Limites

  • Relativa, não absoluta. O MiDaS diz mais perto ou mais longe, não a que distância. O tamanho do curso continua vindo do traçado fundido, não só da profundidade.
  • Média sobre a região em movimento. A profundidade é a média de todos os pixels em movimento na região rastreada, então outros movimentos dentro dela entram na média junto com o curso. Desenhar sua própria região com Set Motion Region… ou Live Track a estreita.
  • Mais pesado não está provado ser melhor. Nenhuma comparação entre o MiDaS small e o MiDaS large quanto à precisão dos cursos foi registrada.
  • O tamanho do curso ainda é um ponto fraco. Comparados com os clipes de teste roteirizados à mão pelo desenvolvedor, os cursos do motor nos dois filmes mais rápidos tiveram um quarto e metade do tamanho dos do humano. Não há nenhuma medição registrada do erro de profundidade em unidades absolutas.

Perguntas

Preciso de um modelo de profundidade?

Não. Sem ele, o motor trabalha a partir do fluxo óptico, do centro da região e da pose, se instalada. O MiDaS small é baixado automaticamente, a menos que você desative os downloads automáticos.

Devo baixar o MiDaS large?

Só se você roda High numa GPU NVIDIA; ele não é usado numa CPU nem nos outros níveis. Não medimos se ele produz scripts melhores que o MiDaS small.

Um script parece fundo demais ou agitado demais. É a profundidade?

Pode ser o equilíbrio entre velocidade e âncora. Experimente o Depth priority entre 45 e 65 e gere de novo. Se os cursos simplesmente parecerem longos demais no dispositivo, o Depth emphasis em 100% é neutro.

A estimativa de profundidade funciona em vídeo de RV?

Vídeos de RV são primeiro desentortados para uma vista em perspectiva normal de um olho, e a profundidade roda nessa vista como em qualquer outro vídeo. A detecção do layout é heurística, baseada em alguns quadros amostrados.

Leia a seguir

Experimente nos seus próprios vídeos

O teste dura um dia e roda no seu próprio PC; seus vídeos são analisados localmente e nunca são enviados.