A IA dentro do AutoScript Sync

Um funscript com IA nasce de várias partes trabalhando juntas, todas rodando no seu PC. Um mapa de calor de movimento encontra onde está a ação, o fluxo óptico mede como ela se move, modelos opcionais de pose e profundidade acrescentam pontos-chave do corpo e uma leitura de aproximação ou afastamento, um pequeno classificador rotula cada janela de 2 segundos pelo tipo de movimento, e um suavizador funde tudo numa única curva de posição. Ele aprende com seus rótulos e edições, e um rótulo definido por você sempre tem prioridade sobre o palpite dele.

Conferido com o código do app em 21 de setembro de 2026. Descreve a versão 2.121.1, a versão atual.

O que cada parte contribui

Cada quadro amostrado é primeiro reduzido para 320 px de largura (vídeos de RV são antes desdistorcidos para uma visão plana de um olho). A busca de região, o fluxo, a pose e a profundidade trabalham todos nesse quadro pequeno.

Encontrando a ação: um mapa de calor de saliência de movimento

Sem uma região definida por você, o motor mantém um mapa de calor de onde o movimento acontece, desbotando o movimento mais antigo à medida que avança, depois pega a área conectada mais quente e a amplia em 15%. Essa área é o que é medido. Você pode substituí-la por uma caixa (Set Motion Region…) ou por uma caixa móvel que você arrasta enquanto o vídeo toca (Live Track). O app também registra qual ponto-chave do corpo suas caixas seguem, para poder propor regiões em vídeos novos.

Medindo o movimento: fluxo óptico DIS

O fluxo óptico estima como cada pixel se moveu entre dois quadros. O motor padrão usa o fluxo denso DIS do OpenCV, mais uma passada mais rápida em meia resolução que verifica se o fluxo é confiável. No High ele também mede a região rastreada a 640 px, em vídeo plano com pelo menos essa largura. Ambos rodam na CPU. É da velocidade do fluxo que o traçado de posição é integrado. Fluxo óptico em detalhes.

Seguindo pessoas: YOLOv8-pose e o rastreador de pessoas

Se um modelo de pose estiver instalado (o download padrão é o YOLOv8 small-pose, cerca de 45 MB), ele encontra cada pessoa acima de 0,35 de confiança com 17 pontos-chave do corpo. Um rastreador associa as pessoas de quadro a quadro pela posição e tamanho da caixa, monta sinais candidatos de movimento a partir de pares de regiões do corpo e fica com o de ritmo mais claro em cada cena. A pose é opcional: sem ela, o motor roda só com o fluxo e informa isso na sua linha de status Inference. Estimativa de pose em detalhes.

Vendo a aproximação e o afastamento: profundidade MiDaS

O fluxo óptico plano não enxerga movimento em direção à câmera ou para longe dela. Os modelos de profundidade MiDaS v2.1 (o small, cerca de 64 MB, é o padrão; o large, cerca de 397 MB, é pensado para GPU) estimam a profundidade relativa em 1 a cada 2 quadros amostrados, com média sobre os pixels em movimento na região. Isso vira mais um sinal candidato de posição. Se o modelo levar mais de 3 segundos por quadro, a profundidade é desligada naquela execução. Estimativa de profundidade em detalhes.

Testemunhas em segundo plano: vetores de movimento e áudio

Numa thread em segundo plano, o app lê os vetores de movimento comprimido do próprio vídeo e um envelope de volume de 50 Hz da trilha sonora, cada um dentro de um orçamento de tempo, então em filmes longos eles podem cobrir só uma parte. Eles ajudam a decidir quais trechos merecem um olhar mais atento, e o áudio mantém o movimento preenchido nas lacunas no ritmo da batida.

Rotulando o movimento: o classificador de tipo de movimento

A linha do tempo é cortada em janelas de 2 segundos. Cada janela é descrita por seis características de movimento e classificada num de quatro tipos gerais de cena por um pequeno modelo de regressão logística que treina enquanto você usa o app. Evidências da geometria dos pontos-chave de pose e da posição do rosto, ativadas por padrão, podem anular ou ajustar a decisão dele. Uma passada de Viterbi então suaviza os rótulos entre janelas vizinhas, para que o tipo não fique oscilando.

O rótulo decide como o movimento daquela janela é moldado. Cada tipo tem um perfil de modelagem, que começa neutro e só muda o resultado depois que você o ensina com suas edições.

Seus rótulos sempre prevalecem. Um rótulo definido por você que cubra pelo menos metade de uma janela substitui a resposta do classificador para aquela janela, e a passada de suavização deixa as janelas ensinadas como estão.

Fundindo tudo numa curva

O fluxo diz a que velocidade as coisas se movem; os outros sinais dizem onde elas estão. O motor integra a velocidade do fluxo num traçado de posição e o funde com uma âncora num filtro de Kalman com um suavizador Rauch-Tung-Striebel (RTS), que percorre o vídeo inteiro para a frente e depois para trás, para que cada ponto se beneficie do que veio depois dele.

A âncora é escolhida por vídeo. O centro da região, a pose e a profundidade competem entre si, e o sinal de pose só pode vencer se cobrir pelo menos um quarto do vídeo e tiver pontuação boa o suficiente. Por padrão, o vencedor é então substituído por uma mistura de todos os sinais legíveis, amostra por amostra, mas só se a mistura pontuar pelo menos tão bem. As pontuações dessa disputa são gravadas nos metadados do script, onde o Report Studio pode fazer gráficos delas.

Onde o rastreamento falha, a lacuna é preenchida com movimento rítmico que continua a partir dos movimentos ao redor, e a parcela da linha do tempo preenchida em vez de medida é registrada. Os pontos são então colocados a cada mudança de direção, com o tamanho do movimento seguindo a velocidade na tela pela curva de intensidade (Smoothed por padrão).

Como ele aprende

Com suas edições
Quando você salva um script gerado pela IA que editou (Ctrl+S ou Save As), o app aprende uma escala de profundidade do movimento e um deslocamento de posição para cada tipo de movimento a partir das janelas que você alterou.
Com seus rótulos
O Teach class num trecho selecionado da linha do tempo o rotula. Seu rótulo substitui a resposta do classificador para essas janelas.
Entre vídeos (aprendizado de corpus)
Ativado por padrão. Cada geração com IA pode guardar até 40 exemplos daquele vídeo, e execuções posteriores os usam para retomar o rastreamento. Então o resultado depende em parte do que você já analisou antes.
Dentro de uma execução (autoaprendizado)
Ativado por padrão no modo automático: o motor também ensina a si mesmo durante cada execução.
AI Bulk Learn
No menu File. Ele examina uma pasta sem criar scripts, amostra janelas curtas (por padrão 30 janelas de 4 segundos por vídeo) e coloca na fila as que o classificador não consegue decidir, para você rotular com o teclado. O Check my labels sinaliza rótulos que parecem errados diante das evidências de movimento, e o ensino usa só rótulos humanos.

Gerar de novo o mesmo vídeo com as mesmas configurações de análise reaproveita a análise de movimento feita antes na sessão (os três últimos vídeos, em memória), e aí só rerrotula e remonta o script, então tentar de novo depois de ensinar é quase instantâneo.

Onde ele roda

No seu PC. Os modelos de pose e profundidade rodam pelo ONNX Runtime ou PyTorch, numa placa de vídeo NVIDIA via CUDA quando houver uma, senão na CPU. Se você pedir a GPU e ela não puder ser usada, eles recorrem à CPU e o app informa qual está realmente em uso; o botão Check GPU diz se a análise está na placa de vídeo. O fluxo óptico sempre roda na CPU. Não há aceleração AMD ou Intel para os modelos de IA, e o TensorRT não é usado.

Por padrão, o app desliga um recurso de ajuste automático da GPU para que os modelos deem os mesmos números de uma execução para outra, com algum custo de velocidade. Os scripts ainda podem variar entre execuções porque o app continua aprendendo. GPU, CPU e instalação no Windows cobre os requisitos.

O que a IA ainda erra

O desenvolvedor compara o motor com scripts escritos à mão. Num pequeno conjunto de clipes, essa comparação mostra onde ele deixa a desejar. É uma verificação interna, não um benchmark, então não damos nenhuma pontuação a partir dela.

  • Mudanças de direção perdidas. Algumas inversões que uma pessoa roteiriza não estão no resultado da IA, em todos os filmes testados.
  • Movimentos pequenos demais em cenas rápidas. O tamanho do movimento fica mais ou menos certo em filmes mais lentos e pequeno demais nos rápidos. Menos quadros amostrados pioram isso.
  • Movimento onde não há nenhum. Dentro da ação, o motor muitas vezes continua produzindo movimentos em trechos que uma pessoa deixaria parados. Existe um filtro que seguraria esses trechos, mas ele fica desligado por padrão.
  • Erros de tipo de cena. As decisões do classificador têm precisão limitada. Rotule as janelas que ele erra; seus rótulos se sobrepõem a ele.
  • Preenchido, não medido. Onde o rastreamento se perde, a curva é preenchida com ritmo em vez de lida do vídeo. O relatório de qualidade mostra quanto.

Não publicamos um número de tempo ou de precisão porque nenhum foi medido ainda contra scripts independentes feitos à mão numa escala que possamos defender. A página de benchmarks explica o que foi e o que não foi medido.

Perguntas

A IA envia meus vídeos para um servidor para processá-los?

Não. Todos os modelos rodam no seu PC e o código de análise não faz chamadas de rede. A internet é usada para baixar modelos, verificar atualizações, licenciamento e a nuvem do Autoblow AI Ultra, que recebe o script, mas nunca o vídeo.

Quais modelos são baixados?

Por padrão, o YOLOv8 small-pose e o MiDaS small, cerca de 109 MB juntos. O botão Download best no app oferece modelos de pose maiores (até o YOLOv8 large, cerca de 168 MB) e recomenda um adequado a uma GPU ou CPU.

Posso desligar a IA?

Desmarcar "Use adaptive AI engine" faz o botão Generate usar um motor básico que segue o principal movimento vertical com fluxo óptico Farneback em quadros de resolução completa. A caixa volta a ficar marcada a cada inicialização, e o Batch Generate Folder e o Generate + Play sempre usam o motor de IA.

Ele fica melhor quanto mais eu uso?

Ele muda com o uso: seus rótulos, edições salvas e os exemplos que guarda de vídeos anteriores alimentam as execuções seguintes. Não medimos o quanto isso melhora os resultados, então não afirmamos nenhum número.

Leia a seguir

Veja a IA trabalhar nos seus próprios vídeos

O teste grátis libera todos os recursos por um dia; uma licença custa £14.99 uma vez e não está presa a uma versão.