깊이 추정: 평면 영상이 숨기는 축

영상은 평면이므로 카메라 쪽으로 곧장 다가오거나 멀어지는 움직임은 화면에서 거의 움직임으로 보이지 않습니다. funscript를 위한 깊이 추정이 그 빈틈을 메웁니다: AutoScript Sync는 PC에서 MiDaS 모델을 실행해 프레임의 각 부분이 얼마나 가까운지 추정하고, 움직이는 영역에서 그 값이 어떻게 변하는지 따라갑니다. 결과는 또 하나의 후보 위치 신호입니다. 깊이 추정은 선택 사항이며, 스크립트는 여전히 옵티컬 플로우를 바탕으로 만들어집니다.

2026년 9월 21일에 앱의 코드와 대조해 확인했습니다.

깊이가 중요한 이유

옵티컬 플로우는 사물이 화면을 가로질러 위, 아래, 왼쪽, 오른쪽으로 어떻게 움직이는지 측정합니다. POV 영상처럼 스트로크가 카메라의 시선 방향으로 움직이면, 움직이는 물체는 화면을 가로지르기보다 주로 커졌다 작아졌다 합니다. 플로우는 그런 움직임을 거의 보지 못합니다. 깊이 모델은 같은 프레임을 가까움과 멂으로 읽으므로, 그 축을 따라가는 스트로크가 대신 깊이 변화로 나타납니다.

Across-the-frame motion versus motion toward the camera Left: a stroke across the frame moves a long way on screen, which optical flow measures. Right: a stroke toward the camera barely moves on screen but changes depth, which the depth model measures. Across the frame Toward the camera Large on-screen shift: flow reads it Grows, barely moves: depth reads it Dashed: position at the start of a stroke. Teal: position at the end.
같은 길이의 스트로크라도 카메라에 대해 어느 방향으로 움직이느냐에 따라 화면에서 긴 움직임이 될 수도, 거의 움직이지 않는 것처럼 보일 수도 있습니다.

사용하는 MiDaS 모델

AutoScript Sync는 ONNX 형식의 MiDaS v2.1 깊이 모델을 사용합니다. 이 모델은 센티미터 단위의 거리가 아니라 한 화면 안에서 더 가깝고 더 먼 상대 깊이를 줍니다.

MiDaS 깊이 모델과 각 모델이 사용되는 경우
모델크기사용되는 경우
MiDaS small약 64 MBFast와 Balanced, 그리고 CPU에서는 모든 단계. 기본 다운로드.
MiDaS large~397 MBHigh, CUDA GPU에서만, 내려받은 경우. GPU를 권장합니다.

이 선택은 기본적으로 켜져 있는 Auto-pick model tier from Accuracy가 하며, 이미 설치된 모델만 고를 수 있습니다. 엔진은 지정해 주는 상대 깊이 ONNX 모델이라면 무엇이든 받아들이지만, 앱이 다운로드를 제공하는 것은 MiDaS뿐입니다.

깊이가 신호가 되는 과정

깊이는 샘플링된 프레임 두 개 중 하나마다, 가로 320 px 분석 이미지에서 추론되며, 추적 영역 안에서 실제로 움직이는 픽셀에 대해 평균을 냅니다. 그 결과는 영역 중심, 자세 키포인트와 함께 위치 궤적의 앵커 후보가 됩니다. 깊이 모델이 프레임당 3초 넘게 걸리면, 느린 모델 하나가 작업 전체를 붙잡지 않도록 엔진은 그 실행의 나머지 동안 깊이 추정을 끕니다.

프레임마다가 아니라 영상마다 하나의 깊이 스케일

깊이 모델의 출력에는 고정된 단위가 없습니다: 프레임마다 제각각의 스케일로 나옵니다. 각 프레임을 따로 정규화하면 스케일 자체가 프레임마다 바뀌고, 그 변화가 움직임처럼 보입니다. 대신 AutoScript Sync는 깊이 측정값의 강건한 백분위수로 영상 전체에 하나의 스케일을 정하므로, 수치의 변화가 곧 장면의 변화를 뜻하게 됩니다.

프레임별 대 영상별 깊이 스케일링, 한 영상의 150프레임에서 측정
측정 항목프레임별 스케일링영상별 스케일링
깊이 변화의 프레임 간 상관관계0.5940.963
잘못된 방향 반전이 생긴 단계42%2%

이것은 개발자가 2026년 9월 10일에 모델의 원시 출력을 대상으로 측정한 좁은 범위의 엔지니어링 측정입니다. 영상별 스케일링이 깊이 신호의 자기모순을 막는다는 것을 보여 줄 뿐, 완성된 스크립트가 얼마나 정확한지를 측정한 것이 아닙니다.

깊이에 영향을 주는 설정

스트로크 설정에는 이름에 depth가 들어간 슬라이더가 두 개 있습니다. 분석을 바꾸는 것은 Depth priority뿐입니다. Depth emphasis는 기기로 보낼 때 스트로크 길이를 다듬으며 MiDaS 모델과는 관계가 없습니다. 둘 다 깊이 모델을 켜거나 끄지 않습니다. 그것은 깊이 모델이 설치되어 선택되어 있는지에 달려 있습니다.

Depth priority
30~90, 기본값 85. 위치 궤적 중 얼마만큼을 측정된 속도에서 가져오고 얼마만큼을 위치 앵커(깊이는 그 후보 중 하나)에서 가져올지 정합니다: 값이 높을수록 앵커의 가중치가 낮아집니다. 앱의 툴팁은 속도가 스트로크 크기를 담고 앵커는 드리프트를 막지만 깊이를 평평하게 만든다고 설명하며, 스크립트가 너무 분주하거나 지나치게 깊게 느껴지면 45–65로 낮추라고 권합니다. 분석을 바꾸는 설정이므로 다시 생성해야 합니다.
Depth emphasis
100%~200%, 기본값 100%(중립). 깊은 스트로크가 비례해서 더 멀리 움직입니다. 기기로 보내는 사본을 다듬는 설정이므로, 바꾼 뒤에는 스크립트를 다시 보내세요. 저장된 파일은 바뀌지 않습니다. 현재 출시된 앱에서는 이 기기용 조정이 Autoblow AI Ultra 업로드에 적용되며, Intiface 기기에 적용하는 것과 Export Script (as played)에 반영하는 것은 다음 업데이트에서 추가됩니다.

깊이 추정의 비용

깊이 추정은 NVIDIA GPU가 있으면 CUDA로 그 GPU에서, 없으면 CPU에서 실행되며, 앱은 실제로 무엇을 쓰고 있는지 보고합니다. RTX 5080 테스트 PC에서 남긴 코드 주석에 따르면 MiDaS small은 호출당 GPU에서 약 25.8 ms, CPU에서 234 ms가 걸립니다. 샘플링된 프레임마다가 아니라 두 개 중 하나마다 실행하므로 그 작업량이 절반으로 줄어듭니다. GPU에서는 깊이 모델의 CUDA 메모리 풀이 4 GB로 제한됩니다.

깊이 추정이 분석 전체에서 차지하는 비중은 공개하지 않았습니다. 현재의 추정치를 뒷받침하는 측정표가 없기 때문입니다. 측정된 항목은 벤치마크 페이지에 나와 있습니다.

한계

  • 절대값이 아닌 상대값. MiDaS는 더 가까운지 더 먼지를 알려 줄 뿐, 얼마나 먼지는 알려 주지 않습니다. 스트로크 크기는 여전히 깊이만이 아니라 융합된 궤적에서 나옵니다.
  • 움직이는 영역 전체의 평균. 깊이는 추적 영역 안의 모든 움직이는 픽셀에 대해 평균을 내므로, 그 안의 다른 움직임도 스트로크와 함께 평균에 섞입니다. Set Motion Region…이나 Live Track으로 영역을 직접 그리면 범위를 좁힐 수 있습니다.
  • 무거운 모델이 더 낫다는 증거는 없습니다. 스트로크 정확도에서 MiDaS small과 MiDaS large를 비교한 기록은 없습니다.
  • 스트로크 크기는 여전히 약점입니다. 개발자가 직접 스크립트를 쓴 테스트 클립과 비교했을 때, 가장 빠른 두 영상에서 엔진의 스트로크는 사람의 4분의 1과 2분의 1 크기였습니다. 절대 단위의 깊이 오차에 대한 공식 측정은 없습니다.

질문

깊이 모델이 필요한가요?

아니요. 깊이 모델이 없으면 엔진은 옵티컬 플로우, 영역 중심, 그리고 설치되어 있다면 자세로 작동합니다. 자동 다운로드를 끄지 않는 한 MiDaS small은 자동으로 내려받아집니다.

MiDaS large를 받아야 하나요?

NVIDIA GPU에서 High를 사용할 때만 해당됩니다. CPU나 다른 단계에서는 사용되지 않습니다. MiDaS small보다 더 나은 스크립트를 만드는지는 측정하지 않았습니다.

스크립트가 너무 깊거나 너무 분주하게 느껴집니다. 깊이 때문인가요?

속도와 앵커 사이의 균형 문제일 수 있습니다. Depth priority를 45~65 사이로 설정하고 다시 생성해 보세요. 기기에서 스트로크가 그저 너무 길게 느껴진다면, Depth emphasis는 100%가 중립입니다.

깊이 추정은 VR 영상에서도 작동하나요?

VR 영상은 먼저 한쪽 눈의 일반 원근 시점으로 왜곡을 풀고, 깊이 추정은 다른 영상과 마찬가지로 그 시점에서 실행됩니다. 레이아웃 감지는 몇 개의 샘플 프레임을 바탕으로 한 휴리스틱입니다.

다음 읽을거리

여러분의 영상으로 직접 사용해 보세요

체험판은 하루 동안 여러분의 PC에서 실행됩니다. 영상은 로컬에서 분석되며 절대 업로드되지 않습니다.