AutoScript Sync の中の AI
AI ファンスクリプトは、いくつもの部品が連携して生まれ、そのすべてがあなたの PC 上で動きます。モーションのヒートマップがアクションの場所を見つけ、オプティカルフローがその動き方を計測し、オプションの姿勢推定モデルと深度モデルが体のキーポイントと近づく/遠ざかる動きの読み取りを加え、小さな分類器が 2 秒ごとの区間を動きの種類でラベル付けし、スムーザーがそのすべてを 1 本の位置カーブに統合します。AI はあなたのラベルと編集から学習し、あなたが付けたラベルは常に AI 自身の推測より優先されます。
2026 年 9 月 21 日にアプリのコードと照合済み。現行リリースのバージョン 2.121.1 について説明しています。
各部品の役割
サンプリングした各フレームは、まず幅 320 px に縮小されます(VR 映像は先に片目の平面映像に補正されます)。領域の検出、フロー、姿勢推定、深度はすべてこの小さなフレームで処理されます。
アクションを見つける:モーション顕著性ヒートマップ
あなたが領域を指定していない場合、エンジンは動きが起きている場所のヒートマップを保持し、古い動きは徐々に薄れさせながら、最も動きの多い連続した領域を選んで 15% 広げます。計測されるのはその領域です。1 つのボックス(Set Motion Region…)か、動画の再生中にドラッグして動かすボックス(Live Track)で上書きできます。アプリは、あなたのボックスがどの体のキーポイントを追っているかも記録し、新しい動画で領域を提案できるようにします。
動きを計測する:DIS オプティカルフロー
オプティカルフローは、2 つのフレーム間ですべてのピクセルがどう動いたかを推定します。デフォルトのエンジンは OpenCV の DIS 密オプティカルフローを使い、さらにフローが信頼できるかを確かめる、より高速な半分の解像度のパスを加えます。High では、幅 640 px 以上の平面動画について、トラッキング領域を 640 px でも計測します。どちらも CPU で動作します。位置の軌跡は、このフローの速度を積分して作られます。オプティカルフローの詳細。
人物を追う:YOLOv8-pose と人物トラッカー
姿勢推定モデルがインストールされていれば(デフォルトでダウンロードされるのは約 45 MB の YOLOv8 small-pose)、信頼度 0.35 を超える各人物を 17 個の体のキーポイントとともに検出します。トラッカーはボックスの位置と大きさでフレーム間の人物を対応づけ、体の部位のペアから動き信号の候補を作り、各シーンで最もリズムがはっきりしたものを残します。姿勢推定はオプションです:なければエンジンはフローだけで動作し、Inference のステータス行にそう表示します。姿勢推定の詳細。
近づく/遠ざかる動きを見る:MiDaS 深度推定
平面のオプティカルフローでは、カメラに近づく/遠ざかる動きは見えません。MiDaS v2.1 の深度モデル(デフォルトは約 64 MB の small、約 397 MB の large は GPU 向け)が、サンプリングしたフレームの 2 枚に 1 枚について相対的な深度を推定し、領域内の動いているピクセルで平均します。これがもう 1 つの位置信号の候補になります。モデルの処理に 1 フレームあたり 3 秒を超える場合、その実行では深度推定がオフになります。深度推定の詳細。
バックグラウンドの補助情報:モーションベクトルと音声
バックグラウンドのスレッドで、アプリは動画自体の圧縮モーションベクトルと、サウンドトラックの 50 Hz の音量エンベロープを、それぞれ時間の予算内で読み取ります。そのため長い動画では一部しか対象にならないことがあります。これらはどの区間を詳しく見るべきかの判断に役立ち、音声は補完された動きをビートに合わせるのに使われます。
動きをラベル付けする:動きの種類の分類器
タイムラインは 2 秒ごとの区間に分けられます。各区間は 6 つの動きの特徴量で表され、アプリを使うにつれて学習する小さなロジスティック回帰モデルによって、4 つの大まかなシーンの種類のいずれかに分類されます。デフォルトでオンになっている、姿勢のキーポイントの配置と顔の位置からの証拠によって、その判定が上書きまたは調整されることがあります。その後 Viterbi のパスが隣り合う区間のラベルをならし、種類が行ったり来たりしないようにします。
ラベルによって、その区間の動きの形が決まります。種類ごとに整形プロファイルがあり、最初はニュートラルで、あなたが編集を通じて教えて初めて出力が変わります。
あなたのラベルが常に優先されます。 あなたが付けたラベルが区間の半分以上をカバーしていれば、その区間の分類器の答えを置き換え、ならしのパスも教えられた区間には手を付けません。
1 本のカーブに統合する
フローはどれだけ速く動いているかを示し、他の信号は物がどこにあるかを示します。エンジンはフローの速度を積分して位置の軌跡にし、カルマンフィルターと Rauch-Tung-Striebel(RTS)スムーザーでアンカーと統合します。スムーザーは動画全体を前向きに、次に後ろ向きに処理するため、各ポイントはその後に起きたことも反映できます。
アンカーは動画ごとに選ばれます。領域の中心、姿勢推定、深度がそれぞれ競い、姿勢推定の信号が勝てるのは、動画の 4 分の 1 以上をカバーし、十分なスコアを出した場合だけです。デフォルトでは、勝者はその後、読み取れるすべての信号をサンプルごとにブレンドしたものに置き換えられますが、それはブレンドのスコアが同等以上の場合に限ります。この競争のスコアはスクリプトのメタデータに書き込まれ、Report Studio でグラフにできます。
トラッキングが途切れた部分は、周囲のストロークから引き継いだリズミカルな動きで埋められ、タイムラインのうち計測ではなく補完した割合が記録されます。その後、方向が変わるたびにポイントが配置され、ストロークの大きさは強さのカーブ(デフォルトは Smoothed)を通して画面上の速さに従います。
学習の仕組み
- あなたの編集から
- AI が生成したスクリプトを編集して保存すると(Ctrl+S または Save As)、アプリはあなたが変更した区間から、動きの種類ごとのストロークの深さのスケールと位置のオフセットを学習します。
- あなたのラベルから
- タイムラインで選択した区間に Teach class を使うと、その区間にラベルが付きます。あなたのラベルは、それらの区間の分類器の答えを置き換えます。
- 動画をまたいで(コーパス学習)
- デフォルトでオン。AI による生成のたびに、その動画から最大 40 個の例を保持でき、後の実行ではそれを使ってトラッキングを捉え直します。そのため、出力はそれまでに解析した内容にも一部左右されます。
- 実行中に(自己学習)
- 自動モードではデフォルトでオン:エンジンは各実行中に自分自身でも学習します。
- AI Bulk Learn
- File メニューにあります。スクリプトを作らずにフォルダーをスキャンし、短い区間をサンプリングして(デフォルトでは動画 1 本につき 4 秒の区間を 30 個)、分類器が判断できないものをキーボードでラベル付けできるよう順番に並べます。Check my labels は動きの証拠と照らして間違っていそうなラベルに印を付け、学習には人が付けたラベルだけを使います。
同じ動画を同じ解析設定で再生成すると、そのセッションで先に行ったモーション解析(メモリ上の直近 3 本の動画分)を再利用し、ラベル付けとスクリプトの再構築だけを行うため、教えた後にやり直すのはほぼ一瞬です。
どこで動くか
あなたの PC 上です。姿勢推定モデルと深度モデルは ONNX Runtime または PyTorch で動作し、NVIDIA のグラフィックカードがあれば CUDA で、なければ CPU で動きます。GPU を指定しても使えない場合は CPU にフォールバックし、実際にどちらを使っているかをアプリが表示します。Check GPU ボタンで、解析がグラフィックカードで行われているかを確認できます。オプティカルフローは常に CPU で動作します。AI モデルに AMD や Intel のアクセラレーションはなく、TensorRT も使っていません。
デフォルトでは、モデルが実行のたびに同じ数値を出すよう、GPU の自動チューニング機能をオフにしています(その分、速度は多少落ちます)。それでも、アプリは学習し続けるため、実行ごとにスクリプトが異なることはあります。動作要件は GPU、CPU と Windows へのインストールで説明しています。
AI がまだ間違えること
開発者は、エンジンを手作業で書かれたスクリプトと比較しています。少数のクリップでのこの比較から、足りない点がわかります。これは内部のチェックでありベンチマークではないため、そこからのスコアは示していません。
- 方向転換の取りこぼし。 人がスクリプトに書く折り返しの一部が、テストしたすべての動画で AI の出力に含まれていません。
- 速いシーンでストロークが小さすぎる。 ゆっくりした動画ではストロークの大きさはほぼ適切ですが、速い動画では小さすぎます。サンプリングするフレームが少ないほど悪化します。
- 動きがないところに動きが出る。 アクションの中では、人なら止めておく区間でも、エンジンがストロークを生成し続けることがよくあります。そうした区間を止めておく仕組みはありますが、デフォルトではオフです。
- シーンの種類の間違い。 分類器の判定の精度には限りがあります。間違っている区間にラベルを付けてください。あなたのラベルが優先されます。
- 計測ではなく補完。 トラッキングが失われた部分では、カーブは動画から読み取るのではなくリズムで補完されます。その量は品質レポートに表示されます。
処理時間や精度の数値を公表していないのは、私たちが責任を持てる規模で、独立した手作りのスクリプトと比較して計測したものがまだないからです。何を計測済みで何を計測していないかは ベンチマークのページにまとめています。
よくある質問
AI は処理のために動画をサーバーに送りますか?
いいえ。すべてのモデルはあなたの PC 上で動き、解析コードはネットワーク呼び出しを一切行いません。インターネットを使うのは、モデルのダウンロード、アップデートの確認、ライセンス、そして Autoblow AI Ultra のクラウドです(クラウドが受け取るのはスクリプトで、動画は決して送られません)。
どのモデルがダウンロードされますか?
デフォルトでは YOLOv8 small-pose と MiDaS small で、合わせて約 109 MB です。アプリ内の Download best ボタンでは、より大きな姿勢推定モデル(最大で約 168 MB の YOLOv8 large)を選べ、GPU または CPU に合ったものを推奨します。
AI をオフにできますか?
「Use adaptive AI engine」のチェックを外すと、Generate ボタンは、フル解像度のフレームで Farneback オプティカルフローを使って主な縦方向の動きを追う基本エンジンに切り替わります。このチェックボックスは起動のたびにオンに戻り、Batch Generate Folder と Generate + Play は常に AI エンジンを使います。
使うほど良くなりますか?
使うにつれて変化します:あなたのラベル、保存した編集、以前の動画から保持した例のすべてが、後の実行に反映されます。それで結果がどれだけ改善するかは計測していないため、数値は示していません。
次に読む
- 技術のセクション姿勢推定、フロー、深度、ドリフト補正の技術的な詳細。
- 動画からスクリプトまで、順を追ってファイルに何が起きるか、結果がどこに保存されるか。
- AutoScript Sync のファンスクリプト生成ツールできること、使い方、デバイス、価格と体験版。
- トップページのモデルガイド姿勢推定と深度の各段階を並べて比較。
自分の動画で AI の働きを見る
無料体験版では 1 日間すべての機能が使えます。ライセンスは £14.99 の一回払いで、バージョンに縛られません。