AutoScript Sync 内部的 AI

AI funscript 来自多个协同工作的部分,全部在你的电脑上运行。运动热图找出动作所在的位置,光流测量它如何运动,可选的姿态和深度模型提供身体关键点以及朝向或远离镜头的读数,一个小型分类器按动作类型标注每个 2 秒窗口,平滑器把这一切融合成一条位置曲线。它会从你的标签和编辑中学习,你设置的标签永远优先于它自己的猜测。

已于 2026 年 9 月 21 日对照应用代码核实。描述的是当前版本 2.121.1。

每个部分的作用

每个采样帧首先缩小到 320 px 宽(VR 视频会先展开为一只眼睛的平面视图)。区域查找、光流、姿态和深度都在这个小帧上工作。

找到动作:运动显著性热图

如果你没有指定区域,引擎会维护一张记录动作发生位置的热图,较早的动作会逐渐淡化,然后取最热的连通区域并向外扩展 15%。被测量的就是这个区域。你可以用一个框(Set Motion Region…)或在视频播放时拖动的移动框(Live Track)来覆盖它。应用还会记录你的框跟随的是哪个身体关键点,以便在新视频上推荐区域。

测量运动:DIS 光流

光流估算每个像素在两帧之间如何移动。默认引擎使用 OpenCV 的 DIS 稠密光流,外加一次更快的半分辨率计算,用来检查光流是否可信。在 High 下,对于宽度至少 640 px 的平面视频,它还会以 640 px 测量追踪区域。两者都在 CPU 上运行。位置轨迹就是由光流速度积分得到的。光流详解

跟随人物:YOLOv8-pose 与人物追踪器

如果安装了姿态模型(默认下载的是 YOLOv8 small-pose,约 45 MB),它会找出置信度高于 0.35 的每个人,每人 17 个身体关键点。追踪器按框的位置和大小在帧与帧之间匹配人物,从成对的身体区域构建候选运动信号,并在每个场景中保留节奏最清晰的那个。姿态是可选的:没有它时,引擎仅靠光流运行,并会在 Inference 状态行中注明。姿态估计详解

看见朝向与远离:MiDaS 深度

平面光流看不到朝向或远离镜头的运动。MiDaS v2.1 深度模型(默认为 small,约 64 MB;large 约 397 MB,适用于 GPU)每隔一个采样帧估算一次相对深度,并对区域内运动像素取平均。这会成为又一个候选位置信号。如果模型每帧耗时超过 3 秒,本次运行就会关闭深度。深度估计详解

后台辅助信号:运动矢量与音频

应用会在后台线程中读取视频自身的压缩运动矢量和音轨的 50 Hz 响度包络,每项都有时间预算,所以在长影片上它们可能只覆盖其中一部分。它们有助于判断哪些时段值得更仔细地查看,音频还能让填补的运动与节拍保持一致。

标注动作:动作类型分类器

时间轴被切分成 2 秒窗口。每个窗口由六个动作特征描述,并由一个小型逻辑回归模型归入四种粗略场景类型之一,该模型会在你使用应用的过程中训练。来自姿态关键点几何关系和面部位置的证据(默认开启)可以推翻或调整它的判断。随后一次 Viterbi 处理会在相邻窗口之间平滑标签,使类型不会来回跳变。

标签决定该窗口的动作如何塑形。每种类型都有一个塑形配置,初始为中性,只有在你通过编辑教过它之后才会改变输出。

你的标签永远优先。你设置的标签只要覆盖一个窗口的至少一半,就会替换分类器对该窗口的答案,平滑处理也不会改动教过的窗口。

融合成一条曲线

光流说明东西移动得多快;其他信号说明东西在哪里。引擎把光流速度积分为位置轨迹,并在带有 Rauch-Tung-Striebel (RTS) 平滑器的卡尔曼滤波器中与锚点融合,该平滑器先正向再反向遍历整个视频,让每个点都能利用其后的信息。

锚点按视频选择。区域中心、姿态和深度相互竞争,只有当姿态信号覆盖至少四分之一的视频且得分足够高时才能胜出。默认情况下,胜出者随后会被所有可读信号的逐样本混合所替代,但前提是混合的得分至少同样好。这场比较的得分会写入脚本的元数据,可以用 Report Studio 绘制图表。

在追踪中断的地方,会用延续周围行程的节奏性运动填补空缺,并记录时间轴中填补而非实测的比例。然后在每次方向变化处放置点,行程幅度随屏幕上的速度变化,并经过强度曲线(默认为 Smoothed)。

它如何学习

从你的编辑中
当你保存编辑过的 AI 生成脚本(Ctrl+S 或 Save As)时,应用会从你修改过的窗口中,为每种动作类型学习行程深度缩放和位置偏移。
从你的标签中
对时间轴上选中的时段使用 Teach class 为其标注。你的标签会替换分类器对这些窗口的答案。
跨视频(语料学习)
默认开启。每次 AI 生成最多可以保留该视频的 40 个范例,之后的运行会用它们重新找回追踪。因此输出部分取决于你之前分析过的内容。
单次运行内(自我学习)
在自动模式下默认开启:引擎在每次运行中也会自我学习。
AI Bulk Learn
位于 File 菜单中。它扫描一个文件夹但不生成脚本,采样短窗口(默认每个视频 30 个 4 秒窗口),并把分类器无法判断的窗口排入队列,供你用键盘标注。Check my labels 会标记那些与动作证据不符、看起来有误的标签,而教学只使用人工标签。

用相同的分析设置重新生成同一个视频时,会复用本次会话中之前的动作分析结果(内存中保留最近三个视频),然后只重新标注并重建脚本,所以教学后再试一次几乎是瞬间完成的。

在哪里运行

在你的电脑上。姿态和深度模型通过 ONNX Runtime 或 PyTorch 运行;有 NVIDIA 显卡时通过 CUDA 在显卡上运行,否则在 CPU 上运行。如果你要求使用 GPU 但无法使用,它们会退回到 CPU,并且应用会报告实际使用的是哪一个;Check GPU 按钮会告诉你分析是否在显卡上进行。光流始终在 CPU 上运行。AI 模型没有 AMD 或 Intel 加速,也不使用 TensorRT。

默认情况下,应用会关闭一项 GPU 自动调优功能,使模型每次运行给出相同的数值,代价是牺牲一些速度。由于应用会持续学习,不同运行之间的脚本仍可能不同。GPU、CPU 与在 Windows 上安装介绍了系统要求。

AI 仍然会出错的地方

开发者会把引擎与手工编写的脚本进行比较。在一小组片段上,这种比较显示出它的不足之处。这是内部检查,不是基准测试,所以我们不据此给出分数。

  • 漏掉方向变化。人工编写脚本时会有的一些换向,在 AI 的输出中没有出现,每部测试影片都是如此。
  • 快节奏场景中行程过小。在较慢的影片上行程幅度大致正确,在快节奏影片上则小得多。采样的帧越少,问题越严重。
  • 没有动作的地方出现运动。在动作范围内,引擎往往会在人工会让其静止的时段继续生成行程。有一个能让这些时段保持静止的门控机制,但默认是关闭的。
  • 场景类型判断错误。分类器判断的准确度有限。请标注它判断错误的窗口;你的标签会覆盖它的判断。
  • 填补的,而不是实测的。在追踪丢失的地方,曲线按节奏填补,而不是从视频中读取。质量报告会显示填补了多少。

我们不公布耗时或准确率数字,因为目前还没有以独立的手工制作脚本为基准、在我们敢于担保的规模上进行过测量。基准测试页面列出了哪些已经测量、哪些尚未测量。

常见问题

AI 会把我的视频发送到服务器处理吗?

不会。每个模型都在你的电脑上运行,分析代码不进行任何网络调用。互联网用于下载模型、检查更新、许可证,以及 Autoblow AI Ultra 的云端,它接收脚本,但从不接收视频。

会下载哪些模型?

默认下载 YOLOv8 small-pose 和 MiDaS small,合计约 109 MB。应用内的 Download best 按钮提供更大的姿态模型(最大到 YOLOv8 large,约 168 MB),并会推荐适合 GPU 或 CPU 的一个。

我可以关闭 AI 吗?

取消勾选 "Use adaptive AI engine" 后,Generate 按钮会改用一个基础引擎,它在全分辨率帧上用 Farneback 光流跟随主要的垂直运动。每次启动时该选项都会重新勾选,而且 Batch Generate Folder 和 Generate + Play 始终使用 AI 引擎。

用得越多,它会越好吗?

它会随使用而变化:你的标签、保存的编辑以及它从之前视频中保留的范例都会用于之后的运行。我们还没有测量这能把结果改善多少,所以不给出任何数字。

延伸阅读

看 AI 处理你自己的视频

免费试用会解锁所有功能一天;许可证一次付费 £14.99,且不绑定版本。