太长不看:Subtitle Edit 最近新增了 Video OCRVideo → OCR burned-in subtitle…),这个免费开源的字幕编辑器现在也能从视频里提取烧录字幕了 — 是个实用的补充。差别在底层。Subtitle Edit 要你框选一个扫描矩形,再用一个通用 OCR 引擎逐帧识别(macOS 上用 Apple Vision;Windows/Linux 上用 Paddle OCR;或 GLM-OCR、PaddleOCR-VL 这类需下载的视觉模型)。GeekLink 则是自动识别出真正的字幕行,再用为字幕文字精调的模型去识别 — 因此快得多、也更不容易漏行 — 而且它开箱即用,无需你下载或安装任何 OCR 引擎或模型。如果你本来就在 Subtitle Edit 里干活、想在编辑器内做免费 OCR,它的 Video OCR 是个不错的选择。如果你要的是最快、最省事的烧录字幕提取,那正是 GeekLink 更强的地方。

想提取烧录字幕、又不想装任何东西?GeekLink 自动找出字幕行,并在你的电脑本地运行 OCR — 不用挑引擎,也不用下模型。有免费额度,无需注册。

Download Free

Subtitle Edit 的 Video OCR 是什么?

Subtitle Edit 是一款历史悠久、免费开源的字幕编辑器,最近新增了 Video OCR 功能,可以把视频里的烧录(硬)字幕提取成可编辑的文本行。你打开 Video → OCR burned-in subtitle…,找到一帧有字幕的画面,把扫描矩形调整到字幕所在的位置(默认是画面下三分之一),选择 OCR 引擎和语言,可选地测试当前帧,然后点击 Start OCR。识别出的行会出现在一个列表里,可以就地编辑。对于本来就用它做时间轴和校对的人来说,内置 OCR 确实很方便。

对这场对比来说,关键在于它怎么识别文字。Subtitle Edit 把这活交给一个通用 OCR 引擎,而按它自己的文档,可选项取决于你的平台:

  • Apple Vision — 仅 macOS;本地、快速、无需下载。
  • Paddle OCR — Windows 和 Linux;本地运行,自动下载。
  • llama.cpp 视觉模型 — GLM-OCR 0.9B、PaddleOCR-VL 1.6(109 种语言)、HunyuanOCR、LightOnOCR;跨平台,引擎和模型自动下载。
  • CrispEmbedOllama 视觉方案 — 另外两条本地视觉模型路径(Ollama 需单独安装),外加一个云端 GLM API 选项。

这些都是能力不错的通用识别器 — 尤其是视觉模型选项,纯字符识别很强,语言覆盖也广。但它们只是对着一个矩形、在抽样的帧上运行;那些字幕特有的活 — 判断哪些行才是真字幕、忽略台标和画面杂物、别在每一帧上重复识别同一条字幕 — 就都留给了你,以及你框得好不好。

GeekLink vs Subtitle Edit Video OCR:两者怎么比?

两者都能把烧录文字读成可编辑的字幕。差距在于 GeekLink 专为字幕打造的四点:自动字幕行识别、为字幕精调的识别、速度,以及零模型安装。

能力 GeekLink Subtitle Edit Video OCR
烧录字幕 OCR → 可编辑字幕 是 — 核心功能 是 — 较新的内置功能
找出字幕行 自动字幕行识别 — 每一行都能找到,包括双行字幕里出现较少的顶行 你框选一个扫描矩形;通用引擎对框内的帧做 OCR
识别模型 为屏幕字幕文字专门精调的模型 通用引擎(Apple Vision / Paddle OCR / 视觉大模型)
模型下载 / 安装 无 — 开箱即用,模型已为你准备好 取决于引擎 — Paddle OCR 和视觉模型需下载(有些很大);Ollama 需单独安装;Apple Vision 无需下载
速度 在 16 GB 内存的 Apple M4 Mac、默认设置下,一段 30 分钟的 1080p 英文字幕视频约 3 分钟(约 10× 实时速度) 因引擎差异很大;Apple Vision 较快,而准确的视觉模型引擎逐帧都很重(没有高性能 GPU 会更慢)
忽略台标、水印、画面文字 字幕行以外的内容自动过滤 凡是落在扫描框里的都会被 OCR;要排除就得重新框选
平台 Mac 和 Windows 桌面应用 Windows / Linux / macOS(各系统可用引擎不同)
价格 OCR 有免费额度;另有付费方案 — 最新价格详见主页 免费、开源

它替你找出字幕行

最大的区别是:GeekLink 把提取当成一个字幕问题,而不是一块像素矩形的问题。Subtitle Edit 的 Video OCR 要你先摆好扫描框,然后在每一抽样帧上识别框里出现的任何文字。这能用,但把判断都压在了你身上:框稍微紧一点,双行字幕里出现较少的行就可能被框在外面;框松一点,频道台标、水印或画面图形又会被当成字幕读进来。

GeekLink 会先识别出真正的字幕行 — 在识别文字之前 — 并且刻意设计成宁可多检、也不漏检(多出来的行一键就能删;从没被捕捉到的行则是无声的损失)。它会保住那些固定框选容易丢掉的低频行,同时让识别避开台标和杂物。你不用为了防这些情况去调框;识别本身就替你处理了。

它用为字幕精调的模型来识别

GeekLink 的识别是专门针对屏幕字幕文字精调的 — 那种带样式、带描边、有时还很小、压在动态画面上的文字 — 而不是把通用文档 OCR 或通用视觉模型套到一帧视频上。真实字幕上的准确率正来自这种精调:花式字幕上的乱码更少,密集的中日韩文字结果也更稳。

Subtitle Edit 的引擎在设计上就是通用的。Apple Vision 快、无需下载,但它是通用的系统 OCR,遇到花式或小号的中日韩字幕会吃力。视觉模型引擎(GLM-OCR、PaddleOCR-VL 等)确实是很强的识别器、语言覆盖也广 — 但它们是你对着一帧运行的通用模型,而非字幕专用的流水线,而且如下所述,它们属于又重、又要先下载的那类。

它快得多

在 16 GB 内存的 Apple M4 Mac、默认设置下,GeekLink 约 3 分钟就能提取完一段 30 分钟、带英文烧录字幕的 1080p 视频 — 大约 10× 实时速度。其中一部分原因是不做重复功:一条字幕会连续停留很多帧,所以对每一抽样帧都独立识别,等于把同一次读取一遍遍重复。GeekLink 会把同一条字幕的证据合并起来,并跳过画面没变化的帧,于是那些昂贵的识别运行的次数少得多。

Subtitle Edit 没有公布吞吐数字,说实话也很因引擎而异。Apple Vision 很快。但那些准确的选项 — llama.cpp 视觉模型、CrispEmbed、Ollama — 都是逐帧运行的重型视觉大模型,会很慢,尤其在没有高性能 GPU 时。所以在 Subtitle Edit 上,你往往在选引擎那一步就得在速度和准确率之间取舍;GeekLink 想做到的是,让你同时拥有精调准确率这条路和快速这条路。

无需下载或安装任何东西

GeekLink 开箱即用。开始前不用选 OCR 引擎,也不用先下模型:打开应用,指向视频,就能开跑。识别模型已经为你准备好了。

用 Subtitle Edit 的 Video OCR 时,模型安装取决于你选的引擎。Paddle OCR 在 Windows 和 Linux 上自动下载;视觉模型引擎要下一个引擎外加一个模型(有些很大);Ollama 得你自己单独安装管理。在 macOS 上,Apple Vision 是唯一无需下载的路径 — 但它也是最通用的识别器,所以遇到更难、更花、或中日韩字幕,你又会被推向那些要先下载的视觉模型去把质量提上来。GeekLink 干脆没有这个岔路:一条路、已精调、无需下载。

什么时候 Subtitle Edit 更合适?

很多时候都合适。Subtitle Edit 是一款出色的免费开源字幕编辑器,它的 OCR 是实打实的加分项:

你本来就在 Subtitle Edit 里编辑。如果你的字幕就在 Subtitle Edit 里做时间轴和校对,那在同一个窗口里做 OCR — 再就地编辑识别出的行 — 既方便又不花钱。

你就是要免费且开源,没别的。Subtitle Edit 免费又开放。如果价格和开源比速度、比省心安装更重要,它是个很好的答案。

你想指定某个特定的 OCR 引擎。Subtitle Edit 让你在多个引擎间选择,如果你有理由偏好某个视觉模型(或云端引擎),也能换上。

两者也不是非此即彼:一种常见做法是先在 GeekLink 里快速、省心地提取,再把结果拿进 Subtitle Edit 做细致的时间轴。工具不同,各有所长。

常见问题

Subtitle Edit 有针对烧录字幕的 OCR 吗?

有。Subtitle Edit 最近新增了 Video OCR 功能(Video → OCR burned-in subtitle…),能把视频里的硬字幕提取成可编辑的行。你框选一个扫描矩形,选好 OCR 引擎和语言,然后开始 OCR。GeekLink 做的是同一件事,但它自动识别字幕行、并使用为字幕精调的模型,所以既不用调框,也不用下载引擎或模型。

OCR 谁更快,GeekLink 还是 Subtitle Edit?

这取决于 Subtitle Edit 用的引擎。Apple Vision 快;更准确的视觉模型引擎(llama.cpp 搭配 GLM-OCR 或 PaddleOCR-VL、CrispEmbed、Ollama)逐帧都很重,没有高性能 GPU 会很慢。GeekLink 在 16 GB 内存的 Apple M4 Mac 上约 3 分钟提取完一段 30 分钟的 1080p 英文字幕视频(约 10x 实时速度),部分原因是它会合并重复帧、跳过没变化的帧,而不是把每一帧都重读一遍。

用 Subtitle Edit 的 Video OCR 需要下载模型吗?

大多数引擎都需要。Paddle OCR 在 Windows 和 Linux 上自动下载,视觉模型引擎要下一个引擎外加一个模型(有些很大);Ollama 需单独安装。在 macOS 上,Apple Vision 无需下载,但它是通用识别器。GeekLink 自带已准备好的识别模型,所以开始前既不用选、也不用下。

为什么 GeekLink 漏的字幕行更少?

Subtitle Edit 会对你框选的扫描矩形里出现的任何文字做 OCR,所以框稍紧就可能丢掉双行字幕里出现较少的顶行,框松了又会把台标或画面文字读进来。GeekLink 自动识别字幕行,并且设计成宁可多检、也不漏检 — 多余的行一键删掉,但没有一行会被无声丢掉 — 同时让识别避开水印和杂物。

Subtitle Edit 的 Video OCR 准吗?

可以很准,尤其是视觉模型引擎,它们是覆盖多语言的强通用识别器。代价是:快的那个(Apple Vision)是通用 OCR,遇到花式或小号中日韩字幕会吃力;而准的那些是逐帧运行的重型下载项。GeekLink 用的是专门针对屏幕字幕文字精调的模型,目标是在不牺牲速度和安装便利的前提下拿到那种准确率。

两个能一起用吗?

能。一种常见做法是:先在 GeekLink 里无需安装地快速提取烧录字幕,再把结果在 Subtitle Edit 里打开做细致的时间轴和校对。两者互补 — GeekLink 负责快速、省心的提取;Subtitle Edit 提供免费、深度的编辑环境。

相关文章