TL;DR:硬字幕(烧录字幕)是画面的一部分,想拿回可编辑的文字只能靠 OCR — 各工具真正的差别在于要折腾多少环境,以及拿到 SRT 之后还能做什么。在 Mac 或 Windows 上,GeekLink 是综合最佳的选择:自动找出字幕行,把 logo 和水印挡在外面,在本地逐行识别、不用配 Python 或显卡环境,还会把少数没把握的行标出来 — 拿到的 SRT 干净,几乎不用返工。需要翻译和烧录时,同一个 App 里也有。开源提取器(VSE、VideOCR、VideoSubFinder + RapidVideOCR)更适合 Linux 用户,以及有 NVIDIA 显卡、只需要一份原始 SRT 的技术用户。下面把全部 8 种方案(含 3 个 OCR 引擎)放进一张表里对比。
核心要点
- GeekLink 用最少的功夫给你最干净的 SRT。自动识别字幕行(不用手动框选)、过滤 logo 和水印、双行和双语字幕逐行用对应语言的模型识别、标出没把握的行 — 全程不需要 Python、conda 或 CUDA。
- 如果你要的不只是 SRT,只有 GeekLink 能接着往下做 — AI 翻译和烧录是同一个 App 里的可选步骤。
- 开源提取器面向技术用户。VSE 和 VideOCR 依赖 NVIDIA 显卡,纯 CPU 下很慢;VideOCR 和 VideoSubFinder 没有 Mac 版。
- VideoSubFinder 自己不做 OCR。文字识别要靠第二个程序(RapidVideOCR 或 Subtitle Edit)— 两个软件,中间要倒腾一批批图片。
- PaddleOCR、Tesseract 和 Google Lens 是引擎,不是工具。它们只读单张图片;找字幕帧、生成时间轴、去重,是字幕工具在引擎之上补的那一层。
想要一体化桌面流程?GeekLink 可在 Mac 和 Windows 上本地提取烧录字幕 — 框选区域、运行 OCR、得到带时间轴的 SRT。免费档,无需账号。
免费下载第一部分:专用字幕提取工具
这五款是专门为从视频中提取硬字幕(烧录字幕)而打造的。它们主要在平台、工作流需要几步、以及拿到 SRT 之后会发生什么这几点上有区别。
1. GeekLink — 综合最佳:提取最干净、手动活最少(Mac 和 Windows)
价格:免费档(含 OCR 提取);Pro 每月 $12.99、每年 $99(约 $8.25/月),或一次性终身 $129
平台:Mac(Apple Silicon)和 64 位 Windows
在这份列表里,GeekLink 用最少的手动操作给你一份干净、能直接用的 SRT — 也是唯一有原生 Mac 应用的工具。导入视频后,GeekLink 会自动找出字幕行,不用手动框选,并把 logo、水印和画面里的其他文字挡在字幕列表之外。双行和双语字幕按行处理:你给每一行选语言,每行用对应的模型识别,所以同一帧里的中文行和英文行都能认对。OCR 在本地运行,编辑器会把少数最没把握的行标出来,你只需要检查几行,而不是逐条校对整份文件。遇到特殊版式自动识别不准时,也可以自己画字幕框。
对大多数人来说,到这一步就结束了:导出 SRT 即可。如果还需要更多,同一个 App 还能翻译(Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek — 结合上下文,支持 40+ 种语言),并把字幕烧录回视频。
亮点:
- 自动找出字幕行 — 不用手动框选 — 并把 logo、水印和画面文字挡在 SRT 之外
- 支持双行和混合语言字幕,每一行用对应的识别模型
- 标出没把握的行,你只需检查几行,而不是整份文件
- 原生 Mac 应用,另有 Windows 版 — 无需 Python、conda 或 NVIDIA 显卡;OCR 100% 在本地运行;内置批量处理
- 同一个 App 里的可选功能:AI 翻译和带样式的烧录
局限:
- 提供 Mac 和 Windows 桌面版;暂无 Linux 版本或网页版
- 闭源;AI 翻译是付费(Pro)功能 — 提取本身在免费档
最适合:想不折腾环境、从烧录字幕里拿到一份准确 SRT 的人,尤其是 Mac 用户。以后需要翻译或烧录时,功能也都在。分步指南:如何用 OCR 提取硬字幕。
2. Video-Subtitle-Extractor(VSE)— 针对 NVIDIA 显卡优化的开源提取器
价格:免费,开源(Apache 2.0)
平台:Windows、Linux、macOS(为 NVIDIA GPU 调优;CPU 回退很慢)
Video-Subtitle-Extractor 是一款常见的开源提取器,用本地 OCR 把烧录字幕提取成 SRT,支持多种语言。它逐帧检测字幕区域,对重复行去重,并提供 Fast/Auto/Precise 三种模式。在中文社区尤其强势。
亮点:
- 多语言,完全本地,无需 API key
- 可跨多个视频批量提取(同分辨率/同区域)
- 姊妹项目(video-subtitle-remover)可以抹掉旧的烧录字幕文字
局限:
- 偏向 NVIDIA/CUDA — 在 Mac 上会回退到很慢的 CPU 处理
- 如果发布版本对你不好使,就得走 Python/conda 配置;路径不能包含空格或非 ASCII 字符
- 没有内置编辑器、翻译或烧录
最适合:有 NVIDIA GPU、想要免费批量提取的技术型用户,尤其是中文内容。完整对比:GeekLink 对比 VSE。
3. VideOCR — Windows 和 Linux 上的免费一步式提取器
价格:免费,开源(MIT)
平台:Windows、Linux、Docker(CPU 与 NVIDIA GPU 版本)
VideOCR 是从带烧录字幕的视频到成品 SRT,最简单的免费一站式方案。载入视频、裁剪字幕区域、运行 — 它用本地的 PaddleOCR,或在混合云模式下用 Google Lens 读取文字,并写出带时间轴的 SRT。
亮点:
- 真正的一步工作流:视频进、SRT 出
- 本地 PaddleOCR 模式(支持多种语言)或更高准确率的 Google Lens 混合模式
- 图形界面和命令行,外加 Docker 镜像;支持 NVIDIA CUDA 加速
局限:
- 没有 macOS 版本
- 按它自己的文档说明,在 CPU 上很慢 — 你真的会想要 GPU 版本
- 没有可以审校结果的编辑器,没有翻译,没有烧录
最适合:想要免费、省心提取,拿到 SRT 就完事的 Windows/Linux 用户。
4. VideoSubFinder — 两步工作流里的字幕帧检测(自身不做 OCR)
价格:免费,开源(GPLv2)
平台:Windows、Linux
VideoSubFinder 完全不做 OCR — 它把问题的视频那一半解决得比谁都好:找出带字幕文字的帧、记录精确时间轴,并输出去掉背景、清理干净的图片。然后你把这些图片交给一个 OCR 工具(RapidVideOCR、Subtitle Edit、FineReader)来得到文字。字幕组的经典之作。
亮点:
- 出色的背景清理 — 交给你的 OCR 工具的图片要好认得多
- 每一行精确的出现/消失时间轴
- 每个阶段都可检视、可调
局限:
- 自己不做 OCR — 需要第二个程序
- 没有 macOS 版本
- 本文中最手动的工作流:两个 App,中间还夹着一批图片
最适合:想要极致掌控、并要给 OCR 提供尽可能最好的原始图片的字幕组成员和完美主义者。
5. RapidVideOCR — 处理 VideoSubFinder 输出的 OCR 步骤
价格:免费,开源(Apache 2.0)
平台:Windows、Linux、macOS(Python/pip;Windows 有桌面版 EXE)
RapidVideOCR 是专为 VideoSubFinder 工作流打造的后半段:它接收 VideoSubFinder 清理好的图片文件夹(RGBImages/TXTImages),把它们 OCR 成 SRT、ASS 或 TXT。它基于 RapidOCR 引擎,维护活跃。
亮点:
- 专门为 VideoSubFinder 的输出设计 — 时间轴能干净地传过来
- 支持 SRT、ASS 和 TXT 输出
- 可用 pip 安装,跨平台工作
局限:
- 不是独立提取器 — 没有 VideoSubFinder 的图片就没用(而 VideoSubFinder 本身没有 Mac 版本,所以这一对仍然被绑在 Windows/Linux 上)
- 以命令行为主;更友好的桌面版仅限 Windows
最适合:在不用 ABBYY FineReader、也不用手动跑 Subtitle Edit OCR 的情况下,把 VideoSubFinder 的流水线补完。
第二部分:OCR 引擎(不是完整工具)
你还会看到有人推荐下面三个。它们只从单张图片里读文字;都不会找字幕帧、去重或生成时间轴,所以单独用出不了 SRT。
6. PaddleOCR
深度学习 OCR 工具包,中文等 CJK 文字识别很强,也是 VideOCR 本地模式用的引擎。要用在视频上,抽帧、去重和时间轴的代码都得自己写。
7. Tesseract OCR
老牌开源引擎,为印刷文档设计。低分辨率、带样式的视频文字对它很难,除非先把画面清理干净(VideoSubFinder 做的就是这件事)。
8. Google Lens
对杂乱画面识别很准,但只能手动 — 一次一张截图,没有时间轴。VideOCR 的混合模式能自动调用它,代价是要把画面发给 Google。
8 款方案怎么比?
| 工具 | 平台 | 自带 OCR | 到 SRT 的步数 | 翻译 / 烧录 | 价格 |
|---|---|---|---|---|---|
| GeekLink | Mac(Apple Silicon)和 64 位 Windows | 是(本地) | 1 | 是 — AI 翻译 + 带样式烧录 | 免费档;Pro 每月 $12.99、每年 $99、终身 $129 |
| Video-Subtitle-Extractor | Win / Linux / macOS(为 NVIDIA 调优) | 是(本地) | 1 | 否 | 免费(Apache 2.0) |
| VideOCR | Windows / Linux / Docker | 是(PaddleOCR 或 Google Lens) | 1 | 否 | 免费(MIT) |
| VideoSubFinder | Windows / Linux | 否 — 只出图片 | 2(需要 OCR 工具) | 否 | 免费(GPLv2) |
| RapidVideOCR | Win / Linux / macOS(pip) | 是(RapidOCR)— 处理 VideoSubFinder 的图片 | 2(配合 VideoSubFinder) | 否 | 免费(Apache 2.0) |
| PaddleOCR | Python 库 | 仅引擎 | DIY 脚本 | 否 | 免费 |
| Tesseract | 库 / 命令行 | 仅引擎 | DIY / 通过 Subtitle Edit | 否 | 免费 |
| Google Lens | 云端 | 仅引擎(云端) | 手动 / 通过 VideOCR 混合模式 | 否 | 免费 |
你该选哪个?
只想把字幕准确地提取出来,用的是 Mac 或 Windows:GeekLink。导入视频、确认它找到的字幕行、导出 SRT — 不用框选,不需要 Python、conda 或 NVIDIA 显卡,logo 和水印也不会混进文件。提取功能和每月 60 分钟的 OCR 导出额度都在免费版里。
你还需要翻译或烧录:如果字幕还要复查、翻译、再烧录回成片,GeekLink 是这里唯一能在一个 App 里全部搞定的工具 — 其他工具交给你一份 SRT 就结束了。
你用 Linux,或者熟悉 Python、手上有 NVIDIA 显卡:开源提取器(VideOCR、VSE)或 VideoSubFinder + RapidVideOCR 两步路线也能用,只是配置更多,之后没有编辑器、翻译和烧录。
常见问题
提取硬字幕最好的免费工具是哪个?
在 Mac 或 Windows 上:GeekLink 免费版包含自动识别字幕行、本地 OCR 提取和每月 60 分钟 OCR 导出额度,不用配 Python 或显卡环境。在 Linux 上,开源方案(VideOCR,或 VideoSubFinder + RapidVideOCR)免费,但配置更多,而且只输出原始 SRT。
我在 Mac 上怎么提取硬字幕?
GeekLink 是本文列表里同时支持 Mac 和 Windows 的桌面选择 — 开源提取器要么只出 Windows/Linux 版本(VideoSubFinder、VideOCR),要么在 Mac 的 CPU 上跑得很慢(Video-Subtitle-Extractor)。GeekLink 在桌面端本地运行 OCR:导入、在字幕区域画框、运行、导出 SRT。
提取硬字幕需要 GPU 吗?
对于开源提取器,想要合理速度实际上是需要的 — VideOCR 和 Video-Subtitle-Extractor 都是围绕 NVIDIA CUDA 构建的,在 CPU 上很慢。在 Mac 上,GeekLink 在 Apple Silicon 上原生运行它的 OCR,不需要独立 GPU。
这些工具里有能翻译提取出来的字幕的吗?
只有 GeekLink。其他工具都停在原语言的 SRT(或图片)。GeekLink 在 App 内用 Claude 3.5 Haiku、GPT-4o、GPT-4o mini 或 DeepSeek 翻译,跨行使用上下文,并能把翻译后的字幕烧录回视频。
我该用 VideoSubFinder 还是 VideOCR?
两者都只支持 Windows/Linux。VideOCR 一次运行就完成检测和 OCR;VideoSubFinder 只产出清理后的文字图片和时间轴,还需要第二个 OCR 工具(比如 RapidVideOCR)。如果你用 Mac,或者提取之后还要复查、翻译、烧录,GeekLink 在一个 App 里就能走完整个流程。
为什么不直接用 Google Lens 或 Tesseract?
它们是 OCR 引擎,不是视频工具 — 它们读取单张图片。从视频中提取字幕还需要找出哪些帧含有文字、跨帧对重复行去重,并构建时间轴。那个视频层正是 VideOCR、VSE、VideoSubFinder 和 GeekLink 在引擎之上提供的东西。