太長不看:燒錄(硬字幕)字幕是影片畫面的一部分,因此要拿回可編輯的文字就得靠 OCR — 而選對工具主要取決於你的作業系統,以及擷取之後你還想走多遠。在 Windows 或 Linux 上,VideOCR 是最佳免費之選:單一程式,影片進、帶時間軸的 SRT 出。若要最大掌控度,經典的兩段式路線是 VideoSubFinder(畫面偵測 + 清理後的圖片)餵給 RapidVideOCR 或 Subtitle Edit。在 Mac 上,GeekLink 是唯一的原生選項 — 也是這裡唯一能在同一個 App 裡繼續走到複查、AI 翻譯與燒錄的工具。以下:五款專用工具與三條 DIY 引擎路線(PaddleOCR、Tesseract、Google Lens),全部彙整於一張表格。

重點整理

  • 你的作業系統決定了一切。在 Windows 或 Linux 上,VideOCR 是最佳免費端到端擷取器。在 Mac 上,GeekLink 是唯一的原生全能選項 — 開源擷取器沒有一款有 Mac 版。
  • VideoSubFinder 本身不做 OCR。它負責找出字幕畫面並清理圖片;你得搭配 RapidVideOCR 或 Subtitle Edit 才能得到實際文字。掌控度最高,兩段式工作流程。
  • Video-Subtitle-Extractor(VSE)是最熱門的開源選項(GitHub 星數 9,000+),但它偏向 NVIDIA/CUDA — 在沒有相容 GPU 的機器上很慢。
  • PaddleOCR、Tesseract 與 Google Lens 是引擎,不是工具。它們讀取圖片;影片這一層(畫面偵測、時間軸、去重)才是上述工具在其之上加的東西。
  • 只有 GeekLink 走得比擷取更遠 — 標記出可疑行的複查、AI 翻譯與燒錄都在同一個 App 裡完成。

在 Mac 上?GeekLink 在本機擷取燒錄字幕 — 框選一個區域、執行 OCR、得到帶時間軸的 SRT。免費方案,無須帳號。

免費下載

第一部分:專用字幕擷取工具

這五款是專為從影片中拉出燒錄(硬字幕)字幕而打造的。它們主要差別在於平台、工作流程需要幾步,以及拿到 SRT 之後會發生什麼。

1. VideOCR — Windows 與 Linux 上最佳的免費端到端擷取器

價格:免費,開源(MIT)
平台:Windows、Linux、Docker(CPU 與 NVIDIA GPU 版本)

VideOCR 是從一段帶燒錄字幕的影片走到完成 SRT 最簡單的免費方式,全程在一個程式裡。載入影片、裁切字幕區域、執行 — 它會用本機的 PaddleOCR 讀取文字,或以混合雲端模式用 Google Lens 讀取,並寫出帶時間軸的 SRT。截至 2026 年 7 月,這是個活躍專案,GitHub 星數約 680。

VideOCR 的 Windows GUI,在雙語燒錄字幕四周畫了一個裁切框,OCR 引擎設為 PaddleOCR 偵測 + Google Lens 辨識
VideOCR 的 Windows GUI:字幕行四周的裁切框,引擎設為 PaddleOCR + Google Lens 混合。截圖來自官方 VideOCR 儲存庫(MIT)。

亮點:

  • 真正的一步式工作流程:影片進、SRT 出
  • 本機 PaddleOCR 模式(其 README 列出 200+ 種語言),或準確度更高的 Google Lens 混合模式
  • GUI 與 CLI,外加 Docker 映像;NVIDIA CUDA 加速

限制:

  • 沒有 macOS 版
  • 依它自己的文件說明,在 CPU 上很慢 — 你真的會想要 GPU 版
  • 沒有可複查結果的編輯器,沒有翻譯,沒有燒錄

最適合:想要免費、免麻煩擷取,且拿到 SRT 就收工的 Windows/Linux 使用者。

2. Video-Subtitle-Extractor(VSE)— 最熱門的開源擷取器

價格:免費,開源(Apache 2.0)
平台:Windows、Linux、macOS(為 NVIDIA GPU 調校;CPU 後援很慢)

Video-Subtitle-Extractor 是這個類別裡最熱門的工具 — GitHub 星數 9,000+ — 以本機 OCR 將燒錄字幕擷取成 SRT,涵蓋 87 種語言。它逐格偵測字幕區域、去除重複行,並提供快速/自動/精確三種模式。在華語社群中特別強勢。

Video-Subtitle-Extractor 的 GUI 正在偵測動畫畫面中的一行燒錄英文字幕,右側有批次佇列與辨識紀錄
VSE 正在偵測字幕行(綠框),右側有批次佇列 — 介面以中文為主。截圖來自官方 VSE 儲存庫(Apache 2.0)。

亮點:

  • 87 種語言,全程本機,無須 API 金鑰
  • 跨多支影片的批次擷取(相同解析度/區域)
  • 姊妹專案(video-subtitle-remover)可抹除舊的燒錄文字

限制:

  • 偏向 NVIDIA/CUDA — 在 Mac 上會退回緩慢的 CPU 處理
  • 若發行版本不合用,需要 Python/conda 設定;路徑不能含空白或非 ASCII 字元
  • 沒有 App 內編輯器、翻譯或燒錄

最適合:擁有 NVIDIA GPU、想要免費大量擷取的技術使用者,尤其是中文內容。完整比較:GeekLink vs VSE

3. GeekLink — Mac 上最佳,也是唯一的全能方案(擷取 → 複查 → 翻譯 → 燒錄)

價格:免費方案(含 OCR 擷取);Pro 每月 $12.99、每年 $99(約每月 $8.25),或一次性終身 $169
平台:macOS(原生,Apple Silicon)

GeekLink 是這份清單上唯一在 Mac 上原生執行的工具 — 也是唯一一款把擷取當成第一步、而非整個工作的工具。匯入影片、在字幕區域四周框一個框,它就會在本機把文字 OCR 成一份帶時間軸、可編輯的字幕清單。尺寸與顏色篩選器把 logo 和浮水印擋在結果之外,編輯器還會標記出它最沒把握的行,讓你只需複查少數幾行、而不必逐條校對全部。從那裡你可以翻譯(Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek — 具備上下文感知,40+ 種語言)並把結果燒錄回去,全部在同一個 App 裡。

GeekLink 在 macOS 上:執行本機 OCR 前,在燒錄字幕區域四周畫一個框
GeekLink 在 macOS 上:在字幕行四周畫一個框 — OCR 只讀取框內,忽略 logo 與浮水印。

亮點:

  • 原生 macOS App — 不用 Python、不用 conda、不用 CUDA;OCR 100% 在本機執行
  • 框選式區域選取,加上尺寸/顏色雜物篩選
  • 編輯器標記出可疑行 — 這裡任何工具中最快的複查流程
  • 同一個 App 繼續走到 AI 翻譯與帶樣式的燒錄;內建批次處理

限制:

  • 僅限 macOS — 沒有 Windows 或 Linux 版本
  • 閉源;AI 翻譯是付費(Pro)功能 — 擷取本身在免費方案內

最適合:Mac 使用者,以及任何真正的工作是「一種語言的燒錄字幕 → 另一種語言的完成影片」的人。逐步指南:如何用 OCR 擷取燒錄字幕

4. VideoSubFinder — 最佳字幕畫面偵測(經典兩段式工作流程)

價格:免費,開源(GPLv2)
平台:Windows、Linux

VideoSubFinder 完全不做 OCR — 但它把問題的影片這一半解得比誰都好:找出含字幕文字的畫面、記錄精確時間軸,並輸出去背後清理乾淨的圖片。接著你把這些圖片丟進 OCR 工具(RapidVideOCR、Subtitle Edit、FineReader)來得到文字。這是字幕組的經典之作,至今在 SourceForge 上每週仍有數百次下載。

亮點:

  • 出色的去背清理 — 交給你的 OCR 工具的是容易得多的圖片
  • 每一行精確的出現/消失時間軸
  • 每個階段都可檢視、可調校

限制:

  • 本身沒有 OCR — 需要第二個程式
  • 沒有 macOS 版
  • 這裡最手動的工作流程:兩個 App,中間夾著一批批圖片

最適合:想要最大掌控度、追求最佳 OCR 原始圖片的字幕組與完美主義者。

5. RapidVideOCR — VideoSubFinder 最佳的 OCR 搭檔

價格:免費,開源(Apache 2.0)
平台:Windows、Linux、macOS(Python/pip;Windows 有桌面 EXE)

RapidVideOCR 是專為 VideoSubFinder 工作流程打造的後半段:它接手 VideoSubFinder 清理後的圖片資料夾(RGBImages/TXTImages),把它們 OCR 成 SRT、ASS 或 TXT。它建構於 RapidOCR 引擎之上,且維護活躍(GitHub 星數約 500)。

RapidVideOCR 線上示範要求上傳一個由 VideoSubFinder 匯出的 RGBImages 或 TXTImages 的 ZIP
RapidVideOCR 的示範講得很白:把 VideoSubFinder 匯出的 RGBImages/TXTImages 餵給它。截圖來自官方 RapidVideOCR 示範(Apache 2.0)。

亮點:

  • 專為 VideoSubFinder 的輸出而設計 — 時間軸能乾淨地傳遞過來
  • SRT、ASS 與 TXT 輸出
  • 可用 pip 安裝,跨平台運作

限制:

  • 不是獨立擷取器 — 沒有 VideoSubFinder 的圖片就沒用(而 VideoSubFinder 本身沒有 Mac 版,所以這對組合仍受限於 Windows/Linux)
  • 以 CLI 為主;較友善的桌面版僅限 Windows

最適合:在不用 ABBYY FineReader 或手動 Subtitle Edit OCR 的情況下完成 VideoSubFinder 管線。

第二部分:DIY 路線 — 可供你在其上打造的 OCR 引擎

這些不是字幕工具 — 它們是辨識引擎。單靠自己時它們讀取圖片;畫面取樣、字幕偵測、去重與時間軸都得由你(或上述某個工具)處理。值得認識,因為「用哪個引擎」解釋了第一部分裡許多差異。

6. PaddleOCR — 若你自建管線,CJK 的最佳引擎

價格:免費,開源
平台:Python 函式庫(任何作業系統)

PaddleOCR 是一套深度學習 OCR 工具組,具備現代水準的準確度,在中文與其他 CJK 文字上尤其強勢 — 它就是 VideOCR 本機模式裡的引擎。對著圖片一指,它就回傳文字;要用在影片上,畫面擷取、裁切、去重與 SRT 組裝都得你自己寫程式。

最適合:正在打造客製化擷取管線的開發者,尤其是中文/日文/韓文內容。

7. Tesseract OCR — 老牌引擎(Subtitle Edit 所用)

價格:免費,開源
平台:函式庫/CLI(任何作業系統)

Tesseract 是經典的開源 OCR 引擎 — 成熟、免費、語言涵蓋廣,但設計上是給列印文件用的。低解析度、有樣式的影片文字對它是個難題,這正是 VideoSubFinder 的去背步驟存在的原因:餵給 Tesseract 乾淨、高對比的圖片(例如透過 Subtitle Edit 的圖片 OCR),它的表現就相當不錯。

最適合:在清理後圖片上走 Subtitle Edit 路線;不建議直接對著影片畫面用。

8. Google Lens — 最準確的辨識,但沒有影片工作流程

價格:免費(雲端)
平台:雲端服務

對著雜亂畫面,Google Lens 大概是你能用到最準確的文字辨識 — 但沒有批次影片工作流程,也沒有時間軸。手動做的話就是一張截圖接一張截圖。VideOCR 的混合模式把它自動化了(本機偵測、Lens 辨識),代價是需要網路連線,並把你的畫面送去 Google。

最適合:抽查幾個難搞的畫面,或當準確度勝過隱私時透過 VideOCR 的混合模式使用。

這 8 款方案如何比較?

工具 平台 自己做 OCR 到 SRT 的步驟 翻譯/燒錄 價格
VideOCRWindows / Linux / Docker是(PaddleOCR 或 Google Lens)1免費(MIT)
Video-Subtitle-ExtractorWin / Linux / macOS(NVIDIA 調校)是(本機)1免費(Apache 2.0)
GeekLinkmacOS(Apple Silicon)是(本機)1是 — AI 翻譯 + 帶樣式燒錄免費方案;Pro 每月 $12.99、每年 $99、終身 $169
VideoSubFinderWindows / Linux否 — 只出圖片2(需 OCR 工具)免費(GPLv2)
RapidVideOCRWin / Linux / macOS(pip)是(RapidOCR)— 用於 VideoSubFinder 的圖片2(搭配 VideoSubFinder)免費(Apache 2.0)
PaddleOCRPython 函式庫僅引擎DIY 寫程式免費
Tesseract函式庫 / CLI僅引擎DIY / 透過 Subtitle Edit免費
Google Lens雲端僅引擎(雲端)手動 / 透過 VideOCR 混合免費

你該選哪一款?

你在 Windows 或 Linux 上,擷取就是全部工作:VideOCR(一步、免費),或者若你有 NVIDIA GPU 且有批次量,就選 Video-Subtitle-Extractor — 尤其是中文內容。

你想要掌控度最高、品質最好的路線,且不介意兩步:VideoSubFinder 負責偵測 + RapidVideOCR(或 Subtitle Edit)負責辨識。傳統字幕組的配方。

你在 Mac 上:GeekLink。開源擷取器要嘛沒有 Mac 版,要嘛退回緩慢的 CPU 處理;GeekLink 的 OCR 是原生、本機的,而且在免費方案內。

擷取是第一步,不是目標:如果字幕需要被複查、翻譯,並燒錄回一支完成的影片,GeekLink 是這裡唯一能在一個 App 裡全部搞定的工具 — 其他所有工具只會遞給你一份 SRT,然後祝你好運。

你是開發者,想打造某個客製化的東西:用 PaddleOCR 做辨識(尤其是 CJK),並研究 VideOCR 與 VSE 如何架構它們的畫面偵測與去重層 — 影片這一層才是真正費工的地方。

常見問題

擷取燒錄字幕最好的免費工具是哪個?

在 Windows 或 Linux 上:VideOCR — 免費、開源,從影片到 SRT 只需一步。在 Mac 上:GeekLink 的免費方案涵蓋完整 OCR 擷取與 SRT 匯出。如果你想要最大的品質掌控度、又不介意兩段式工作流程,VideoSubFinder + RapidVideOCR 也完全免費。

我要如何在 Mac 上擷取燒錄字幕?

GeekLink 是這份清單裡唯一的原生 Mac 選項 — 開源擷取器出的是 Windows/Linux 版本(VideoSubFinder、VideOCR),或在 Mac 的 CPU 上跑得很慢(Video-Subtitle-Extractor)。GeekLink 在 Apple Silicon 上以本機執行 OCR:匯入、在字幕區域四周框一個框、執行、匯出 SRT。

擷取燒錄字幕需要 GPU 嗎?

對開源擷取器而言,要有合理的速度基本上是需要的 — VideOCR 與 Video-Subtitle-Extractor 都是圍繞 NVIDIA CUDA 打造的,在 CPU 上很慢。在 Mac 上,GeekLink 在 Apple Silicon 上原生執行它的 OCR,不需要獨立 GPU。

這些工具有任何一款能翻譯擷取出的字幕嗎?

只有 GeekLink。其他工具止步於原文 SRT(或圖片)。GeekLink 在 App 內以 Claude 3.5 Haiku、GPT-4o、GPT-4o mini 或 DeepSeek 翻譯,並跨行運用上下文,還能把翻譯後的字幕燒錄回影片。

我該用 VideoSubFinder 還是 VideOCR?

若你想要一個程式、一個步驟,選 VideOCR — 它在一次執行中同時偵測並 OCR。若你想要最大掌控度與品質,選 VideoSubFinder:它產出盡可能最乾淨的文字圖片與精確時間軸,接著你用 RapidVideOCR 或 Subtitle Edit 對它們 OCR。相同平台(Windows/Linux),不同哲學。

為什麼不直接用 Google Lens 或 Tesseract?

它們是 OCR 引擎,不是影片工具 — 它們讀取單張圖片。從影片中擷取字幕還需要找出哪些畫面含有文字、跨畫面去除重複行,以及建立時間軸。影片這一層正是 VideOCR、VSE、VideoSubFinder 與 GeekLink 在引擎之上提供的東西。

相關文章