太長不看:這三款工具都能從硬字幕(燒錄字幕)中取出可編輯的文字,但它們適合不同的配置。VideoSubFinder(免費,Windows/Linux)本身不做 OCR — 它偵測字幕畫面與時間軸,然後輸出清理後的文字圖片,供你餵給像 Subtitle Edit 或 FineReader 這樣的獨立 OCR 工具。VideOCR(免費,開源,Windows/Linux)是端到端的:它用本機的 PaddleOCR 讀取文字(或以混合雲端模式用 Google Lens),並寫出帶時間軸的 SRT。GeekLink 是 macOS 選項:端到端的本機 OCR,具框選式區域選取、一個會標出它沒把握的行的編輯器,接著在同一個 App 裡進行 AI 翻譯與燒錄。在 Windows 或 Linux 上,VideOCR 是最佳免費之選;如果你想要具完整掌控度的經典兩段式字幕組工作流程,選 VideoSubFinder;在 Mac 上,或如果你需要把字幕翻譯後燒錄回去,選 GeekLink。

在 Mac 上?GeekLink 在本機擷取燒錄字幕 — 框選一個區域、執行 OCR、得到帶時間軸的 SRT。免費方案,無須帳號。

免費下載

VideOCR 是什麼?

VideOCR 是一款給 Windows 與 Linux 用的免費、開源(MIT)工具,使用本機的 PaddleOCR 或混合雲端模式的 Google Lens,把影片中的硬字幕擷取成一個 SRT 檔案。它是個活躍的 GitHub 專案(截至 2026 年 7 月約 680 星),同時有 GUI 與 CLI,外加 CPU 與 NVIDIA GPU 的 Docker 映像。

工作流程很直接:載入一支影片、裁切字幕區域、選一個 OCR 引擎,然後執行。本機模式使用 PaddleOCR 模型(其 README 列出 200+ 種支援語言);混合模式在本機做文字偵測,但把辨識送給 Google Lens,這是以隱私與離線使用換取難搞素材上的準確度。它支援 NVIDIA CUDA 加速、可設定的信心閾值,以及處理間距問題的後製。

直接引自它自己的文件,主要的注意事項是:在 CPU 上的本機 OCR 很慢(GPU 版本存在是有原因的),而且沒有 macOS 版本 — 它只出 Windows 與 Linux 版本。也沒有內建編輯器可複查或修正辨識出的文字、沒有翻譯、沒有燒錄;輸出就是那個 SRT,管線的其餘部分由你自理。來源:GitHub 上的 VideOCR

VideoSubFinder 是什麼?

VideoSubFinder 是一款免費(GPLv2)的 Windows/Linux 工具,找出含有硬字幕的畫面與它們的時間軸 — 但它本身不執行 OCR。它輸出的是「清理過」的文字圖片(字幕行從背景中隔離出來),你接著把這些圖片丟進像 Subtitle Edit、ABBYY FineReader 或 Google Drive 的 OCR 這類獨立 OCR 程式,來得到實際文字。

它是字幕組世界的經典 — 在 SourceForge 上發布,至今每週仍有數百次下載 — 兩段式的設計是刻意的。VideoSubFinder 解決真正困難、專屬影片的問題(哪些畫面有字幕文字、每一行何時出現與消失、把背景清理掉),並把字元辨識留給專門的 OCR 軟體。仔細做的話,結果非常出色,這就是為什麼 VideoSubFinder + Subtitle Edit 的組合至今仍是影片論壇上的標準配方。

那份強大的代價是工作流程的摩擦:你要管理兩個程式、在它們之間傳輸一批批圖片,最後把文字重新縫回時間軸。而且跟 VideOCR 一樣,沒有 macOS 版本 — 它針對 Windows 與 Linux。來源:SourceForge 上的 VideoSubFinder

VideOCR vs VideoSubFinder vs GeekLink:它們如何比較?

一句話版本:VideoSubFinder 是一個需要第二個 OCR 工具的字幕畫面偵測器,VideOCR 是一款給 Windows/Linux 用的完整免費擷取器,而 GeekLink 是一款給 macOS 用的完整擷取器加管線。

功能 GeekLink VideOCR VideoSubFinder
平台 macOS(原生,Apple Silicon) Windows / Linux / Docker — 無 Mac 版 Windows / Linux — 無 Mac 版
自己做 OCR 是 — 本機,端到端 是 — PaddleOCR 本機,或 Google Lens 混合(雲端) 否 — 輸出清理後的文字圖片供外部 OCR 工具使用
到完成 SRT 的步驟 一款 App:匯入 → 框選 → 執行 → SRT 一款 App:裁切 → 執行 → SRT 兩款 App:在這裡偵測畫面,在別處 OCR 圖片(如 Subtitle Edit)
字幕區域選取 是 — 框選;外加給 logo 與浮水印的尺寸/顏色篩選 是 — 裁切設定 是 — 搜尋區域設定
在 App 內複查/修正結果 是 — 編輯器標出它最沒把握的行 否 — 在別處編輯 SRT 否 — 修正在你的 OCR 工具裡進行
擷取字幕的 AI 翻譯 是 — Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek(上下文感知,40+ 種語言)
把字幕燒錄回影片 是 — 帶樣式燒錄
完全離線執行 是 — OCR 100% 本機 本機模式是;Google Lens 混合模式需要網路 是(OCR 步驟取決於你搭配的工具)
GPU 加速 在 Apple Silicon 上本機執行 NVIDIA CUDA 版本 偏向 CPU;多執行緒
價格/授權 免費方案;付費每月 $12.99、每年 $99,或一次性終身 $169 免費,開源(MIT) 免費,開源(GPLv2)

重點:先按作業系統挑,其次才按工作流程。VideOCR 與 VideoSubFinder 都沒有出 Mac 版,而 GeekLink 沒有出 Windows 版 — 所以對大多數人來說,作業系統就決定了。當你真的有選擇時,問題在於你想要免費的原始擷取(VideOCR)、兩步達成的最大掌控度(VideoSubFinder),還是在一款 App 裡擷取加複查、翻譯與燒錄(GeekLink)。

你能直接用 PaddleOCR、Tesseract 或 Google Lens 嗎?

可以,但它們是 OCR 引擎,不是影片字幕工具 — 單靠自己時它們讀取圖片,而影片那部分仍得有人處理:對畫面取樣、偵測字幕在哪裡、去除重複行,以及建立時間軸。那正是上述工具圍繞它們所做的工作。

引擎 它是什麼 對字幕的優勢 對影片欠缺什麼
PaddleOCR 開源深度學習 OCR 工具組(Python 函式庫) 現代水準的準確度;在中文與其他 CJK 文字上尤其強;本機執行 讀取圖片,不是影片 — 畫面擷取、區域裁切、去重與 SRT 組裝都得你自己寫程式(基本上就是 VideOCR 圍繞它所做的事)
Tesseract 老牌開源 OCR 引擎,被許多文件工具與 Subtitle Edit 的圖片 OCR 使用 成熟、免費、語言涵蓋非常廣;在乾淨、高對比的文字上表現不錯 為列印文件而設計 — 低解析度、有樣式的影片文字是個難題,這就是 VideoSubFinder 的去背步驟存在的原因
Google Lens Google 的雲端文字辨識 極其準確,即使是雜亂或有樣式的文字 沒有批次影片工作流程、沒有時間軸 — 手動做就是一張截圖接一張截圖;VideOCR 的混合模式把它自動化,代價是把你的畫面送去 Google

所以「哪個 OCR 引擎最好」通常是錯的第一個問題。對字幕來說,工具的影片這一層 — 畫面偵測、時間軸、去重、區域與雜物篩選 — 決定了你會看到的大部分實際品質差距。

你該選哪一款?

在 Windows 或 Linux 上,你想要免費、端到端的擷取:VideOCR。一款 App、本機 PaddleOCR、輸出 SRT。如果你有 NVIDIA GPU,就用 GPU 版 — CPU 模式依它自己承認就是很慢。GeekLink 在這裡不是選項:它僅限 macOS。

你想要最大掌控度與最好的 OCR 原始圖片:VideoSubFinder + Subtitle Edit(或 FineReader)。兩段式工作流程較慢、也較手動,但去背步驟真的很好,而且每個階段都可檢視。這是傳統字幕組的路線。

在 Mac 上:GeekLink 是務實的選擇 — 另外兩款沒有出 Mac 版,透過模擬或從原始碼執行它們,就違背了快速擷取的初衷。GeekLink 的 OCR 在本機執行,框選與尺寸/顏色篩選把 logo 與浮水印擋在結果之外,而擷取在免費方案內。

擷取對你來說只是第一步:如果真正的工作是「燒錄的中文字幕進、翻譯後的英文字幕燒錄回去」,只有 GeekLink 涵蓋整條鏈 — OCR、一個標出值得檢查的行的編輯器、上下文感知的 AI 翻譯,以及在一款 App 裡的帶樣式燒錄。用 VideOCR 或 VideoSubFinder,你得從三、四個獨立工具拼湊出那條管線。

它們要多少錢?

VideOCR(MIT)與 VideoSubFinder(GPLv2)都完全免費且開源 — 沒有付費層級,沒有任何計量。如果你在 Windows/Linux 上、擷取就是全部工作,你的軟體成本是零。

GeekLink 有一個永久免費方案(完整 OCR、語音辨識、編輯、批次、SRT/ASS 匯出;免費匯出帶有小小的 GeekLink 標記),外加給翻譯與燒錄管線的統一付費方案:

  • 月付 — 每月 $12.99
  • 年付 — 每年 $99(約每月 $8.25),含 100 萬 AI 翻譯 tokens(約 1,500 分鐘)
  • 終身 — 一次性 $169(早鳥)/ 一般 $199,含 100 萬 AI 翻譯 tokens,無訂閱
  • 額外 AI 翻譯 tokens — 每 100 萬 tokens $6.99(超量)

你付給 GeekLink 的錢不是為了 OCR — 擷取是免費的。付費方案涵蓋 AI 翻譯與完成影片的管線。如果你需要的只是 Windows 上的免費擷取,VideOCR 就是正確答案,且分文不花。

常見問題

VideoSubFinder 自己做 OCR 嗎?

不做。VideoSubFinder 偵測含有硬字幕的畫面、記錄它們的時間軸,並輸出清理後的文字圖片。要得到實際文字,你得把這些圖片丟進一個獨立的 OCR 程式 — 常見的是 Subtitle Edit(以 Tesseract 為基礎的圖片 OCR)、ABBYY FineReader 或 Google Drive OCR。VideOCR 與 GeekLink 都自己執行 OCR。

VideOCR 或 VideoSubFinder 有 Mac 版嗎?

沒有。截至 2026 年 7 月,VideOCR 出 Windows、Linux 與 Docker 版本,VideoSubFinder 出 Windows 與 Linux 版本。在 macOS 上,GeekLink 是以 OCR 擷取硬字幕的原生選項。

哪一款工具擷取硬字幕最準確?

這取決於你的素材更甚於工具:解析度、對比與字型樣式主宰一切。三款都採用現代方法 — VideOCR 用 PaddleOCR 或 Google Lens,VideoSubFinder 為你搭配的任何 OCR 產出清理後的圖片,而 GeekLink 以區域與雜物篩選執行本機 OCR。GeekLink 還額外標出它最沒把握的行,所以你只需複查少數幾行、而不必逐條校對全部。

VideOCR 或 VideoSubFinder 能翻譯字幕嗎?

不能。兩者都止步於原文文字 — VideOCR 止於 SRT,VideoSubFinder 止於圖片加時間軸。翻譯需要另一個工具。GeekLink 在 App 內以 Claude 3.5 Haiku、GPT-4o、GPT-4o mini 或 DeepSeek 翻譯擷取出的字幕,並跨行運用上下文,還能把結果燒錄回影片。

字幕 OCR 用 Tesseract 還是 PaddleOCR 比較好?

對影片字幕來說,像 PaddleOCR 這樣的深度學習引擎通常比為乾淨列印文件而設計的 Tesseract 更能處理低解析度、有樣式與 CJK 文字。話雖如此,VideoSubFinder 的去背步驟透過交給 Tesseract 乾淨得多的圖片,縮小了這個差距。無論如何,引擎的重要性都不及圍繞它的影片這一層 — 畫面偵測、時間軸與去重。

這些工具能離線運作嗎?

VideoSubFinder:能(它的 OCR 步驟取決於你搭配的工具)。VideOCR:在本機 PaddleOCR 模式下能;它的 Google Lens 混合模式需要網路,並把畫面送去 Google。GeekLink:能 — OCR 在你的 Mac 上 100% 本機執行;只有選用的 AI 翻譯步驟會呼叫一個模型 API。

相關文章