太長不看:Subtitle Edit 最近新增了 Video OCR(Video → OCR burned-in subtitle…),這個免費開源的字幕編輯器現在也能從影片裡提取燒錄字幕了 — 是個實用的補充。差別在底層。Subtitle Edit 要你框選一個掃描矩形,再用一個通用 OCR 引擎逐幀識別(macOS 上用 Apple Vision;Windows/Linux 上用 Paddle OCR;或 GLM-OCR、PaddleOCR-VL 這類需下載的視覺模型)。GeekLink 則是自動識別出真正的字幕行,再用為字幕文字精調的模型去識別 — 因此快得多、也更不容易漏行 — 而且它開箱即用,無需你下載或安裝任何 OCR 引擎或模型。如果你本來就在 Subtitle Edit 裡幹活、想在編輯器內做免費 OCR,它的 Video OCR 是個不錯的選擇。如果你要的是最快、最省事的燒錄字幕提取,那正是 GeekLink 更強的地方。
想提取燒錄字幕、又不想裝任何東西?GeekLink 自動找出字幕行,並在你的電腦本地執行 OCR — 不用挑引擎,也不用下模型。有免費額度,無需註冊。
Download FreeSubtitle Edit 的 Video OCR 是什麼?
Subtitle Edit 是一款歷史悠久、免費開源的字幕編輯器,最近新增了 Video OCR 功能,可以把影片裡的燒錄(硬)字幕提取成可編輯的文本行。你開啟 Video → OCR burned-in subtitle…,找到一幀有字幕的畫面,把掃描矩形調整到字幕所在的位置(預設是畫面下三分之一),選擇 OCR 引擎和語言,可選地測試當前幀,然後點選 Start OCR。識別出的行會出現在一個列表裡,可以就地編輯。對於本來就用它做時間軸和校對的人來說,內建 OCR 確實很方便。
對這場對比來說,關鍵在於它怎麼識別文字。Subtitle Edit 把這活交給一個通用 OCR 引擎,而按它自己的文件,可選項取決於你的平臺:
- Apple Vision — 僅 macOS;本地、快速、無需下載。
- Paddle OCR — Windows 和 Linux;本地執行,自動下載。
- llama.cpp 視覺模型 — GLM-OCR 0.9B、PaddleOCR-VL 1.6(109 種語言)、HunyuanOCR、LightOnOCR;跨平臺,引擎和模型自動下載。
- CrispEmbed 和 Ollama 視覺方案 — 另外兩條本地視覺模型路徑(Ollama 需單獨安裝),外加一個雲端 GLM API 選項。
這些都是能力不錯的通用識別器 — 尤其是視覺模型選項,純字元識別很強,語言覆蓋也廣。但它們只是對著一個矩形、在抽樣的幀上執行;那些字幕特有的活 — 判斷哪些行才是真字幕、忽略臺標和畫面雜物、別在每一幀上重複識別同一條字幕 — 就都留給了你,以及你框得好不好。
GeekLink vs Subtitle Edit Video OCR:兩者怎麼比?
兩者都能把燒錄文字讀成可編輯的字幕。差距在於 GeekLink 專為字幕打造的四點:自動字幕行識別、為字幕精調的識別、速度,以及零模型安裝。
| 能力 | GeekLink | Subtitle Edit Video OCR |
|---|---|---|
| 燒錄字幕 OCR → 可編輯字幕 | 是 — 核心功能 | 是 — 較新的內建功能 |
| 找出字幕行 | 自動字幕行識別 — 每一行都能找到,包括雙行字幕裡出現較少的頂行 | 你框選一個掃描矩形;通用引擎對框內的幀做 OCR |
| 識別模型 | 為螢幕字幕文字專門精調的模型 | 通用引擎(Apple Vision / Paddle OCR / 視覺大模型) |
| 模型下載 / 安裝 | 無 — 開箱即用,模型已為你準備好 | 取決於引擎 — Paddle OCR 和視覺模型需下載(有些很大);Ollama 需單獨安裝;Apple Vision 無需下載 |
| 速度 | 在 16 GB 記憶體的 Apple M4 Mac、預設設定下,一段 30 分鐘的 1080p 英文字幕影片約 3 分鐘(約 10× 即時速度) | 因引擎差異很大;Apple Vision 較快,而準確的視覺模型引擎逐幀都很重(沒有高效能 GPU 會更慢) |
| 忽略臺標、水印、畫面文字 | 字幕行以外的內容自動過濾 | 凡是落在掃描框裡的都會被 OCR;要排除就得重新框選 |
| 平臺 | Mac 和 Windows 桌面應用 | Windows / Linux / macOS(各系統可用引擎不同) |
| 價格 | OCR 有免費額度;另有付費方案 — 最新價格詳見主頁 | 免費、開源 |
它替你找出字幕行
最大的區別是:GeekLink 把提取當成一個字幕問題,而不是一塊畫素矩形的問題。Subtitle Edit 的 Video OCR 要你先擺好掃描框,然後在每一抽樣幀上識別框裡出現的任何文字。這能用,但把判斷都壓在了你身上:框稍微緊一點,雙行字幕裡出現較少的頂行就可能被框在外面;框松一點,頻道臺標、水印或畫面圖形又會被當成字幕讀進來。
GeekLink 會先識別出真正的字幕行 — 在識別文字之前 — 並且刻意設計成寧可多檢、也不漏檢(多出來的行一鍵就能刪;從沒被捕捉到的行則是無聲的損失)。它會保住那些固定框選容易丟掉的低頻行,同時讓識別避開臺標和雜物。你不用為了防這些情況去調框;識別本身就替你處理了。
它用為字幕精調的模型來識別
GeekLink 的識別是專門針對螢幕字幕文字精調的 — 那種帶樣式、帶描邊、有時還很小、壓在動態畫面上的文字 — 而不是把通用文件 OCR 或通用視覺模型套到一幀影片上。真實字幕上的準確率正來自這種精調:花式字幕上的亂碼更少,密集的中日韓文字結果也更穩。
Subtitle Edit 的引擎在設計上就是通用的。Apple Vision 快、無需下載,但它是通用的系統 OCR,遇到花式或小號的中日韓字幕會吃力。視覺模型引擎(GLM-OCR、PaddleOCR-VL 等)確實是很強的識別器、語言覆蓋也廣 — 但它們是你對著一幀執行的通用模型,而非字幕專用的流水線,而且如下所述,它們屬於又重、又要先下載的那類。
它快得多
在 16 GB 記憶體的 Apple M4 Mac、預設設定下,GeekLink 約 3 分鐘就能提取完一段 30 分鐘、帶英文燒錄字幕的 1080p 影片 — 大約 10× 即時速度。其中一部分原因是不做重複功:一條字幕會連續停留很多幀,所以對每一抽樣幀都獨立識別,等於把同一次讀取一遍遍重複。GeekLink 會把同一條字幕的證據合併起來,並跳過畫面沒變化的幀,於是那些昂貴的識別執行的次數少得多。
Subtitle Edit 沒有公佈吞吐數字,說實話也很因引擎而異。Apple Vision 很快。但那些準確的選項 — llama.cpp 視覺模型、CrispEmbed、Ollama — 都是逐幀執行的重型視覺大模型,會很慢,尤其在沒有高效能 GPU 時。所以在 Subtitle Edit 上,你往往在選引擎那一步就得在速度和準確率之間取捨;GeekLink 想做到的是,讓你同時擁有精調準確率這條路和快速這條路。
無需下載或安裝任何東西
GeekLink 開箱即用。開始前不用選 OCR 引擎,也不用先下模型:開啟應用,指向影片,就能開跑。識別模型已經為你準備好了。
用 Subtitle Edit 的 Video OCR 時,模型安裝取決於你選的引擎。Paddle OCR 在 Windows 和 Linux 上自動下載;視覺模型引擎要下一個引擎外加一個模型(有些很大);Ollama 得你自己單獨安裝管理。在 macOS 上,Apple Vision 是唯一無需下載的路徑 — 但它也是最通用的識別器,所以遇到更難、更花、或中日韓字幕,你又會被推向那些要先下載的視覺模型去把質量提上來。GeekLink 乾脆沒有這個岔路:一條路、已精調、無需下載。
什麼時候 Subtitle Edit 更合適?
很多時候都合適。Subtitle Edit 是一款出色的免費開源字幕編輯器,它的 OCR 是實打實的加分項:
你本來就在 Subtitle Edit 裡編輯。如果你的字幕就在 Subtitle Edit 裡做時間軸和校對,那在同一個窗口裡做 OCR — 再就地編輯識別出的行 — 既方便又不花錢。
你就是要免費且開源,沒別的。Subtitle Edit 免費又開放。如果價格和開源比速度、比省心安裝更重要,它是個很好的答案。
你想指定某個特定的 OCR 引擎。Subtitle Edit 讓你在多個引擎間選擇,如果你有理由偏好某個視覺模型(或雲端引擎),也能換上。
兩者也不是非此即彼:一種常見做法是先在 GeekLink 裡快速、省心地提取,再把結果拿進 Subtitle Edit 做細緻的時間軸。工具不同,各有所長。
常見問題
Subtitle Edit 有針對燒錄字幕的 OCR 嗎?
有。Subtitle Edit 最近新增了 Video OCR 功能(Video → OCR burned-in subtitle…),能把影片裡的硬字幕提取成可編輯的行。你框選一個掃描矩形,選好 OCR 引擎和語言,然後開始 OCR。GeekLink 做的是同一件事,但它自動識別字幕行、並使用為字幕精調的模型,所以既不用調框,也不用下載引擎或模型。
OCR 誰更快,GeekLink 還是 Subtitle Edit?
這取決於 Subtitle Edit 用的引擎。Apple Vision 快;更準確的視覺模型引擎(llama.cpp 搭配 GLM-OCR 或 PaddleOCR-VL、CrispEmbed、Ollama)逐幀都很重,沒有高效能 GPU 會很慢。GeekLink 在 16 GB 記憶體的 Apple M4 Mac 上約 3 分鐘提取完一段 30 分鐘的 1080p 英文字幕影片(約 10x 即時速度),部分原因是它會合並重復幀、跳過沒變化的幀,而不是把每一幀都重讀一遍。
用 Subtitle Edit 的 Video OCR 需要下載模型嗎?
大多數引擎都需要。Paddle OCR 在 Windows 和 Linux 上自動下載,視覺模型引擎要下一個引擎外加一個模型(有些很大);Ollama 需單獨安裝。在 macOS 上,Apple Vision 無需下載,但它是通用識別器。GeekLink 自帶已準備好的識別模型,所以開始前既不用選、也不用下。
為什麼 GeekLink 漏的字幕行更少?
Subtitle Edit 會對你框選的掃描矩形裡出現的任何文字做 OCR,所以框稍緊就可能丟掉雙行字幕裡出現較少的頂行,框鬆了又會把臺標或畫面文字讀進來。GeekLink 自動識別字幕行,並且設計成寧可多檢、也不漏檢 — 多餘的行一鍵刪掉,但沒有一行會被無聲丟掉 — 同時讓識別避開水印和雜物。
Subtitle Edit 的 Video OCR 準嗎?
可以很準,尤其是視覺模型引擎,它們是覆蓋多語言的強通用識別器。代價是:快的那個(Apple Vision)是通用 OCR,遇到花式或小號中日韓字幕會吃力;而準的那些是逐幀執行的重型下載項。GeekLink 用的是專門針對螢幕字幕文字精調的模型,目標是在不犧牲速度和安裝便利的前提下拿到那種準確率。
兩個能一起用嗎?
能。一種常見做法是:先在 GeekLink 裡無需安裝地快速提取燒錄字幕,再把結果在 Subtitle Edit 裡開啟做細緻的時間軸和校對。兩者互補 — GeekLink 負責快速、省心的提取;Subtitle Edit 提供免費、深度的編輯環境。