太長不看:字幕擷取能自動化到什麼程度,取決於你手上是三種字幕類型中的哪一種。MKV/MP4 檔案裡的可開關字幕軌道,一條 ffmpeg 指令即可——完全可腳本化。完全沒有字幕的影片交給語音辨識:Whisper 可以從命令列本機執行,或者 GeekLink 的監看資料夾會自動轉錄並翻譯每一個被丟進資料夾的影片,無需逐個檔案點擊。燒錄字幕(文字被烤進像素裡)是抗拒腳本化的那一步——macOS 上沒有成熟、有人維護的開源 OCR 流水線來做這件事——而 GeekLink 的批次 OCR(每次執行 50 多個影片,完全本機)正好填補了這個空缺。 每條路徑都輸出標準 SRT,這是任何下游腳本、編輯器或 AI 代理都能消費的通用介面。
2026 年,人們為什麼要自動化字幕擷取?
字幕擷取過去是一次性的活兒:開啟一個 App、載入影片、點一通。到了 2026 年,它越來越是一條更大工作流程裡的一個步驟。創作者把整個舊內容庫改造成新語言。語言學習者把內容餵給 subs2srs 之類的句子挖掘工具。團隊把 AI 編程代理——Claude Code 及類似工具——接起來,端到端編排影片流水線:下載、擷取字幕、翻譯、品管、發布。
一旦字幕擷取從一次性任務變成流水線中的一步,問題就變了:它能無人值守執行嗎?能批次執行嗎?腳本或 AI 代理能觸發它並接住輸出嗎? 本文針對每種字幕類型如實回答這三個問題——包括那些答案是「單靠腳本做不到」的部分。
有一條約束貫穿下面的一切:流水線保持本機。雲端字幕 API 是存在的,但對於要處理數小時素材的創作者,它們按分鐘計費,還要求上傳源影片——對於未發布或客戶素材來說是行不通的。本文裡的一切都在你自己的 Mac 上執行,任何影片都不上傳。
哪些字幕類型可以自動擷取?
每個影片都屬於三種情況之一,而每種情況的自動化路數完全不同:
- 可開關字幕(內嵌軌道)——容器內部一條獨立的文字軌道(在 MKV 裡常見,部分 MP4 也有)。文字已經以資料的形式存在。擷取輕而易舉,100% 可腳本化。
- 沒有字幕——影片只有音訊。你需要語音辨識。本機高度可自動化,但有品質方面的注意事項。
- 燒錄字幕(硬字幕)——文字是畫面的一部分,在動畫擷取、中韓綜藝、TikTok/Reels 搬運和較早的廣播素材裡常見。原始文字資料已經沒了;你需要對影片畫面幀做 OCR。這就是抗拒 DIY 腳本化的那一步。
一條實用的經驗法則:如果你能在播放器裡把字幕關掉,一條指令就能擷取;如果你能聽到語音但看不到字幕,本機語音辨識能搞定;如果字幕是畫面的一部分,你就需要一個專門的 OCR 工具。 如果你不確定自己屬於哪種情況,我們的 內嵌字幕與燒錄字幕指南 教你十秒分辨。
怎麼自動擷取可開關字幕軌道?
這是簡單的情況,你不需要任何特殊工具。ffmpeg(免費,可透過 Homebrew 安裝)一條指令就能擷取一條字幕軌道:
ffmpeg -i input.mkv -map 0:s:0 output.srt
它取第一條字幕串流(0:s:0)並寫成 SRT。把它套進一個 shell 迴圈,你就有了對整個資料夾的批次擷取。任何 AI 編程代理都能替你寫好並執行它——擷取可開關字幕軌道是一個已解決、完全可腳本化的問題,不需要任何付費軟體。
有兩點注意事項值得了解。第一,DVD 和藍光字幕軌道(VobSub/PGS)是以圖像而非文字儲存的——單靠 -map 無法把它們轉成 SRT;它們同樣需要 OCR。第二,很多檔案有多條不同語言的軌道,所以在挑選索引之前先用 ffprobe 把它們列出來。我們關於 MKV 和 MP4 的指南講了這些細節。
在 Mac 上怎麼自動化語音轉字幕的轉錄?
當完全沒有字幕資料時,語音辨識來產生它。在 Mac 上有兩條本機自動化路徑。
路徑 1:直接腳本化 Whisper
OpenAI 的 Whisper 是開源的,可從命令列執行:whisper video.mp4 --model small --output_format srt。它確實可腳本化,而且如果你已經在用 AI 代理驅動 Mac,讓它對一個影片資料夾編排 Whisper 是可行的。缺口出現在轉錄之後:Whisper 的原始輸出沒有翻譯步驟,沒有把結果與影片對照的視覺化檢查,而且不看完全片就沒法知道它哪些行錯了。
路徑 2:監看資料夾自動化(無需腳本)
GeekLink 的監看資料夾功能是同一套自動化的無程式碼版本。你只需讓 GeekLink 指向一個資料夾一次,選好辨識和翻譯設定,之後被丟進那個資料夾的每一個影片都會自動匯入、轉錄並翻譯——無需逐個檔案點擊,也沒有腳本要維護。 一個下載器、一個 AI 代理,或者一個人都可以給資料夾投餵;剩下的交給 App。
這對自動化很重要,因為一個被監看的資料夾本身就是一個整合點。任何能移動檔案的東西——一個 yt-dlp 腳本、一條 Hazel 規則、一個代理、一個網路共享——都能觸發處理,而無需 GeekLink 暴露 API。辨識透過 Whisper 涵蓋 49 種語言,翻譯則用你選擇的模型(Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek)涵蓋 40 多種語言,所以這個資料夾可以輸出雙語字幕,而不只是轉錄稿。
為什麼燒錄字幕擷取是最難自動化的一步?
這是本文最坦誠的部分。如果你的影片有烤進像素裡的字幕,那套在其他地方都管用的「直接腳本化就行」的路子就失靈了。截至 2026 年,macOS 上沒有成熟、有人維護的開源流水線能可靠地把燒錄字幕變成帶時間軸的 SRT——這個領域的開源 OCR 專案要麼面向 Windows、要麼依賴 GPU、要麼無人維護。(我們在 燒錄字幕擷取工具橫評 裡對整個格局做了比較。)
一個週末腳本做不到的原因:影片 OCR 不是「截圖加文字辨識」。一個每秒取樣一個影格並做 OCR 的樸素腳本會同時撞上四堵牆:
- 時間軸精度。 每秒取樣意味著每一行字幕的起訖時間可能偏差多達一秒——一對上語音立刻就能察覺。
- 去重。 一條在螢幕上停留三秒的字幕會出現在幾十張取樣影格裡,每張 OCR 的結果都略有不同。把它們合併成一條乾淨、時長正確的行,才是真正的難題。
- 字幕與其他一切。 浮水印、頻道台標、畫面圖形和歌詞在 OCR 引擎看來都像文字。不知道真正的字幕在哪裡,輸出就會塞滿垃圾行。
- 中日韓準確率。 中文、日文和韓文字幕——最可能被燒錄的語言——恰恰是通用 OCR 準確率下滑最厲害的地方。
GeekLink 的批次 OCR 正是圍繞這四堵牆打造的。你在第一個影片上框選字幕區域——一個一次性、十秒的步驟,告訴引擎字幕在哪裡、要忽略什麼——剩下的就無人值守地跑完。一次執行在你的 Mac 上連續處理 50 多個影片,每個影片都產出一份帶時間軸的 SRT,並附帶逐行信賴度,讓你看清哪些要複核。 完整流程在我們的 燒錄字幕 OCR 指南 裡。
一款沒有 API 的 Mac App 怎麼融入自動化工作流程?
任何在搭建代理驅動流水線的人都會有一個合理的疑問:GeekLink 是一款 Mac App,不是命令列工具——那它怎麼和腳本組合?
它的整合契約就是檔案系統:檔案進入一個資料夾,標準 SRT 檔案出來,中間的一切都無人值守地執行。 具體來說:
- 輸入側: 監看資料夾接受任何落進去的東西(用於語音辨識和翻譯),批次匯入則一次接受一整個資料夾(用於 OCR 及其他一切)。
- 輸出側: 匯出為標準 SRT(也有 TXT 文字稿和燒錄字幕的影片)。SRT 是純文字,格式穩定、有幾十年歷史——任何下游的腳本、編輯器、翻譯步驟或 AI 代理都能解析它。沒有需要解鎖的專有專案檔案。
坦白講講侷限:GeekLink 目前沒有公開的命令列介面或 HTTP API。 基於資料夾的自動化已經涵蓋了個人創作者和小團隊實際會用的無人值守批次場景;如果程式化控制對你的工作流程很重要,來 GeekLink Discord 告訴我們——聽到真實的工作流程正是我們排優先順序的依據。
一條完整的本機字幕流水線長什麼樣?
把各個部分拼起來,這裡有一條能處理任意混合影片、完全在本機執行的流水線:
- 按字幕類型分揀。 檢查每個檔案:播放器顯示的是字幕軌道(可開關)、可見的烤入文字(燒錄),還是兩者都沒有(語音)?代理可以用
ffprobe自動做第一項檢查;另外兩項瞄兩秒就行。 - 可開關軌道 → ffmpeg。 每個檔案一條腳本指令,搞定。
- 沒有字幕 → 監看資料夾。 把檔案丟進去;辨識和翻譯無人值守地執行,用你選定的源語言和目標語言。
- 燒錄字幕 → GeekLink 批次 OCR。 匯入這一批,框選一次字幕框,執行。每趟 50 多個影片。
- 收集 SRT 輸出。 三條路徑都匯聚到帶時間軸的 SRT 檔案,隨時可進入下一步——翻譯、編輯、句子挖掘、重新嵌入或發布。
設計原則:靠把每個影片路由到正確的擷取器來實現自動化,而不是逼一個工具做所有事。 ffmpeg 在軌道擷取上無可匹敵;基於 Whisper 的辨識處理語音;專門的 OCR 處理燒錄文字。而 SRT 格式正是讓它們能組合起來的東西。
自動化在哪些環節仍需人工?
一條無人值守的流水線會產出字幕;它不保證字幕是對的。人名、行話、重疊的說話聲,以及一切蓋在響亮音樂下的內容,都是辨識錯誤扎堆的地方——而一條全自動流水線會樂呵呵地把這些錯誤傳播進你的譯文和已發布的影片裡。
可擴展的解法不是讀每一行——而是讓流水線標出哪些行可能錯了,這樣人工審校的環節就從整篇文字稿縮小成一份短名單。 GeekLink 讀取辨識器的逐字信賴度,標出每一行裡信賴度最低的詞,外加被音樂覆蓋的片段,然後匯出一個供免費的 Subtitle Edit 使用的審校包。端到端的審校流程在 找出 AI 弄錯的字幕行 裡有講。
預算方面,上面這條自動化流水線可以在 GeekLink 的免費版上試用;完整批次使用為每年 99 美元(約每月 8.25 美元)或終身 169 美元,兩者都含 100 萬 AI 翻譯額度。要求:搭載 Apple Silicon(M1–M4)的 macOS 13.0 及以上。
常見問題
我能在 Mac 上自動從影片擷取字幕嗎?
能,但方法取決於字幕類型。可開關字幕軌道用一條免費的 ffmpeg 指令即可擷取。沒有字幕的影片需要本機語音辨識(可腳本化的 Whisper,或 GeekLink 的監看資料夾作為帶翻譯的無程式碼版本)。燒錄字幕需要專門的 OCR——GeekLink 在本機每次執行批次處理 50 多個影片。
像 Claude Code 這樣的 AI 代理能從影片擷取字幕嗎?
部分能。一個 AI 編程代理可以腳本化 ffmpeg 來抽取可開關字幕軌道,並執行 Whisper 做語音轉文字——兩者都是它能很好驅動的命令列工具。代理在 Mac 上無法可靠腳本化的是燒錄字幕 OCR,因為沒有有人維護的開源流水線來做這件事。務實的分工:讓代理處理軌道和語音,把燒錄字幕的影片透過一個共享資料夾路由到批次 OCR 工具。
GeekLink 有用於自動化的命令列或 API 嗎?
沒有——GeekLink 目前沒有公開的命令列介面或 API。它的自動化模型是基於資料夾的:監看資料夾會自動轉錄並翻譯任何丟進去的影片,批次匯入每次 OCR 執行處理 50 多個影片,所有輸出都是腳本能接住的標準 SRT。如果你的工作流程需要程式化控制,來 Discord 告訴我們——真實用例驅動我們的路線圖。
我怎麼從很多影片裡批次擷取燒錄字幕?
用批次 OCR 工具,而不是逐個檔案寫腳本。在 GeekLink 裡你匯入整個資料夾,框選一次字幕區域,然後這一批就在你的 Mac 上無人值守地執行——每趟 50 多個影片,每個都匯出為帶時間軸的 SRT,並附帶逐行信賴度供審校。
自動化字幕擷取是私密的嗎?我的影片會被上傳嗎?
本文裡的流水線是本機的:ffmpeg、Whisper 辨識和 GeekLink 的 OCR 全部在你自己的 Mac 上執行,任何影片都不上傳到任何地方。唯一一個可選的雲端步驟是 AI 翻譯——如果你啟用它,被傳送給你選擇的翻譯模型(Claude 3.5 Haiku、GPT-4o、GPT-4o mini 或 DeepSeek)的是字幕文字(不是影片)。
自動化字幕流水線應該用什麼輸出格式?
SRT。它是純文字,幾乎被每一個編輯器、播放器、平台和翻譯工具支援,腳本和 AI 代理解析起來也毫不費力。不管你用哪個擷取器,都匯聚到帶時間軸的 SRT 作為交換格式;只在最後一步、如有需要時再轉成特定平台的格式(VTT、ASS)。
揭露:GeekLink 是我們自己的 Mac App;這裡描述的監看資料夾、批次 OCR、信賴度標記和翻譯功能都是 GeekLink 的功能。ffmpeg 和 Whisper 是獨立的開源專案,與我們沒有關聯,是憑其自身價值推薦的。