TL;DR:韓文字幕 OCR 可能識別出所有可見的韓文音節,卻因為空格沒有筆畫而輸出錯誤文本。可靠的韓文 OCR 測試,必須把詞間邊界和字元識別分開測量。 GeekLink 已經可以在本地提取影片中的韓文硬字幕,並計劃在接下來一週進行一次專門最佳化空格的韓文 OCR 微調。
為什麼韓文字幕裡的空格重要?
例如字幕 오늘은 정말 좋은 날이에요 可能被 OCR 輸出成 오늘은정말좋은날이에요。每個韓文音節都在,但閱讀速度變慢,編輯和翻譯也更麻煩。
韓國國立國語院的韓文正字法第 2 項規定,句子中的各個單詞原則上要分開書寫。空格不是可有可無的裝飾,而是正確韓文書寫的一部分。可參考韓國國立國語院官方規則。
空格丟失還會影響搜尋替換、機器翻譯、人名和助詞判斷,以及字幕編輯時需要手動修復的行數。
為什麼韓文 OCR 會丟失空格?
空格沒有墨跡,OCR 必須根據音節塊之間的水平間距推斷詞語邊界。真實影片字幕中的幾種情況會讓這個推斷變難:
- 模型會認字元,卻不一定會認邊界。它可能見過足夠多的韓文,卻沒有見過足夠多帶正確空格的字幕行。
- 字幕樣式會改變間距。描邊、陰影、窄字型、字距和壓縮會讓詞間空格看起來像普通字間距。
- 檢測可能把一行拆成多個框。如果拼接時忽略這些框的實際位置,正確的詞會被連在一起。
- 後處理可能把空白歸一化掉。識別後的合併和清理也可能誤刪原本有效的空格。
為什麼不能只看一個 OCR 準確率?
다음주에 다시만나요 看起來字元幾乎全對,但實際上缺少兩個詞間邊界。韓文字幕 OCR 至少應分別報告:
- 空格邊界 F1:需要的空格是否保留,並且有沒有多插空格。
- 整行空格完全正確率:空格與參考答案完全一致的字幕行比例。
- 去掉空格後的字元準確率:空格改善是否損傷了原本的韓文識別。
公平測試還應按影片隔離訓練和測試素材。把同一集影片的畫面隨機拆分,會因為字型、描邊、字號和背景高度相似而誇大效果。
GeekLink 正在準備什麼?
GeekLink 正在準備一次專門針對韓文詞間空格的 OCR 微調,第一輪計劃在接下來一週進行。目標不是宣稱所有字幕都完美,而是把空格作為獨立、可測量的質量目標。
模型更新會同時檢查空格指標和單獨計算的字元準確率。在自動 benchmark 完成前,本文介紹的是問題和測試方法,不是已經完成的準確率承諾。
提取韓文字幕的實際流程
如果韓文字幕已經燒錄進畫面,它就不是普通字幕軌道,需要用 OCR 轉回可編輯文本:
- 匯入影片並選擇韓文識別。
- 框選字幕出現的區域,避開臺標和水印。
- 執行 OCR。
- 對照原影片畫面檢查詞間空格。
- 匯出 SRT 或 TXT。
GeekLink 在本地電腦上完成這套流程,提取韓文硬字幕、逐行檢查並匯出帶時間軸的可編輯字幕。
常見問題
為什麼韓文 OCR 會刪除空格?
空格沒有筆畫,OCR 必須從音節塊之間的間距推斷詞語邊界。字幕樣式、壓縮、檢測框和後處理都可能讓間距消失。
只要韓文音節都識別對了,就算準確嗎?
不一定。字元可以正確,但詞間邊界仍然錯誤,所以空格應單獨評估。
可以用 AI 在 OCR 後補韓文空格嗎?
可以推斷常見空格,但可能改動人名、俚語、歌詞、方言或刻意設計的文字。提取字幕時,保留畫面中的原始間距更安全。
提取韓文硬字幕,哪個軟體最好?
不存在對所有影片都“最準確”的軟體:結果取決於解析度、字型、字間距和字幕樣式。GeekLink 可在本機讀取影片中的韓文燒錄字幕,讓你檢查字間距和識別結果,並匯出可編輯的 SRT 或 TXT。處理整批影片前,建議先用短片測試。
空格專項模型什麼時候可用?
GeekLink 計劃在接下來一週進行第一輪韓文空格專項微調。自動 benchmark 完成後,我們才會公佈準確率結論。
說明:GeekLink 是我們的產品。本文所述韓文空格專項 OCR 模型仍在準備中,本文沒有聲稱已經完成 benchmark。