TL;DR:韩文字幕 OCR 可能识别出所有可见的韩文音节,却因为空格没有笔画而输出错误文本。可靠的韩文 OCR 测试,必须把词间边界和字符识别分开测量。 GeekLink 已经可以在本地提取视频中的韩文硬字幕,并计划在接下来一周进行一次专门优化空格的韩文 OCR 微调。
为什么韩文字幕里的空格重要?
例如字幕 오늘은 정말 좋은 날이에요 可能被 OCR 输出成 오늘은정말좋은날이에요。每个韩文音节都在,但阅读速度变慢,编辑和翻译也更麻烦。
韩国国立国语院的韩文正字法第 2 项规定,句子中的各个单词原则上要分开书写。空格不是可有可无的装饰,而是正确韩文书写的一部分。可参考韩国国立国语院官方规则。
空格丢失还会影响搜索替换、机器翻译、人名和助词判断,以及字幕编辑时需要手动修复的行数。
为什么韩文 OCR 会丢失空格?
空格没有墨迹,OCR 必须根据音节块之间的水平间距推断词语边界。真实视频字幕中的几种情况会让这个推断变难:
- 模型会认字符,却不一定会认边界。它可能见过足够多的韩文,却没有见过足够多带正确空格的字幕行。
- 字幕样式会改变间距。描边、阴影、窄字体、字距和压缩会让词间空格看起来像普通字间距。
- 检测可能把一行拆成多个框。如果拼接时忽略这些框的实际位置,正确的词会被连在一起。
- 后处理可能把空白归一化掉。识别后的合并和清理也可能误删原本有效的空格。
为什么不能只看一个 OCR 准确率?
다음주에 다시만나요 看起来字符几乎全对,但实际上缺少两个词间边界。韩文字幕 OCR 至少应分别报告:
- 空格边界 F1:需要的空格是否保留,并且有没有多插空格。
- 整行空格完全正确率:空格与参考答案完全一致的字幕行比例。
- 去掉空格后的字符准确率:空格改善是否损伤了原本的韩文识别。
公平测试还应按视频隔离训练和测试素材。把同一集视频的画面随机拆分,会因为字体、描边、字号和背景高度相似而夸大效果。
GeekLink 正在准备什么?
GeekLink 正在准备一次专门针对韩文词间空格的 OCR 微调,第一轮计划在接下来一周进行。目标不是宣称所有字幕都完美,而是把空格作为独立、可测量的质量目标。
模型更新会同时检查空格指标和单独计算的字符准确率。在自动 benchmark 完成前,本文介绍的是问题和测试方法,不是已经完成的准确率承诺。
提取韩文字幕的实际流程
如果韩文字幕已经烧录进画面,它就不是普通字幕轨道,需要用 OCR 转回可编辑文本:
- 导入视频并选择韩文识别。
- 框选字幕出现的区域,避开台标和水印。
- 运行 OCR。
- 对照原视频画面检查词间空格。
- 导出 SRT 或 TXT。
GeekLink 在本地电脑上完成这套流程,提取韩文硬字幕、逐行检查并导出带时间轴的可编辑字幕。
常见问题
为什么韩文 OCR 会删除空格?
空格没有笔画,OCR 必须从音节块之间的间距推断词语边界。字幕样式、压缩、检测框和后处理都可能让间距消失。
只要韩文音节都识别对了,就算准确吗?
不一定。字符可以正确,但词间边界仍然错误,所以空格应单独评估。
可以用 AI 在 OCR 后补韩文空格吗?
可以推断常见空格,但可能改动人名、俚语、歌词、方言或刻意设计的文字。提取字幕时,保留画面中的原始间距更安全。
GeekLink 能从视频中提取韩文字幕吗?
可以。GeekLink 从视频画面读取韩文硬字幕,对齐时间轴,并导出可编辑的 SRT 或 TXT。小字号、复杂样式和严重压缩的字幕仍建议快速检查。
空格专项模型什么时候可用?
GeekLink 计划在接下来一周进行第一轮韩文空格专项微调。自动 benchmark 完成后,我们才会公布准确率结论。
说明:GeekLink 是我们的产品。本文所述韩文空格专项 OCR 模型仍在准备中,本文没有声称已经完成 benchmark。