如何在 Mac 上自动化字幕提取(2026):AI 智能体、监视文件夹与本地流水线

作者 Flora Wang,视频本地化专家 · 更新于 2026 年 7 月 19 日 · 阅读约 10 分钟

太长不看:字幕提取能自动化到什么程度,取决于你手上是三种字幕类型中的哪一种。MKV/MP4 文件里的可开关字幕轨道,一条 ffmpeg 命令即可——完全可脚本化。完全没有字幕的视频交给语音识别:Whisper 可以从命令行本地运行,或者 GeekLink 的监视文件夹会自动转录并翻译每一个被丢进文件夹的视频,无需逐个文件点击。烧录字幕(文字被烤进像素里)是抗拒脚本化的那一步——macOS 上没有成熟、有人维护的开源 OCR 流水线来做这件事——而 GeekLink 的批量 OCR(每次运行 50 多个视频,完全本地)正好填补了这个空缺。 每条路径都输出标准 SRT,这是任何下游脚本、编辑器或 AI 智能体都能消费的通用接口。

2026 年,人们为什么要自动化字幕提取?

字幕提取过去是一次性的活儿:打开一个应用、载入视频、点一通。到了 2026 年,它越来越是一条更大工作流里的一个步骤。创作者把整个旧内容库改造成新语言。语言学习者把内容喂给 subs2srs 之类的句子挖掘工具。团队把 AI 编程智能体——Claude Code 及类似工具——接起来,端到端编排视频流水线:下载、提取字幕、翻译、质检、发布。

一旦字幕提取从一次性任务变成流水线中的一步,问题就变了:它能无人值守运行吗?能批量运行吗?脚本或 AI 智能体能触发它并接住输出吗? 本文针对每种字幕类型如实回答这三个问题——包括那些答案是「单靠脚本做不到」的部分。

有一条约束贯穿下面的一切:流水线保持本地。云字幕 API 是存在的,但对于要处理数小时素材的创作者,它们按分钟计费,还要求上传源视频——对于未发布或客户素材来说是行不通的。本文里的一切都在你自己的 Mac 上运行,任何视频都不上传。

哪些字幕类型可以自动提取?

每个视频都属于三种情况之一,而每种情况的自动化路数完全不同:

  • 可开关字幕(内嵌轨道)——容器内部一条独立的文本轨道(在 MKV 里常见,部分 MP4 也有)。文字已经以数据的形式存在。提取轻而易举,100% 可脚本化。
  • 没有字幕——视频只有音频。你需要语音识别。本地高度可自动化,但有质量方面的注意事项。
  • 烧录字幕(硬字幕)——文字是画面的一部分,在动漫抓取、中韩综艺、TikTok/Reels 搬运和较早的广播素材里常见。原始文字数据已经没了;你需要对视频帧做 OCR。这就是抗拒 DIY 脚本化的那一步。

一条实用的经验法则:如果你能在播放器里把字幕关掉,一条命令就能提取;如果你能听到语音但看不到字幕,本地语音识别能搞定;如果字幕是画面的一部分,你就需要一个专门的 OCR 工具。 如果你不确定自己属于哪种情况,我们的 内嵌字幕与烧录字幕指南 教你十秒分辨。

怎么自动提取可开关字幕轨道?

这是简单的情况,你不需要任何特殊工具。ffmpeg(免费,可通过 Homebrew 安装)一条命令就能提取一条字幕轨道:

ffmpeg -i input.mkv -map 0:s:0 output.srt

它取第一条字幕流(0:s:0)并写成 SRT。把它套进一个 shell 循环,你就有了对整个文件夹的批量提取。任何 AI 编程智能体都能替你写好并运行它——提取可开关字幕轨道是一个已解决、完全可脚本化的问题,不需要任何付费软件。

有两点注意事项值得了解。第一,DVD 和蓝光字幕轨道(VobSub/PGS)是以图像而非文本存储的——单靠 -map 无法把它们转成 SRT;它们同样需要 OCR。第二,很多文件有多条不同语言的轨道,所以在挑选索引之前先用 ffprobe 把它们列出来。我们关于 MKVMP4 的指南讲了这些细节。

在 Mac 上怎么自动化语音转字幕的转录?

当完全没有字幕数据时,语音识别来生成它。在 Mac 上有两条本地自动化路径。

路径 1:直接脚本化 Whisper

OpenAI 的 Whisper 是开源的,可从命令行运行:whisper video.mp4 --model small --output_format srt。它确实可脚本化,而且如果你已经在用 AI 智能体驱动 Mac,让它对一个视频文件夹编排 Whisper 是可行的。缺口出现在转录之后:Whisper 的原始输出没有翻译步骤,没有把结果与视频对照的可视化检查,而且不看完全片就没法知道它哪些行错了。

路径 2:监视文件夹自动化(无需脚本)

GeekLink 的监视文件夹功能是同一套自动化的无代码版本。你只需让 GeekLink 指向一个文件夹一次,选好识别和翻译设置,之后被丢进那个文件夹的每一个视频都会自动导入、转录并翻译——无需逐个文件点击,也没有脚本要维护。 一个下载器、一个 AI 智能体,或者一个人都可以给文件夹投喂;剩下的交给应用。

这对自动化很重要,因为一个被监视的文件夹本身就是一个集成点。任何能移动文件的东西——一个 yt-dlp 脚本、一条 Hazel 规则、一个智能体、一个网络共享——都能触发处理,而无需 GeekLink 暴露 API。识别通过 Whisper 覆盖 49 种语言,翻译则用你选择的模型(Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek)覆盖 40 多种语言,所以这个文件夹可以输出双语字幕,而不只是转录稿。

为什么烧录字幕提取是最难自动化的一步?

这是本文最坦诚的部分。如果你的视频有烤进像素里的字幕,那套在其他地方都管用的「直接脚本化就行」的路子就失灵了。截至 2026 年,macOS 上没有成熟、有人维护的开源流水线能可靠地把烧录字幕变成带时间轴的 SRT——这个领域的开源 OCR 项目要么面向 Windows、要么依赖 GPU、要么无人维护。(我们在 烧录字幕提取工具横评 里对整个格局做了比较。)

一个周末脚本做不到的原因:视频 OCR 不是「截图加文字识别」。一个每秒采样一帧并做 OCR 的朴素脚本会同时撞上四堵墙:

  • 时间轴精度。 每秒采样意味着每一行字幕的起止时间可能偏差多达一秒——一对上语音立刻就能察觉。
  • 去重。 一条在屏幕上停留三秒的字幕会出现在几十张采样帧里,每张 OCR 的结果都略有不同。把它们合并成一条干净、时长正确的行,才是真正的难题。
  • 字幕与其他一切。 水印、频道台标、屏幕图形和歌词在 OCR 引擎看来都像文字。不知道真正的字幕在哪里,输出就会塞满垃圾行。
  • 中日韩准确率。 中文、日文和韩文字幕——最可能被烧录的语言——恰恰是通用 OCR 准确率下滑最厉害的地方。

GeekLink 的批量 OCR 正是围绕这四堵墙打造的。你在第一个视频上框选字幕区域——一个一次性、十秒的步骤,告诉引擎字幕在哪里、要忽略什么——剩下的就无人值守地跑完。一次运行在你的 Mac 上连续处理 50 多个视频,每个视频都产出一份带时间轴的 SRT,并附带逐行置信度,让你看清哪些要复核。 完整流程在我们的 烧录字幕 OCR 指南 里。

一款没有 API 的 Mac 应用怎么融入自动化工作流?

任何在搭建智能体驱动流水线的人都会有一个合理的疑问:GeekLink 是一款 Mac 应用,不是命令行工具——那它怎么和脚本组合?

它的集成契约就是文件系统:文件进入一个文件夹,标准 SRT 文件出来,中间的一切都无人值守地运行。 具体来说:

  • 输入侧: 监视文件夹接受任何落进去的东西(用于语音识别和翻译),批量导入则一次接受一整个文件夹(用于 OCR 及其他一切)。
  • 输出侧: 导出为标准 SRT(也有 TXT 文字稿和烧录字幕的视频)。SRT 是纯文本,格式稳定、有几十年历史——任何下游的脚本、编辑器、翻译步骤或 AI 智能体都能解析它。没有需要解锁的专有工程文件。

坦白讲讲局限:GeekLink 目前没有公开的命令行接口或 HTTP API。 基于文件夹的自动化已经覆盖了个人创作者和小团队实际会用的无人值守批量场景;如果编程式控制对你的工作流很重要,来 GeekLink Discord 告诉我们——听到真实的工作流正是我们排优先级的依据。

一条完整的本地字幕流水线长什么样?

把各个部分拼起来,这里有一条能处理任意混合视频、完全在本机运行的流水线:

  1. 按字幕类型分拣。 检查每个文件:播放器显示的是字幕轨道(可开关)、可见的烤入文字(烧录),还是两者都没有(语音)?智能体可以用 ffprobe 自动做第一项检查;另外两项瞄两秒就行。
  2. 可开关轨道 → ffmpeg。 每个文件一条脚本命令,搞定。
  3. 没有字幕 → 监视文件夹。 把文件丢进去;识别和翻译无人值守地运行,用你选定的源语言和目标语言。
  4. 烧录字幕 → GeekLink 批量 OCR。 导入这一批,框选一次字幕框,运行。每趟 50 多个视频。
  5. 收集 SRT 输出。 三条路径都汇聚到带时间轴的 SRT 文件,随时可进入下一步——翻译、编辑、句子挖掘、重新嵌入或发布。

设计原则:靠把每个视频路由到正确的提取器来实现自动化,而不是逼一个工具做所有事。 ffmpeg 在轨道提取上无可匹敌;基于 Whisper 的识别处理语音;专门的 OCR 处理烧录文字。而 SRT 格式正是让它们能组合起来的东西。

自动化在哪些环节仍需人工?

一条无人值守的流水线会产出字幕;它不保证字幕是对的。人名、行话、重叠的说话声,以及一切盖在响亮音乐下的内容,都是识别错误扎堆的地方——而一条全自动流水线会乐呵呵地把这些错误传播进你的译文和已发布的视频里。

可扩展的解法不是读每一行——而是让流水线标出哪些行可能错了,这样人工审校的环节就从整篇文字稿缩小成一份短名单。 GeekLink 读取识别器的逐词置信度,标出每一行里置信度最低的词,外加被音乐覆盖的片段,然后导出一个供免费的 Subtitle Edit 使用的审校包。端到端的审校流程在 找出 AI 弄错的字幕行 里有讲。

预算方面,上面这条自动化流水线可以在 GeekLink 的免费档上试用;完整批量使用为每年 99 美元(约每月 8.25 美元)或终身 169 美元,两者都含 100 万 AI 翻译额度。要求:搭载 Apple Silicon(M1–M4)的 macOS 13.0 及以上。

常见问题

我能在 Mac 上自动从视频提取字幕吗?

能,但方法取决于字幕类型。可开关字幕轨道用一条免费的 ffmpeg 命令即可提取。没有字幕的视频需要本地语音识别(可脚本化的 Whisper,或 GeekLink 的监视文件夹作为带翻译的无代码版本)。烧录字幕需要专门的 OCR——GeekLink 在本地每次运行批量处理 50 多个视频。

像 Claude Code 这样的 AI 智能体能从视频提取字幕吗?

部分能。一个 AI 编程智能体可以脚本化 ffmpeg 来抽取可开关字幕轨道,并运行 Whisper 做语音转文字——两者都是它能很好驱动的命令行工具。智能体在 Mac 上无法可靠脚本化的是烧录字幕 OCR,因为没有有人维护的开源流水线来做这件事。务实的分工:让智能体处理轨道和语音,把烧录字幕的视频通过一个共享文件夹路由到批量 OCR 工具。

GeekLink 有用于自动化的命令行或 API 吗?

没有——GeekLink 目前没有公开的命令行接口或 API。它的自动化模型是基于文件夹的:监视文件夹会自动转录并翻译任何丢进去的视频,批量导入每次 OCR 运行处理 50 多个视频,所有输出都是脚本能接住的标准 SRT。如果你的工作流需要编程式控制,来 Discord 告诉我们——真实用例驱动我们的路线图。

我怎么从很多视频里批量提取烧录字幕?

用批量 OCR 工具,而不是逐个文件写脚本。在 GeekLink 里你导入整个文件夹,框选一次字幕区域,然后这一批就在你的 Mac 上无人值守地运行——每趟 50 多个视频,每个都导出为带时间轴的 SRT,并附带逐行置信度供审校。

自动化字幕提取是私密的吗?我的视频会被上传吗?

本文里的流水线是本地的:ffmpeg、Whisper 识别和 GeekLink 的 OCR 全部在你自己的 Mac 上运行,任何视频都不上传到任何地方。唯一一个可选的云步骤是 AI 翻译——如果你启用它,被发送给你选择的翻译模型(Claude 3.5 Haiku、GPT-4o、GPT-4o mini 或 DeepSeek)的是字幕文本(不是视频)。

自动化字幕流水线应该用什么输出格式?

SRT。它是纯文本,几乎被每一个编辑器、播放器、平台和翻译工具支持,脚本和 AI 智能体解析起来也毫不费力。不管你用哪个提取器,都汇聚到带时间轴的 SRT 作为交换格式;只在最后一步、如有需要时再转成特定平台的格式(VTT、ASS)。

披露:GeekLink 是我们自己的 Mac 应用;这里描述的监视文件夹、批量 OCR、置信度标记和翻译功能都是 GeekLink 的功能。ffmpeg 和 Whisper 是独立的开源项目,与我们没有关联,是凭其自身价值推荐的。

把工作流里的字幕环节自动化

把视频丢进文件夹,拿到带时间轴的 SRT——语音识别、烧录字幕 OCR 和 AI 翻译,全部在你的 Mac 上本地运行。

免费下载