TL;DR:焼き込み字幕(ハードサブ)は映像の一部なので、編集可能なテキストに戻すには OCR が必要です。ツールの本当の違いは、どれだけ環境構築が要るかと、SRT を得た後に何ができるかです。Mac や Windows なら、総合的なおすすめは GeekLink です。字幕行を自動で見つけ、ロゴやウォーターマークを除外し、Python や GPU の設定なしにローカルで1行ずつ読み取り、自信の低い数行に印を付けてくれるので、ほとんど手直し不要のきれいな SRT が得られます。翻訳や焼き込みが必要になったときも、同じアプリで対応できます。オープンソースの抽出ツール(VSE、VideOCR、VideoSubFinder + RapidVideOCR)は、主に Linux ユーザーや、NVIDIA GPU を持ち素の SRT だけが欲しい技術者向けです。以下、3つの OCR エンジンを含む全8つの選択肢を1つの表で比較します。

要点

  • 最小限の手間で最もきれいな SRT が得られるのは GeekLink です。字幕行の自動検出(手作業の切り抜き不要)、ロゴ・ウォーターマークの除外、2行・2言語字幕の行ごとの言語モデル、自信の低い行の表示。Python も conda も CUDA も不要です。
  • SRT の先まで必要なら、続けられるのは GeekLink だけです — AI 翻訳と焼き込みは同じアプリ内のオプションです。
  • オープンソースの抽出ツールは技術者向けです。VSE と VideOCR は NVIDIA GPU 前提で、CPU では遅くなります。VideOCR と VideoSubFinder には Mac 版がありません。
  • VideoSubFinder は単体では OCR をしません。テキスト化には2つ目のプログラム(RapidVideOCR や Subtitle Edit)が必要で、2つのアプリの間で画像を受け渡すことになります。
  • PaddleOCR、Tesseract、Google Lens はエンジンであって、ツールではありません。読めるのは1枚の画像だけ。字幕フレームの検出、タイミング、重複除去は字幕ツールが上に足す部分です。

オールインワンのデスクトップ作業が必要ですか? GeekLink はMacとWindowsで焼き込み字幕をローカル抽出します。枠を描いてOCRを実行すれば、タイムスタンプ付きのSRTが得られます。無料プランあり、アカウント不要。

無料ダウンロード

パート1:専用の字幕抽出ツール

この5つは、動画からハードサブ(焼き込み字幕)を取り出すために専用設計されています。主な違いは、プラットフォーム、ワークフローに要するステップ数、そして SRT を得た後に何ができるかです。

1. GeekLink — 総合1位:最小限の手作業で最もきれいに抽出(Mac・Windows)

価格: 無料プラン(OCR 抽出を含む)、Pro 月額 $12.99、年額 $99(約 $8.25/月)、または買い切りライフタイム $129
プラットフォーム: Mac(Apple Silicon)と64ビットWindows

GeekLink は、このリストのどのツールよりも少ない手作業で、そのまま使えるきれいな SRT を作れます。さらに、ネイティブの Mac アプリがあるのも GeekLink だけです。 動画を読み込むと字幕行を自動で見つけるので、手で切り抜く必要はありません。ロゴやウォーターマーク、画面上のほかの文字は字幕リストに入りません。2行字幕や2言語字幕は行ごとに処理します。各行の言語を選ぶと、それぞれ対応するモデルで読み取るので、同じフレームにある中国語の行と英語の行がどちらも正しく認識されます。OCR はローカルで実行され、エディタが自信の低い数行に印を付けるため、ファイル全体を校正する代わりに数行を確認するだけで済みます。特殊なレイアウトで自動検出が合わない場合は、字幕の枠を自分で描くこともできます。

多くの人にとっては、ここで作業は完了です。SRT を書き出せば終わりです。さらに必要なら、同じアプリで翻訳(Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek — 文脈を考慮、40以上の言語)や、動画への字幕の焼き込みもできます。

macOS版GeekLinkがロケット打ち上げ映像から2本の英語字幕行を自動検出し、他の画面上の文字と区別している画面
GeekLinkは英語動画の字幕行を個別に自動検出し、日付など他の画面上の文字を字幕リストと区別します。

優れている点:

  • 字幕行を自動で検出(手作業の切り抜き不要)。ロゴ、ウォーターマーク、画面上の文字を SRT から除外
  • 2行字幕や多言語が混在する字幕に対応し、行ごとに適した認識モデルを使用
  • 自信の低い行を表示するので、ファイル全体ではなく数行を確認するだけ
  • ネイティブ Mac アプリと Windows 版。Python、conda、NVIDIA GPU は不要。OCR は 100% ローカルで実行、バッチ処理も内蔵
  • 同じアプリのオプション機能:AI 翻訳とスタイル付き焼き込み

制約:

  • Mac・Windows対応。Linux版はなし
  • クローズドソース。AI 翻訳は有料(Pro)機能。抽出自体は無料プランに含まれる

おすすめの用途: 環境構築なしで、焼き込み字幕から正確な SRT を得たいすべての人。特に Mac ユーザー。あとで翻訳や焼き込みが必要になっても、すでに揃っています。ステップバイステップガイド:OCR でハードサブを抽出する方法。

2. Video-Subtitle-Extractor(VSE)— NVIDIA GPU 向けに調整されたオープンソース抽出ツール

価格: 無料、オープンソース(Apache 2.0)
プラットフォーム: Windows、Linux、macOS(NVIDIA GPU 向けに最適化。CPU フォールバックは遅い)

Video-Subtitle-Extractor は広く使われているオープンソースの抽出ツールで、多言語対応のローカル OCR で焼き込み字幕を SRT に抽出します。 フレームごとに字幕領域を検出し、繰り返しの行を重複除去し、Fast/Auto/Precise モードを提供します。特に中国語圏のコミュニティで強力です。

Video-Subtitle-Extractor の GUI が、アニメのフレーム内の焼き込み英語字幕行を検出し、バッチキューと認識ログを表示している
VSE が字幕行(緑の枠)を検出し、右側にバッチキュー。インターフェースは中国語優先。公式 VSE リポジトリ(Apache 2.0)のスクリーンショット。

優れている点:

  • 多言語対応、完全ローカル、API キー不要
  • 複数の動画にわたるバッチ抽出(同一解像度/領域)
  • 姉妹プロジェクト(video-subtitle-remover)で古い焼き込みテキストを消去できる

制約:

  • NVIDIA/CUDA 向け。Mac では遅い CPU 処理にフォールバックする
  • リリースビルドが動かない場合は Python/conda のセットアップが必要。パスにスペースや非 ASCII 文字を含められない
  • アプリ内エディタ、翻訳、焼き込みなし

おすすめの用途: NVIDIA GPU を持ち、無料で大量抽出をしたいテクニカルユーザー、特に中国語コンテンツ向け。詳しい比較:GeekLink vs VSE。

3. VideOCR — Windows・Linux 向けの無料ワンステップ抽出ツール

価格: 無料、オープンソース(MIT)
プラットフォーム: Windows、Linux、Docker(CPU 版 & NVIDIA GPU 版)

VideOCR は、焼き込み字幕付きの動画から完成した SRT まで、1つのプログラムで到達できる最もシンプルな無料の方法です。 動画を読み込み、字幕エリアを切り抜き、実行します。ローカルの PaddleOCR、またはハイブリッドなクラウドモードで Google Lens を使ってテキストを読み取り、タイムスタンプ付きの SRT を書き出します。

VideOCR の Windows GUI。二言語の焼き込み字幕を囲む切り抜き枠が描かれ、OCR エンジンは PaddleOCR 検出 + Google Lens 認識に設定されている
VideOCR の Windows GUI:字幕行を囲む切り抜き枠、エンジンは PaddleOCR + Google Lens ハイブリッドに設定。公式 VideOCR リポジトリ(MIT)のスクリーンショット。

優れている点:

  • 真の1ステップワークフロー:動画を入れれば SRT が出る
  • ローカル PaddleOCR モード(多言語対応)、またはより高精度な Google Lens ハイブリッドモード
  • GUI と CLI、さらに Docker イメージ、NVIDIA CUDA アクセラレーション

制約:

  • macOS ビルドなし
  • 自身のドキュメントによれば CPU では遅い。GPU 版が本当に必要
  • 結果をレビューするエディタがなく、翻訳も焼き込みもなし

おすすめの用途: 無料で手間のかからない抽出を求め、SRT が得られればそれで完了する Windows/Linux ユーザー。

4. VideoSubFinder — 2ステップワークフローのフレーム検出(OCR 機能なし)

価格: 無料、オープンソース(GPLv2)
プラットフォーム: Windows、Linux

VideoSubFinder は OCR をまったく行いませんが、問題の動画側の半分を誰よりも上手く解決します。字幕テキストのあるフレームを見つけ、正確なタイミングを記録し、背景を取り除いたクリーニング済みの画像を出力します。 その画像を OCR ツール(RapidVideOCR、Subtitle Edit、FineReader)に通してテキストを取得します。字幕制作の定番ツールです。

優れている点:

  • 優れた背景クリーニング。OCR ツールにずっと扱いやすい画像を渡せる
  • 行ごとの正確な表示/消失タイミング
  • すべての段階を検査・調整可能

制約:

  • OCR 機能を持たない。2つ目のプログラムが必要
  • macOS ビルドなし
  • ここで最も手作業の多いワークフロー。2つのアプリと、その間に画像バッチが挟まる

おすすめの用途: 最大限のコントロールと、OCR のための可能な限り最良の生画像を求める字幕制作者や完璧主義者。

5. RapidVideOCR — VideoSubFinder の出力を処理する OCR ステップ

価格: 無料、オープンソース(Apache 2.0)
プラットフォーム: Windows、Linux、macOS(Python/pip、Windows 向けにデスクトップ EXE)

RapidVideOCR は VideoSubFinder ワークフローの後半を担う専用ツールです。VideoSubFinder のクリーニング済み画像フォルダ(RGBImages/TXTImages)を受け取り、SRT、ASS、または TXT に OCR します。 RapidOCR エンジンをベースにしており、活発にメンテナンスされています。

RapidVideOCR のオンラインデモが、VideoSubFinder がエクスポートした RGBImages または TXTImages の ZIP を要求している
RapidVideOCR のデモははっきり述べています:VideoSubFinder がエクスポートする RGBImages/TXTImages を渡してください。公式 RapidVideOCR デモ(Apache 2.0)のスクリーンショット。

優れている点:

  • VideoSubFinder の出力向けに特別設計。タイミングがきれいに引き継がれる
  • SRT、ASS、TXT 出力
  • pip でインストール可能、クロスプラットフォームで動作

制約:

  • 単体の抽出ツールではない。VideoSubFinder の画像なしでは使えない(そして VideoSubFinder 自体に Mac ビルドがないため、このペアはやはり Windows/Linux に縛られる)
  • CLI 優先。使いやすいデスクトップ版は Windows 専用

おすすめの用途: ABBYY FineReader や Subtitle Edit の手動 OCR パスなしで VideoSubFinder のパイプラインを完成させたい人。

パート2:OCR エンジン(完成したツールではありません)

次の3つもよく勧められます。どれも1枚の画像から文字を読むだけで、字幕フレームの検出、重複除去、タイムスタンプ作成は行わないため、単体では SRT になりません。

6. PaddleOCR

ディープラーニングの OCR ツールキットで、中国語など CJK の文字に強く、VideOCR のローカルモードにも使われています。動画に使うには、フレーム抽出、重複除去、タイミングのコードを自分で書く必要があります。

7. Tesseract OCR

印刷文書向けに作られた老舗のオープンソースエンジンです。低解像度で装飾のある動画の文字は苦手で、先に画像をクリーニングする必要があります(VideoSubFinder がやっているのがそれです)。

8. Google Lens

雑然としたフレームでも認識精度は高いものの、手作業です。スクリーンショットを1枚ずつ処理し、タイミング情報もありません。VideOCR のハイブリッドモードで自動化できますが、フレームを Google に送信することになります。

8つの選択肢を比較すると?

ツール プラットフォーム 自前で OCR SRT までのステップ 翻訳/焼き込み 価格
GeekLinkMac(Apple Silicon)・64ビットWindowsあり(ローカル)1あり — AI 翻訳 + スタイル付き焼き込み無料プラン、Pro 月額 $12.99、年額 $99、ライフタイム $129
Video-Subtitle-ExtractorWin / Linux / macOS(NVIDIA 最適化)あり(ローカル)1なし無料(Apache 2.0)
VideOCRWindows / Linux / Dockerあり(PaddleOCR または Google Lens)1なし無料(MIT)
VideoSubFinderWindows / Linuxなし — 画像のみ2(OCR ツールが必要)なし無料(GPLv2)
RapidVideOCRWin / Linux / macOS(pip)あり(RapidOCR)— VideoSubFinder の画像に対して2(VideoSubFinder と併用)なし無料(Apache 2.0)
PaddleOCRPython ライブラリエンジンのみ自作スクリプトなし無料
Tesseractライブラリ / CLIエンジンのみ自作 / Subtitle Edit 経由なし無料
Google Lensクラウドエンジンのみ(クラウド)手動 / VideOCR ハイブリッド経由なし無料

どれを選ぶべき?

Mac や Windows で、字幕を正確に取り出したいだけ:GeekLink。動画を読み込み、見つかった字幕行を確認して SRT を書き出すだけ。切り抜きも Python も conda も NVIDIA GPU も不要で、ロゴやウォーターマークはファイルに混ざりません。抽出機能と月60分の OCR 書き出し枠は無料プランに含まれます。

翻訳や焼き込みも必要:字幕を確認し、翻訳し、完成した動画に焼き込み直す必要があるなら、それを1つのアプリで全部こなせるのはここでは GeekLink だけです。ほかのツールは SRT を渡したらそこで終わりです。

Linux を使っている、または Python に慣れていて NVIDIA GPU がある:オープンソースの抽出ツール(VideOCR、VSE)や VideoSubFinder + RapidVideOCR の2ステップでも対応できますが、設定の手間が増え、その後の編集・翻訳・焼き込みはできません。

よくある質問

ハードサブを抽出する最良の無料ツールは?

Mac や Windows なら、GeekLink の無料プランで字幕行の自動検出、ローカルでの OCR 抽出、月60分の OCR 書き出しが使えます。Python や GPU の設定は不要です。Linux では、オープンソースの選択肢(VideOCR、または VideoSubFinder + RapidVideOCR)が無料ですが、設定の手間が増え、出力は素の SRT までです。

Mac でハードサブを抽出するには?

GeekLinkはこのリストでMac版とWindows版の両方を提供するデスクトップ選択肢です。オープンソース抽出ツールはWindows/Linux中心(VideoSubFinder、VideOCR)か、より多くのセットアップが必要です(Video-Subtitle-Extractor)。GeekLinkはOCRをローカルで実行します:インポート、字幕エリアを枠で囲む、実行、SRTを書き出す。

ハードサブの抽出に GPU は必要?

オープンソースの抽出ツールでは、まともな速度のためには事実上必要です。VideOCR と Video-Subtitle-Extractor はどちらも NVIDIA CUDA を中心に作られており、CPU では遅くなります。Mac では、GeekLink は独立した GPU なしで Apple Silicon 上にネイティブに OCR を実行します。

これらのツールで抽出した字幕を翻訳できる?

GeekLink だけです。他は元言語の SRT(または画像)で止まります。GeekLink は Claude 3.5 Haiku、GPT-4o、GPT-4o mini、DeepSeek を使ってアプリ内で翻訳し、行をまたぐ文脈を活用します。そして翻訳した字幕を動画に焼き戻すこともできます。

VideoSubFinder と VideOCR、どちらを使うべき?

どちらも Windows/Linux 専用です。VideOCR は1回の実行で検出と OCR を行います。VideoSubFinder はクリーニング済みの文字画像とタイミングを出力するだけなので、RapidVideOCR などの OCR ツールが別途必要です。Mac を使っている場合や、抽出後に確認・翻訳・焼き込みまで行いたい場合は、GeekLink なら1つのアプリで全工程を完了できます。

Google Lens や Tesseract を直接使えばいいのでは?

それらは OCR エンジンであって動画ツールではなく、単一の画像を読み取るだけです。動画からの字幕抽出には、どのフレームにテキストがあるかを見つけ、フレームをまたいで行を重複除去し、タイムスタンプを構築することも必要です。その動画レイヤーこそ、VideOCR、VSE、VideoSubFinder、GeekLink がエンジンの上に提供しているものです。

関連記事