Kurz gesagt: Eingebrannte (hardcodierte) Untertitel sind Teil des Videobilds, wer bearbeitbaren Text zurückhaben will, braucht also OCR — und was die Tools wirklich unterscheidet, ist, wie viel Einrichtung sie brauchen und was nach der SRT passiert. Auf Mac oder Windows ist GeekLink insgesamt die beste Wahl: Es findet die Untertitelzeilen automatisch, hält Logos und Wasserzeichen heraus, liest jede Zeile lokal ohne Python- oder GPU-Einrichtung und markiert die wenigen Zeilen, bei denen es unsicher ist — so bekommst du eine saubere SRT mit wenig Nacharbeit. Übersetzung und Einbrennen sind da, falls du sie irgendwann brauchst. Die Open-Source-Extraktoren (VSE, VideOCR, VideoSubFinder + RapidVideOCR) eignen sich vor allem für Linux-Nutzer und technisch versierte Nutzer mit NVIDIA-GPU, die nur eine rohe SRT brauchen. Unten: alle 8 Optionen, darunter drei OCR-Engines, in einer Tabelle verglichen.

Das Wichtigste in Kürze

  • GeekLink liefert die sauberste SRT mit dem geringsten Aufwand. Automatische Erkennung der Untertitelzeilen (kein manuelles Zuschneiden), Filter für Logos und Wasserzeichen, Sprachmodelle pro Zeile für zweizeilige und zweisprachige Untertitel und markierte unsichere Zeilen — ohne Python, conda oder CUDA.
  • Brauchst du mehr als die SRT, geht es nur bei GeekLink weiter — KI-Übersetzung und Einbrennen sind optionale Schritte in derselben App.
  • Die Open-Source-Extraktoren sind für technisch versierte Nutzer gebaut. VSE und VideOCR setzen auf NVIDIA-GPUs und sind auf der CPU langsam; VideOCR und VideoSubFinder gibt es nicht für den Mac.
  • VideoSubFinder macht selbst keine OCR. Für den eigentlichen Text braucht es ein zweites Programm (RapidVideOCR oder Subtitle Edit) — zwei Apps, mit Bildstapeln dazwischen.
  • PaddleOCR, Tesseract und Google Lens sind Engines, keine Tools. Sie lesen einzelne Bilder; Frame-Erkennung, Timing und das Entfernen von Duplikaten kommen erst durch ein Untertitel-Tool hinzu.

Du willst einen All-in-one-Workflow auf dem Desktop? GeekLink findet die Untertitelzeilen automatisch, extrahiert sie lokal auf Mac und Windows und exportiert eine SRT mit Zeitstempeln. Kostenloser Tarif, kein Konto nötig.

Kostenlos herunterladen

Teil 1: Spezielle Tools zur Untertitel-Extraktion

Diese fünf sind eigens dafür gebaut, eingebrannte (hardcodierte) Untertitel aus Videos zu holen. Sie unterscheiden sich vor allem in der Plattform, der Zahl der Arbeitsschritte und darin, was nach der SRT passiert.

1. GeekLink — Insgesamt am besten: die sauberste Extraktion mit der wenigsten Handarbeit (Mac und Windows)

Preis: Kostenloser Tarif (OCR-Extraktion inklusive); Pro $12,99/Monat, $99/Jahr (~$8,25/Monat) oder $169 einmalig als Lifetime
Plattform: Mac (Apple Silicon) und 64-Bit-Windows

Mit GeekLink bekommst du eine saubere, brauchbare SRT mit weniger Handarbeit als mit jedem anderen Tool in dieser Liste — und es ist das einzige mit einer nativen Mac-App. Importiere das Video, und GeekLink findet die Untertitelzeilen automatisch — kein Zuschneiden von Hand —, und hält Logos, Wasserzeichen und anderen Bildschirmtext aus der Untertitelliste heraus. Zweizeilige und zweisprachige Untertitel werden zeilenweise verarbeitet: Du wählst für jede Zeile die Sprache, und jede wird mit dem passenden Modell gelesen, sodass eine chinesische und eine englische Zeile im selben Bild beide korrekt herauskommen. Die OCR läuft lokal, und der Editor markiert die wenigen Zeilen, bei denen er am unsichersten ist, sodass du eine Handvoll prüfst, statt die ganze Datei Korrektur zu lesen. Passt die automatische Erkennung nicht zu einem ungewöhnlichen Layout, kannst du den Untertitelrahmen selbst ziehen.

Für die meisten ist die Aufgabe damit erledigt: SRT exportieren, fertig. Brauchst du mehr, kann dieselbe App auch übersetzen (Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek — kontextbewusst, über 40 Sprachen) und Untertitel wieder ins Video einbrennen.

GeekLink unter macOS erkennt in einem NASA-Startvideo automatisch zwei englische Untertitelzeilen und trennt sie von anderem Bildschirmtext
GeekLink erkennt in einem Startvideo automatisch einzelne englische Untertitelzeilen und hält anderen Bildschirmtext aus der Untertitelliste heraus.

Was heraussticht:

  • Findet Untertitelzeilen automatisch — ohne manuelles Zuschneiden — und hält Logos, Wasserzeichen und Bildschirmtext aus der SRT heraus
  • Verarbeitet zweizeilige und gemischtsprachige Untertitel mit dem passenden Erkennungsmodell für jede Zeile
  • Markiert unsichere Zeilen, sodass du eine Handvoll prüfst statt der ganzen Datei
  • Native Mac-App plus Windows-Version — kein Python, kein conda, keine NVIDIA-GPU; OCR läuft zu 100 % lokal; Stapelverarbeitung integriert
  • Optionale Extras in derselben App: KI-Übersetzung und Einbrennen mit eigenem Stil

Einschränkungen:

  • Desktop-App für Mac und Windows; keine Linux-Version und kein Web-Arbeitsbereich
  • Closed Source; KI-Übersetzung ist eine kostenpflichtige (Pro-)Funktion — die Extraktion selbst ist im kostenlosen Tarif enthalten

Ideal für: Alle, die ohne Einrichtung eine genaue SRT aus eingebrannten Untertiteln wollen — besonders auf dem Mac. Brauchst du später Übersetzung oder Einbrennen, ist beides schon da. Schritt-für-Schritt-Anleitung: Eingebrannte Untertitel per OCR extrahieren.

2. Video-Subtitle-Extractor (VSE) — Open-Source-Extraktor, optimiert für NVIDIA-GPUs

Preis: Kostenlos, Open Source (Apache 2.0)
Plattform: Windows, Linux, macOS (optimiert für NVIDIA-GPUs; der CPU-Modus ist langsam)

Video-Subtitle-Extractor ist ein weit verbreiteter Open-Source-Extraktor, der eingebrannte Untertitel mit lokaler OCR in vielen Sprachen in eine SRT überführt. Es erkennt den Untertitelbereich Bild für Bild, entfernt doppelte Zeilen und bietet die Modi Fast/Auto/Precise. Besonders stark verbreitet in der chinesischsprachigen Community.

Die GUI von Video-Subtitle-Extractor erkennt eine eingebrannte englische Untertitelzeile in einem Anime-Frame, mit Stapel-Warteschlange und Erkennungsprotokoll
VSE erkennt die Untertitelzeile (grüner Rahmen), rechts die Stapel-Warteschlange — die Oberfläche ist primär auf Chinesisch ausgelegt. Screenshot aus dem offiziellen VSE-Repository (Apache 2.0).

Was heraussticht:

  • Viele Sprachen, komplett lokal, keine API-Keys
  • Stapel-Extraktion über mehrere Videos (gleiche Auflösung/gleicher Bereich)
  • Das Schwesterprojekt (video-subtitle-remover) kann den alten eingebrannten Text entfernen

Einschränkungen:

  • Auf NVIDIA/CUDA ausgerichtet — auf dem Mac fällt es auf langsame CPU-Verarbeitung zurück
  • Python/conda-Einrichtung, falls die Release-Version bei dir nicht läuft; Pfade dürfen keine Leerzeichen oder Nicht-ASCII-Zeichen enthalten
  • Kein integrierter Editor, keine Übersetzung, kein Einbrennen

Ideal für: Technisch versierte Nutzer mit NVIDIA-GPU, die kostenlos in großen Mengen extrahieren wollen, besonders bei chinesischen Inhalten. Ausführlicher Vergleich: GeekLink vs. VSE.

3. VideOCR — Kostenloser Ein-Schritt-Extraktor für Windows und Linux

Preis: Kostenlos, Open Source (MIT)
Plattform: Windows, Linux, Docker (Versionen für CPU & NVIDIA-GPU)

VideOCR ist der einfachste kostenlose Weg, in einem einzigen Programm von einem Video mit eingebrannten Untertiteln zu einer fertigen SRT zu kommen. Video laden, Untertitelbereich zuschneiden, starten — es liest den Text lokal mit PaddleOCR oder in einem hybriden Cloud-Modus mit Google Lens und schreibt eine SRT mit Zeitstempeln.

Die Windows-GUI von VideOCR mit einem Zuschneiderahmen um zweisprachige eingebrannte Untertitel, OCR-Engine auf PaddleOCR-Erkennung + Google-Lens-Texterkennung eingestellt
Die Windows-GUI von VideOCR: Zuschneiderahmen um die Untertitelzeile, Engine auf den Hybridmodus PaddleOCR + Google Lens eingestellt. Screenshot aus dem offiziellen VideOCR-Repository (MIT).

Was heraussticht:

  • Echter Ein-Schritt-Workflow: Video rein, SRT raus
  • Lokaler PaddleOCR-Modus (viele Sprachen) oder genauerer Hybridmodus mit Google Lens
  • GUI und CLI plus Docker-Images; NVIDIA-CUDA-Beschleunigung

Einschränkungen:

  • Keine macOS-Version
  • Laut eigener Dokumentation langsam auf der CPU — du willst eigentlich die GPU-Version
  • Kein Editor zum Prüfen der Ergebnisse, keine Übersetzung, kein Einbrennen

Ideal für: Windows-/Linux-Nutzer, die kostenlos und unkompliziert extrahieren wollen und mit der SRT fertig sind.

4. VideoSubFinder — Frame-Erkennung für einen zweistufigen Workflow (ohne eigene OCR)

Preis: Kostenlos, Open Source (GPLv2)
Plattform: Windows, Linux

VideoSubFinder macht überhaupt keine OCR — dafür löst es die Videohälfte des Problems besser als jedes andere Tool: Es findet die Frames mit Untertiteltext, zeichnet das exakte Timing auf und gibt bereinigte Bilder ohne Hintergrund aus. Diese Bilder schickst du dann durch ein OCR-Tool (RapidVideOCR, Subtitle Edit, FineReader), um den Text zu erhalten. Ein Fansub-Klassiker.

Was heraussticht:

  • Hervorragende Hintergrundbereinigung — dein OCR-Tool bekommt viel leichter lesbare Bilder
  • Präzises Ein- und Ausblend-Timing pro Zeile
  • Jede Stufe lässt sich prüfen und feinjustieren

Einschränkungen:

  • Keine eigene OCR — ein zweites Programm ist nötig
  • Keine macOS-Version
  • Der manuellste Workflow in dieser Liste: zwei Apps, Bildstapel dazwischen

Ideal für: Fansubber und Perfektionisten, die maximale Kontrolle und die bestmöglichen Rohbilder für die OCR wollen.

5. RapidVideOCR — Der OCR-Schritt für die Ausgabe von VideoSubFinder

Preis: Kostenlos, Open Source (Apache 2.0)
Plattform: Windows, Linux, macOS (Python/pip; Desktop-EXE für Windows)

RapidVideOCR ist die eigens gebaute zweite Hälfte des VideoSubFinder-Workflows: Es nimmt die bereinigten Bildordner von VideoSubFinder (RGBImages/TXTImages) und macht daraus per OCR SRT, ASS oder TXT. Es basiert auf der RapidOCR-Engine und wird aktiv gepflegt.

Online-Demo von RapidVideOCR, die nach einer ZIP mit den von VideoSubFinder exportierten RGBImages oder TXTImages fragt
Die Demo von RapidVideOCR sagt es ganz deutlich: Füttere sie mit den RGBImages/TXTImages, die VideoSubFinder exportiert. Screenshot aus der offiziellen RapidVideOCR-Demo (Apache 2.0).

Was heraussticht:

  • Speziell für die Ausgabe von VideoSubFinder entwickelt — das Timing kommt sauber durch
  • Ausgabe als SRT, ASS und TXT
  • Per pip installierbar, plattformübergreifend

Einschränkungen:

  • Kein eigenständiger Extraktor — ohne die Bilder von VideoSubFinder nutzlos (und VideoSubFinder selbst gibt es nicht für den Mac, das Duo bleibt also auf Windows/Linux beschränkt)
  • Primär CLI; die freundlichere Desktop-Version gibt es nur für Windows

Ideal für: Die VideoSubFinder-Pipeline vervollständigen, ohne ABBYY FineReader oder manuelle OCR-Durchgänge in Subtitle Edit.

Teil 2: OCR-Engines (keine vollständigen Tools)

Diese drei werden ebenfalls oft empfohlen. Sie lesen Text aus einzelnen Bildern; keine davon findet Untertitel-Frames, entfernt Duplikate oder erzeugt Zeitstempel — allein liefern sie also keine SRT.

6. PaddleOCR

Ein OCR-Toolkit auf Deep-Learning-Basis, stark bei Chinesisch und anderen CJK-Schriften, und die Engine im lokalen Modus von VideOCR. Für Video musst du Frame-Extraktion, Duplikatentfernung und Timing selbst programmieren.

7. Tesseract OCR

Die altgediente Open-Source-Engine, entwickelt für gedruckte Dokumente. Niedrig aufgelöster, stilisierter Videotext ist für sie schwer zu knacken, es sei denn, die Frames werden vorher bereinigt (genau das macht VideoSubFinder).

8. Google Lens

Genau bei unruhigen Frames, aber manuell — ein Screenshot nach dem anderen, ohne Timing. Der Hybridmodus von VideOCR automatisiert das, schickt dafür aber deine Frames an Google.

Wie schneiden alle 8 Optionen im Vergleich ab?

Tool Plattform Macht selbst OCR Schritte bis zur SRT Übersetzung / Einbrennen Preis
GeekLinkMac (Apple Silicon) und 64-Bit-WindowsJa (lokal)1Ja — KI-Übersetzung + Einbrennen mit eigenem StilKostenloser Tarif; Pro $12,99/Monat, $99/Jahr, $169 Lifetime
Video-Subtitle-ExtractorWin / Linux / macOS (für NVIDIA optimiert)Ja (lokal)1NeinKostenlos (Apache 2.0)
VideOCRWindows / Linux / DockerJa (PaddleOCR oder Google Lens)1NeinKostenlos (MIT)
VideoSubFinderWindows / LinuxNein — nur Bilder2 (braucht ein OCR-Tool)NeinKostenlos (GPLv2)
RapidVideOCRWin / Linux / macOS (pip)Ja (RapidOCR) — auf Bildern von VideoSubFinder2 (mit VideoSubFinder)NeinKostenlos (Apache 2.0)
PaddleOCRPython-BibliothekNur EngineEigene SkripteNeinKostenlos
TesseractBibliothek / CLINur EngineSelbst bauen / über Subtitle EditNeinKostenlos
Google LensCloudNur Engine (Cloud)Manuell / über den Hybridmodus von VideOCRNeinKostenlos

Welches Tool solltest du wählen?

Du willst die Untertitel einfach nur genau herausholen, auf Mac oder Windows: GeekLink. Video importieren, die gefundenen Untertitelzeilen bestätigen und die SRT exportieren — kein Zuschneiden, kein Python, kein conda, keine NVIDIA-GPU, und Logos und Wasserzeichen bleiben aus der Datei heraus. Extraktion und 60 Minuten OCR-Export pro Monat sind im kostenlosen Tarif enthalten.

Du brauchst auch Übersetzung oder Einbrennen: Müssen die Untertitel geprüft, übersetzt und wieder in ein fertiges Video eingebrannt werden, ist GeekLink hier das einzige Tool, das all das in einer App erledigt — alle anderen geben dir eine SRT und hören dann auf.

Du nutzt Linux oder kommst gut mit Python zurecht und hast eine NVIDIA-GPU: Die Open-Source-Extraktoren (VideOCR, VSE) oder der zweistufige Weg VideoSubFinder + RapidVideOCR können funktionieren — mit mehr Einrichtung und ohne anschließenden Editor, Übersetzung oder Einbrennen.

Häufig gestellte Fragen

Was ist das beste kostenlose Tool zum Extrahieren eingebrannter Untertitel?

Auf Mac oder Windows: Der kostenlose Tarif von GeekLink umfasst automatische Erkennung der Untertitelzeilen, lokale OCR-Extraktion und 60 Minuten OCR-Export pro Monat, ohne Python- oder GPU-Einrichtung. Unter Linux sind die Open-Source-Optionen (VideOCR oder VideoSubFinder + RapidVideOCR) kostenlos, brauchen aber mehr Einrichtung und hören bei der rohen SRT auf.

Wie extrahiere ich eingebrannte Untertitel auf dem Mac?

GeekLink ist die Desktop-Option in dieser Liste mit Versionen für Mac und Windows. Die Open-Source-Extraktoren konzentrieren sich auf Windows/Linux (VideoSubFinder, VideOCR) oder brauchen mehr Einrichtung (Video-Subtitle-Extractor). GeekLink führt die OCR lokal aus: importieren, die automatisch erkannten Untertitelzeilen prüfen, starten und als SRT exportieren.

Brauche ich eine GPU, um eingebrannte Untertitel zu extrahieren?

Bei den Open-Source-Extraktoren praktisch ja, wenn es halbwegs schnell gehen soll — VideOCR und Video-Subtitle-Extractor sind beide auf NVIDIA CUDA ausgelegt und auf der CPU langsam. Auf dem Mac führt GeekLink seine OCR nativ auf aktueller Desktop-Hardware aus, ohne dedizierte GPU.

Kann eines dieser Tools die extrahierten Untertitel übersetzen?

Nur GeekLink. Die anderen hören bei der SRT in der Originalsprache (oder bei Bildern) auf. GeekLink übersetzt direkt in der App mit Claude 3.5 Haiku, GPT-4o, GPT-4o mini oder DeepSeek, mit zeilenübergreifendem Kontext, und kann die übersetzten Untertitel wieder ins Video einbrennen.

Soll ich VideoSubFinder oder VideOCR nehmen?

Beide gibt es nur für Windows/Linux. VideOCR erkennt und liest in einem Durchgang; VideoSubFinder erzeugt nur bereinigte Textbilder und Timing, du brauchst also ein zweites OCR-Tool wie RapidVideOCR. Bist du auf dem Mac oder willst du das Ergebnis danach prüfen, übersetzen oder einbrennen, deckt GeekLink den ganzen Workflow in einer App ab.

Warum nicht einfach direkt Google Lens oder Tesseract nutzen?

Das sind OCR-Engines, keine Video-Tools — sie lesen einzelne Bilder. Um Untertitel aus Videos zu extrahieren, musst du außerdem herausfinden, welche Frames Text enthalten, doppelte Zeilen über Frames hinweg entfernen und Zeitstempel erzeugen. Genau diese Videoschicht liefern VideOCR, VSE, VideoSubFinder und GeekLink zusätzlich zu einer Engine.

Verwandte Artikel