En bref : Les sous-titres incrustés (hardcodés) font partie de l’image de la vidéo : pour récupérer du texte modifiable, il faut donc de l’OCR — et ce qui distingue vraiment les outils, c’est la configuration qu’ils demandent et ce qui se passe après le SRT. Sur Mac ou Windows, GeekLink est le meilleur choix global : il trouve automatiquement les lignes de sous-titres, écarte les logos et filigranes, lit chaque ligne en local sans configuration Python ni GPU, et signale les quelques lignes dont il n’est pas sûr — vous obtenez un SRT propre avec peu de retouches. La traduction et l’incrustation sont là si vous en avez besoin un jour. Les extracteurs open source (VSE, VideOCR, VideoSubFinder + RapidVideOCR) conviennent surtout aux utilisateurs de Linux et aux profils techniques équipés d’un GPU NVIDIA qui n’ont besoin que d’un SRT brut. Ci-dessous : les 8 options, dont trois moteurs d’OCR, comparées dans un seul tableau.

À retenir

  • GeekLink donne le SRT le plus propre pour le moins d’efforts. Détection automatique des lignes de sous-titres (pas de recadrage manuel), filtrage des logos et filigranes, modèles de langue par ligne pour les sous-titres sur deux lignes et bilingues, et signalement des lignes incertaines — sans Python, conda ni CUDA.
  • Si vous avez besoin de plus que le SRT, seul GeekLink va plus loin — la traduction IA et l’incrustation sont des étapes optionnelles dans la même application.
  • Les extracteurs open source sont conçus pour les profils techniques. VSE et VideOCR misent sur les GPU NVIDIA et sont lents sur CPU ; VideOCR et VideoSubFinder n’ont pas de version Mac.
  • VideoSubFinder ne fait pas d’OCR lui-même. Il faut un second programme (RapidVideOCR ou Subtitle Edit) pour obtenir le texte — deux applications, avec des lots d’images entre les deux.
  • PaddleOCR, Tesseract et Google Lens sont des moteurs, pas des outils. Ils lisent des images isolées ; la détection des images utiles, le timing et la suppression des doublons sont ce qu’un outil de sous-titrage ajoute par-dessus.

Vous voulez un flux de travail tout-en-un sur ordinateur ? GeekLink trouve automatiquement les lignes de sous-titres, les extrait en local sur Mac et Windows, et exporte un SRT horodaté. Offre gratuite, sans compte.

Téléchargement gratuit

Partie 1 : les outils dédiés à l’extraction de sous-titres

Ces cinq outils sont conçus spécifiquement pour extraire les sous-titres incrustés (hardcodés) d’une vidéo. Ils diffèrent surtout par la plateforme, le nombre d’étapes du flux de travail et ce qui se passe une fois le SRT obtenu.

1. GeekLink — Le meilleur dans l’ensemble : l’extraction la plus propre avec le moins de travail manuel (Mac et Windows)

Prix : Offre gratuite (extraction OCR incluse) ; Pro à 12,99 $/mois, 99 $/an (~8,25 $/mois) ou 169 $ en achat unique à vie
Plateforme : Mac (Apple Silicon) et Windows 64 bits

GeekLink vous donne un SRT propre et exploitable avec moins de travail manuel que n’importe quel autre outil de cette liste — et c’est le seul à proposer une application Mac native. Importez la vidéo et GeekLink trouve automatiquement les lignes de sous-titres — pas de recadrage à la main — et écarte les logos, filigranes et autres textes à l’écran de la liste des sous-titres. Les sous-titres sur deux lignes et bilingues sont traités ligne par ligne : vous choisissez la langue de chaque ligne, et chacune est lue avec le modèle correspondant, si bien qu’une ligne en chinois et une ligne en anglais dans la même image ressortent toutes deux correctement. L’OCR tourne en local, et l’éditeur signale les quelques lignes dont il est le moins sûr : vous en vérifiez une poignée au lieu de relire tout le fichier. Si la détection automatique ne convient pas à une mise en page inhabituelle, vous pouvez tracer vous-même le cadre des sous-titres.

Pour la plupart des gens, le travail s’arrête là : exportez le SRT et c’est terminé. Si vous avez besoin de plus, la même application peut aussi traduire (Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek — en tenant compte du contexte, dans plus de 40 langues) et réincruster les sous-titres dans la vidéo.

GeekLink sur macOS détecte automatiquement deux lignes de sous-titres en anglais dans un extrait de lancement de la NASA tout en séparant les autres textes à l’écran
GeekLink détecte automatiquement les différentes lignes de sous-titres en anglais d’une vidéo de lancement et tient les autres textes à l’écran à l’écart de la liste des sous-titres.

Points forts :

  • Trouve automatiquement les lignes de sous-titres — sans recadrage manuel — et écarte logos, filigranes et textes à l’écran du SRT
  • Gère les sous-titres sur deux lignes et multilingues, avec le bon modèle de reconnaissance pour chaque ligne
  • Signale les lignes incertaines : vous en relisez une poignée au lieu du fichier entier
  • Application Mac native plus une version Windows — ni Python, ni conda, ni GPU NVIDIA ; OCR 100 % locale ; traitement par lots intégré
  • Options supplémentaires dans la même application : traduction IA et incrustation avec style personnalisé

Limites :

  • Application de bureau pour Mac et Windows ; pas de version Linux ni d’espace de travail en ligne
  • Code fermé ; la traduction IA est une fonction payante (Pro) — l’extraction elle-même fait partie de l’offre gratuite

Idéal pour : Tous ceux qui veulent un SRT précis à partir de sous-titres incrustés sans rien configurer — surtout sur Mac. Si vous avez besoin plus tard de traduction ou d’incrustation, c’est déjà là. Guide pas à pas : Extraire des sous-titres incrustés par OCR.

2. Video-Subtitle-Extractor (VSE) — Extracteur open source optimisé pour les GPU NVIDIA

Prix : Gratuit, open source (Apache 2.0)
Plateforme : Windows, Linux, macOS (optimisé pour GPU NVIDIA ; le mode CPU est lent)

Video-Subtitle-Extractor est un extracteur open source très utilisé, qui convertit les sous-titres incrustés en SRT grâce à une OCR locale dans de nombreuses langues. Il détecte la zone des sous-titres image par image, supprime les lignes en double et propose les modes Fast/Auto/Precise. Particulièrement populaire dans la communauté sinophone.

Interface de Video-Subtitle-Extractor détectant une ligne de sous-titre incrustée en anglais dans une image d’anime, avec file de traitement par lots et journal de reconnaissance
VSE détecte la ligne de sous-titre (cadre vert), avec la file de traitement à droite — l’interface est d’abord pensée pour le chinois. Capture d’écran issue du dépôt officiel de VSE (Apache 2.0).

Points forts :

  • Nombreuses langues, entièrement local, sans clé API
  • Extraction par lots sur plusieurs vidéos (même résolution/même zone)
  • Un projet frère (video-subtitle-remover) peut effacer l’ancien texte incrusté

Limites :

  • Orienté NVIDIA/CUDA — sur Mac, il se rabat sur un traitement CPU lent
  • Configuration Python/conda si la version publiée ne fonctionne pas chez vous ; les chemins ne doivent contenir ni espaces ni caractères non ASCII
  • Pas d’éditeur intégré, ni de traduction, ni d’incrustation

Idéal pour : Les profils techniques équipés d’un GPU NVIDIA qui veulent extraire gratuitement en masse, surtout pour des contenus en chinois. Comparaison complète : GeekLink vs VSE.

3. VideOCR — Extracteur gratuit en une étape pour Windows et Linux

Prix : Gratuit, open source (MIT)
Plateforme : Windows, Linux, Docker (versions CPU et GPU NVIDIA)

VideOCR est le moyen gratuit le plus simple de passer, dans un seul programme, d’une vidéo aux sous-titres incrustés à un SRT terminé. Chargez la vidéo, recadrez la zone des sous-titres, lancez — il lit le texte en local avec PaddleOCR, ou avec Google Lens dans un mode hybride cloud, et écrit un SRT horodaté.

Interface Windows de VideOCR avec un cadre de recadrage autour de sous-titres bilingues incrustés, moteur d’OCR réglé sur détection PaddleOCR + reconnaissance Google Lens
L’interface Windows de VideOCR : cadre de recadrage autour de la ligne de sous-titre, moteur réglé sur le mode hybride PaddleOCR + Google Lens. Capture d’écran issue du dépôt officiel de VideOCR (MIT).

Points forts :

  • Un vrai flux en une étape : la vidéo en entrée, le SRT en sortie
  • Mode PaddleOCR local (nombreuses langues) ou mode hybride Google Lens, plus précis
  • Interface graphique et CLI, plus des images Docker ; accélération NVIDIA CUDA

Limites :

  • Pas de version macOS
  • Lent sur CPU, de l’aveu même de sa documentation — il vous faut vraiment la version GPU
  • Pas d’éditeur pour relire les résultats, ni de traduction, ni d’incrustation

Idéal pour : Les utilisateurs de Windows/Linux qui veulent une extraction gratuite et sans prise de tête, et dont le travail s’arrête au SRT.

4. VideoSubFinder — Détection des images pour un flux en deux étapes (sans OCR propre)

Prix : Gratuit, open source (GPLv2)
Plateforme : Windows, Linux

VideoSubFinder ne fait pas du tout d’OCR — en revanche, il résout la partie vidéo du problème mieux que quiconque : trouver les images contenant du texte de sous-titre, enregistrer le timing exact et produire des images nettoyées, débarrassées de l’arrière-plan. Vous passez ensuite ces images dans un outil d’OCR (RapidVideOCR, Subtitle Edit, FineReader) pour obtenir le texte. Un classique du fansub.

Points forts :

  • Excellent nettoyage de l’arrière-plan — votre outil d’OCR reçoit des images bien plus faciles à lire
  • Timing précis d’apparition et de disparition pour chaque ligne
  • Chaque étape peut être vérifiée et ajustée

Limites :

  • Pas d’OCR propre — un second programme est nécessaire
  • Pas de version macOS
  • Le flux le plus manuel de cette liste : deux applications, des lots d’images entre les deux

Idéal pour : Les fansubbers et perfectionnistes qui veulent un contrôle maximal et les meilleures images brutes possibles pour l’OCR.

5. RapidVideOCR — L’étape d’OCR pour la sortie de VideoSubFinder

Prix : Gratuit, open source (Apache 2.0)
Plateforme : Windows, Linux, macOS (Python/pip ; exécutable de bureau pour Windows)

RapidVideOCR est la seconde moitié du flux VideoSubFinder, conçue pour cela : il prend les dossiers d’images nettoyées de VideoSubFinder (RGBImages/TXTImages) et les convertit par OCR en SRT, ASS ou TXT. Il repose sur le moteur RapidOCR et il est activement maintenu.

Démo en ligne de RapidVideOCR demandant un ZIP des RGBImages ou TXTImages exportées par VideoSubFinder
La démo de RapidVideOCR le dit clairement : donnez-lui les RGBImages/TXTImages exportées par VideoSubFinder. Capture d’écran issue de la démo officielle de RapidVideOCR (Apache 2.0).

Points forts :

  • Conçu spécifiquement pour la sortie de VideoSubFinder — le timing est conservé proprement
  • Sortie en SRT, ASS et TXT
  • Installable avec pip, multiplateforme

Limites :

  • Pas un extracteur autonome — inutile sans les images de VideoSubFinder (et VideoSubFinder lui-même n’a pas de version Mac, donc le duo reste limité à Windows/Linux)
  • Avant tout en ligne de commande ; la version de bureau, plus conviviale, n’existe que pour Windows

Idéal pour : Compléter la chaîne VideoSubFinder sans ABBYY FineReader ni passes d’OCR manuelles dans Subtitle Edit.

Partie 2 : les moteurs d’OCR (pas des outils complets)

Ces trois-là sont aussi souvent recommandés. Ils lisent le texte d’images isolées ; aucun ne trouve les images contenant des sous-titres, ne supprime les doublons ni ne génère d’horodatage — seuls, ils ne produisent donc pas de SRT.

6. PaddleOCR

Une boîte à outils d’OCR basée sur l’apprentissage profond, performante sur le chinois et les autres écritures CJK, et le moteur du mode local de VideOCR. Pour l’utiliser sur de la vidéo, il faut écrire vous-même le code d’extraction des images, de suppression des doublons et de timing.

7. Tesseract OCR

Le moteur open source historique, conçu pour les documents imprimés. Le texte vidéo stylisé et en basse résolution est difficile pour lui, sauf si les images sont d’abord nettoyées (c’est ce que fait VideoSubFinder).

8. Google Lens

Précis sur des images chargées, mais manuel — une capture d’écran à la fois, sans timing. Le mode hybride de VideOCR l’automatise, au prix de l’envoi de vos images à Google.

Comment se comparent les 8 options ?

Outil Plateforme Fait sa propre OCR Étapes jusqu’au SRT Traduction / incrustation Prix
GeekLinkMac (Apple Silicon) et Windows 64 bitsOui (en local)1Oui — traduction IA + incrustation avec styleOffre gratuite ; Pro à 12,99 $/mois, 99 $/an, 169 $ à vie
Video-Subtitle-ExtractorWin / Linux / macOS (optimisé NVIDIA)Oui (en local)1NonGratuit (Apache 2.0)
VideOCRWindows / Linux / DockerOui (PaddleOCR ou Google Lens)1NonGratuit (MIT)
VideoSubFinderWindows / LinuxNon — images uniquement2 (nécessite un outil d’OCR)NonGratuit (GPLv2)
RapidVideOCRWin / Linux / macOS (pip)Oui (RapidOCR) — sur les images de VideoSubFinder2 (avec VideoSubFinder)NonGratuit (Apache 2.0)
PaddleOCRBibliothèque PythonMoteur uniquementScripts maisonNonGratuit
TesseractBibliothèque / CLIMoteur uniquementMaison / via Subtitle EditNonGratuit
Google LensCloudMoteur uniquement (cloud)Manuel / via le mode hybride de VideOCRNonGratuit

Lequel choisir ?

Vous voulez simplement récupérer les sous-titres, avec précision, sur Mac ou Windows : GeekLink. Importez la vidéo, confirmez les lignes de sous-titres trouvées et exportez le SRT — sans recadrage, sans Python, conda ni GPU NVIDIA, et les logos et filigranes restent hors du fichier. L’extraction et 60 minutes d’export OCR par mois font partie de l’offre gratuite.

Vous avez aussi besoin de traduction ou d’incrustation : si les sous-titres doivent être relus, traduits et réincrustés dans une vidéo finale, GeekLink est le seul outil ici à tout faire dans une seule application — tous les autres vous remettent un SRT et s’arrêtent là.

Vous êtes sous Linux, ou à l’aise avec Python et équipé d’un GPU NVIDIA : les extracteurs open source (VideOCR, VSE) ou la voie en deux étapes VideoSubFinder + RapidVideOCR peuvent convenir, avec plus de configuration et sans éditeur, traduction ni incrustation ensuite.

Questions fréquentes

Quel est le meilleur outil gratuit pour extraire des sous-titres incrustés ?

Sur Mac ou Windows : l’offre gratuite de GeekLink couvre la détection automatique des lignes de sous-titres, l’extraction OCR en local et 60 minutes d’export OCR par mois, sans configuration Python ni GPU. Sous Linux, les options open source (VideOCR, ou VideoSubFinder + RapidVideOCR) sont gratuites mais demandent plus de configuration et s’arrêtent au SRT brut.

Comment extraire des sous-titres incrustés sur Mac ?

GeekLink est l’option de bureau de cette liste qui existe à la fois pour Mac et pour Windows. Les extracteurs open source se concentrent sur Windows/Linux (VideoSubFinder, VideOCR) ou demandent plus de configuration (Video-Subtitle-Extractor). GeekLink fait l’OCR en local : importez, vérifiez les lignes de sous-titres détectées automatiquement, lancez et exportez en SRT.

Faut-il un GPU pour extraire des sous-titres incrustés ?

Pour les extracteurs open source, en pratique oui si vous voulez une vitesse raisonnable — VideOCR et Video-Subtitle-Extractor sont tous deux conçus autour de NVIDIA CUDA et lents sur CPU. Sur Mac, GeekLink exécute son OCR nativement sur du matériel récent, sans GPU dédié.

Un de ces outils peut-il traduire les sous-titres extraits ?

Seul GeekLink. Les autres s’arrêtent au SRT dans la langue d’origine (ou aux images). GeekLink traduit directement dans l’application avec Claude 3.5 Haiku, GPT-4o, GPT-4o mini ou DeepSeek, en tenant compte du contexte entre les lignes, et peut réincruster les sous-titres traduits dans la vidéo.

Faut-il choisir VideoSubFinder ou VideOCR ?

Les deux sont réservés à Windows/Linux. VideOCR détecte et fait l’OCR en une seule passe ; VideoSubFinder ne produit que des images de texte nettoyées et le timing, il vous faut donc un second outil d’OCR comme RapidVideOCR. Si vous êtes sur Mac, ou si vous voulez ensuite relire, traduire ou incruster le résultat, GeekLink couvre tout le flux dans une seule application.

Pourquoi ne pas utiliser directement Google Lens ou Tesseract ?

Ce sont des moteurs d’OCR, pas des outils vidéo — ils lisent des images isolées. Extraire des sous-titres d’une vidéo demande aussi de trouver quelles images contiennent du texte, de dédoublonner les lignes d’une image à l’autre et de générer les horodatages. C’est précisément cette couche vidéo qu’apportent VideOCR, VSE, VideoSubFinder et GeekLink par-dessus un moteur.

Articles connexes