TL;DR: Legendas embutidas (queimadas) fazem parte da imagem do vídeo, então recuperar texto editável exige OCR — e o que realmente diferencia as ferramentas é quanta configuração elas pedem e o que dá para fazer depois de ter o SRT. No Mac ou no Windows, o GeekLink é a melhor opção no geral: encontra as linhas de legenda automaticamente, deixa logotipos e marcas d'água de fora, lê cada linha localmente sem configurar Python nem GPU e marca as poucas linhas de que não tem certeza — assim você recebe um SRT limpo, com pouquíssimo retrabalho. Tradução e queima estão lá caso você precise. Os extratores open-source (VSE, VideOCR, VideoSubFinder + RapidVideOCR) atendem principalmente usuários de Linux e usuários técnicos com GPU NVIDIA que só precisam de um SRT bruto. Abaixo: as 8 opções, incluindo três motores de OCR, comparadas em uma tabela.

Principais conclusões

  • O GeekLink entrega o SRT mais limpo com o menor esforço. Detecção automática das linhas de legenda (sem recortar à mão), filtro de logotipos e marcas d'água, um modelo de idioma por linha para legendas de duas linhas e bilíngues, e linhas duvidosas marcadas; sem Python, conda ou CUDA.
  • Se você precisa de mais do que o SRT, só o GeekLink continua — tradução com IA e queima são etapas opcionais no mesmo app.
  • Os extratores open-source são feitos para usuários técnicos. VSE e VideOCR dependem de GPUs NVIDIA e ficam lentos na CPU; VideOCR e VideoSubFinder não têm versão para Mac.
  • O VideoSubFinder não faz OCR sozinho. Ele precisa de um segundo programa (RapidVideOCR ou Subtitle Edit) para obter o texto: dois apps e lotes de imagens no meio do caminho.
  • PaddleOCR, Tesseract e Google Lens são motores, não ferramentas. Eles leem imagens isoladas; detecção de quadros, sincronização e remoção de duplicatas são o que uma ferramenta de legendas acrescenta por cima.

Quer um fluxo de desktop tudo-em-um? O GeekLink extrai legendas queimadas localmente no Mac e Windows — desenhe uma caixa, execute o OCR e obtenha um SRT com marcações de tempo. Nível gratuito, sem conta.

Baixe grátis

Parte 1: Ferramentas dedicadas de extração de legendas

Estas cinco foram feitas especificamente para extrair legendas embutidas (queimadas) de vídeo. Diferem principalmente na plataforma, em quantas etapas o fluxo exige e no que acontece depois que você tem o SRT.

1. GeekLink — Melhor no geral: a extração mais limpa com o menor trabalho manual (Mac e Windows)

Preço: Nível gratuito (extração por OCR incluída); Pro US$ 12,99/mês, US$ 99/ano (~US$ 8,25/mês) ou US$ 129 vitalício único
Plataforma: Mac (Apple Silicon) e Windows de 64 bits

O GeekLink entrega um SRT limpo e pronto para usar com menos trabalho manual do que qualquer outra ferramenta desta lista, e é o único com app nativo para Mac. Você importa o vídeo e o GeekLink encontra as linhas de legenda automaticamente, sem recorte manual, e deixa logotipos, marcas d'água e outros textos da tela fora da lista de legendas. Legendas de duas linhas e bilíngues são tratadas linha a linha: você escolhe o idioma de cada linha e cada uma é lida com o modelo correspondente, então uma linha em chinês e outra em inglês no mesmo quadro saem certas. O OCR roda localmente, e o editor marca as poucas linhas de que tem menos certeza, para você conferir algumas em vez de revisar o arquivo inteiro. Se a detecção automática não se encaixar em um layout incomum, você pode desenhar a caixa da legenda por conta própria.

Para a maioria das pessoas, o trabalho termina aqui: exporte o SRT e pronto. Se precisar de mais, o mesmo app também traduz (Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek — com contexto, mais de 40 idiomas) e queima as legendas de volta no vídeo.

GeekLink no macOS detectando automaticamente duas linhas de legendas em inglês em um lançamento espacial e separando-as de outros textos na tela
O GeekLink detecta automaticamente linhas de legenda em inglês e separa do painel outros textos na tela, como a data.

O que se destaca:

  • Encontra as linhas de legenda automaticamente — sem recorte manual — e deixa logotipos, marcas d'água e textos da tela fora do SRT
  • Lida com legendas de duas linhas e em vários idiomas, com o modelo de reconhecimento certo para cada linha
  • Marca as linhas duvidosas, então você confere algumas em vez do arquivo inteiro
  • App nativo para Mac e versão para Windows — sem Python, conda ou GPU NVIDIA; o OCR roda 100% localmente; processamento em lote incluído
  • Extras opcionais no mesmo app: tradução com IA e queima com estilos

Limitações:

  • Versões para Mac e Windows; sem versão para Linux ou web
  • Código fechado; a tradução por IA é um recurso pago (Pro) — a extração em si está no nível gratuito

Melhor para: Qualquer pessoa que queira um SRT preciso a partir de legendas queimadas sem configurar nada, principalmente no Mac. Se depois precisar traduzir ou queimar, já está tudo lá. Guia passo a passo: Como extrair legendas embutidas com OCR.

2. Video-Subtitle-Extractor (VSE) — Extrator open-source otimizado para GPUs NVIDIA

Preço: Gratuito, open source (Apache 2.0)
Plataforma: Windows, Linux, macOS (otimizado para GPU NVIDIA; o fallback em CPU é lento)

O Video-Subtitle-Extractor é um extrator open-source bastante usado que transforma legendas queimadas em SRT com OCR local em vários idiomas. Ele detecta a região da legenda quadro a quadro, remove linhas repetidas e oferece os modos Rápido/Auto/Preciso. Especialmente forte na comunidade de língua chinesa.

Interface do Video-Subtitle-Extractor detectando uma linha de legenda em inglês queimada em um quadro de anime, com fila de lote e log de reconhecimento
O VSE detectando a linha de legenda (caixa verde) com uma fila de lote à direita — a interface é primeiramente em chinês. Captura de tela do repositório oficial do VSE (Apache 2.0).

O que se destaca:

  • Vários idiomas, totalmente local, sem chaves de API
  • Extração em lote de vários vídeos (mesma resolução/região)
  • Projeto irmão (video-subtitle-remover) pode apagar o texto queimado antigo

Limitações:

  • Voltado para NVIDIA/CUDA — em um Mac recai para o lento processamento em CPU
  • Configuração Python/conda se a versão pronta não funcionar para você; caminhos não podem conter espaços ou caracteres não ASCII
  • Sem editor, tradução ou queima na aplicação

Melhor para: Usuários técnicos com uma GPU NVIDIA que querem extração gratuita em massa, especialmente para conteúdo em chinês. Comparação completa: GeekLink vs VSE.

3. VideOCR — Extrator gratuito de uma etapa para Windows e Linux

Preço: Gratuito, open source (MIT)
Plataforma: Windows, Linux, Docker (versões CPU e GPU NVIDIA)

O VideOCR é a maneira gratuita mais simples de ir de um vídeo com legendas queimadas a um SRT finalizado em um só programa. Carregue o vídeo, recorte a área da legenda, rode — ele lê o texto com PaddleOCR localmente, ou com o Google Lens em um modo híbrido na nuvem, e grava um SRT com marcações de tempo.

Interface do VideOCR no Windows com uma caixa de recorte desenhada ao redor de legendas queimadas bilíngues, motor de OCR definido como detecção PaddleOCR + reconhecimento Google Lens
A interface do VideOCR no Windows: caixa de recorte ao redor da linha de legenda, motor definido como híbrido PaddleOCR + Google Lens. Captura de tela do repositório oficial do VideOCR (MIT).

O que se destaca:

  • Fluxo verdadeiramente de uma etapa: vídeo entra, SRT sai
  • Modo PaddleOCR local (multilíngue) ou modo híbrido Google Lens de maior precisão
  • GUI e CLI, além de imagens Docker; aceleração NVIDIA CUDA

Limitações:

  • Sem versão para macOS
  • Lento na CPU segundo a própria documentação — você realmente quer a versão com GPU
  • Sem editor para revisar resultados, sem tradução, sem queima

Melhor para: Usuários de Windows/Linux que querem extração gratuita e sem complicação e que terminam assim que têm o SRT.

4. VideoSubFinder — Detecção de quadros para um fluxo de duas etapas (sem OCR próprio)

Preço: Gratuito, open source (GPLv2)
Plataforma: Windows, Linux

O VideoSubFinder não faz OCR de forma alguma — ele resolve a metade de vídeo do problema melhor do que qualquer outro: encontrar os quadros com texto de legenda, registrar a sincronização exata e produzir imagens limpas com o fundo removido. Você então passa essas imagens por uma ferramenta de OCR (RapidVideOCR, Subtitle Edit, FineReader) para obter o texto. Um clássico do fansub.

O que se destaca:

  • Excelente limpeza de fundo — entrega imagens muito mais fáceis para sua ferramenta de OCR
  • Sincronização precisa de aparecer/desaparecer por linha
  • Toda etapa é inspecionável e ajustável

Limitações:

  • Sem OCR próprio — um segundo programa é necessário
  • Sem versão para macOS
  • O fluxo mais manual aqui: dois aplicativos, lotes de imagens no meio

Melhor para: Fansubbers e perfeccionistas que querem controle máximo e as melhores imagens brutas possíveis para OCR.

5. RapidVideOCR — A etapa de OCR para a saída do VideoSubFinder

Preço: Gratuito, open source (Apache 2.0)
Plataforma: Windows, Linux, macOS (Python/pip; EXE de desktop para Windows)

O RapidVideOCR é a segunda metade feita sob medida do fluxo do VideoSubFinder: ele pega as pastas de imagens limpas do VideoSubFinder (RGBImages/TXTImages) e faz OCR delas para SRT, ASS ou TXT. É construído sobre o motor RapidOCR e mantido ativamente.

Demonstração online do RapidVideOCR pedindo um ZIP de RGBImages ou TXTImages exportado pelo VideoSubFinder
A demonstração do RapidVideOCR diz claramente: alimente-o com os RGBImages/TXTImages que o VideoSubFinder exporta. Captura de tela da demonstração oficial do RapidVideOCR (Apache 2.0).

O que se destaca:

  • Projetado especificamente para a saída do VideoSubFinder — a sincronização passa limpa
  • Saída em SRT, ASS e TXT
  • Instalável via pip, funciona em múltiplas plataformas

Limitações:

  • Não é um extrator autônomo — inútil sem as imagens do VideoSubFinder (e o próprio VideoSubFinder não tem versão para Mac, então a dupla ainda fica presa a Windows/Linux)
  • Focado em CLI; a versão de desktop mais amigável é somente para Windows

Melhor para: Completar o pipeline do VideoSubFinder sem o ABBYY FineReader ou passes manuais de OCR no Subtitle Edit.

Parte 2: Motores de OCR (não são ferramentas completas)

Você também vai ver estes três sendo recomendados. Eles leem texto de imagens isoladas; nenhum encontra os quadros com legenda, remove duplicatas ou gera marcações de tempo, então sozinhos não produzem um SRT.

6. PaddleOCR

Um kit de OCR com deep learning, forte em chinês e outros textos CJK, e o motor do modo local do VideOCR. Usá-lo em vídeo significa escrever seu próprio código de extração de quadros, remoção de duplicatas e sincronização.

7. Tesseract OCR

O veterano motor open-source, projetado para documentos impressos. Texto de vídeo em baixa resolução e estilizado é difícil para ele, a menos que os quadros sejam limpos antes (que é exatamente o que o VideoSubFinder faz).

8. Google Lens

Preciso em quadros bagunçados, mas manual: uma captura de cada vez, sem tempos. O modo híbrido do VideOCR automatiza isso, ao custo de enviar seus quadros para o Google.

Como as 8 opções se comparam?

Ferramenta Plataforma Faz seu próprio OCR Etapas até o SRT Tradução / queima Preço
GeekLinkMac (Apple Silicon) e Windows de 64 bitsSim (local)1Sim — tradução por IA + queima estilizadaNível gratuito; Pro US$ 12,99/mês, US$ 99/ano, US$ 129 vitalício
Video-Subtitle-ExtractorWin / Linux / macOS (otimizado NVIDIA)Sim (local)1NãoGratuito (Apache 2.0)
VideOCRWindows / Linux / DockerSim (PaddleOCR ou Google Lens)1NãoGratuito (MIT)
VideoSubFinderWindows / LinuxNão — apenas imagens2 (precisa de ferramenta de OCR)NãoGratuito (GPLv2)
RapidVideOCRWin / Linux / macOS (pip)Sim (RapidOCR) — nas imagens do VideoSubFinder2 (com VideoSubFinder)NãoGratuito (Apache 2.0)
PaddleOCRBiblioteca PythonApenas motorProgramação DIYNãoGratuito
TesseractBiblioteca / CLIApenas motorDIY / via Subtitle EditNãoGratuito
Google LensNuvemApenas motor (nuvem)Manual / via híbrido VideOCRNãoGratuito

Qual você deve escolher?

Você só quer tirar as legendas, com precisão, no Mac ou no Windows: GeekLink. Importe o vídeo, confirme as linhas de legenda que ele detecta e exporte o SRT — sem recortes, Python, conda ou GPU NVIDIA, e sem logotipos ou marcas d'água no arquivo. A extração e 60 minutos de exportação OCR por mês estão no plano gratuito.

Você também precisa traduzir ou queimar: se as legendas precisam ser revisadas, traduzidas e queimadas de volta em um vídeo finalizado, o GeekLink é a única ferramenta desta lista que faz tudo em um só app — as outras entregam um SRT e param por aí.

Você usa Linux, ou domina Python e tem uma GPU NVIDIA: os extratores open-source (VideOCR, VSE) ou o caminho de duas etapas VideoSubFinder + RapidVideOCR também funcionam, com mais configuração e sem editor, tradução ou queima depois.

Perguntas frequentes

Qual é a melhor ferramenta gratuita para extrair legendas embutidas?

No Mac ou no Windows: o plano gratuito do GeekLink inclui detecção automática das linhas de legenda, extração OCR local e 60 minutos de exportação OCR por mês, sem configurar Python nem GPU. No Linux, as opções open-source (VideOCR, ou VideoSubFinder + RapidVideOCR) são gratuitas, mas exigem mais configuração e param no SRT bruto.

Como extraio legendas embutidas em um Mac?

O GeekLink é a opção de desktop desta lista com versões para Mac e Windows. Os extratores open-source se concentram em Windows/Linux (VideoSubFinder, VideOCR) ou exigem mais configuração (Video-Subtitle-Extractor). O GeekLink roda OCR localmente: importe, desenhe uma caixa ao redor da área da legenda, execute e exporte o SRT.

Preciso de uma GPU para extrair legendas embutidas?

Para os extratores open-source, na prática sim para uma velocidade razoável — VideOCR e Video-Subtitle-Extractor são ambos construídos em torno do NVIDIA CUDA e são lentos na CPU. Em um Mac, o GeekLink roda seu OCR nativamente no Apple Silicon sem uma GPU dedicada.

Alguma dessas ferramentas consegue traduzir as legendas extraídas?

Apenas o GeekLink. As outras param no SRT (ou imagens) no idioma original. O GeekLink traduz na aplicação com Claude 3.5 Haiku, GPT-4o, GPT-4o mini ou DeepSeek, usando contexto entre as linhas, e pode queimar as legendas traduzidas de volta no vídeo.

Devo usar o VideoSubFinder ou o VideOCR?

Os dois rodam só em Windows/Linux. O VideOCR detecta e faz OCR em uma única execução; o VideoSubFinder só gera imagens de texto limpas e os tempos, então você precisa de uma segunda ferramenta de OCR, como o RapidVideOCR. Se você usa Mac, ou quer revisar, traduzir ou queimar o resultado depois, o GeekLink cobre todo o fluxo em um só app.

Por que não usar simplesmente o Google Lens ou o Tesseract diretamente?

Eles são motores de OCR, não ferramentas de vídeo — leem imagens individuais. Extrair legendas de vídeo também exige encontrar quais quadros contêm texto, deduplicar linhas entre quadros e construir as marcações de tempo. Essa camada de vídeo é exatamente o que VideOCR, VSE, VideoSubFinder e GeekLink fornecem por cima de um motor.

Artigos relacionados