TL;DR: 하드코딩(번인) 자막은 영상 이미지의 일부라서, 편집 가능한 텍스트로 되돌리려면 OCR이 필요합니다. 도구 간의 진짜 차이는 설정이 얼마나 필요한지, 그리고 SRT를 얻은 뒤 무엇을 할 수 있는지입니다. Mac이나 Windows라면 종합 1순위는 GeekLink입니다. 자막 줄을 자동으로 찾고, 로고와 워터마크를 걸러 내며, Python이나 GPU 설정 없이 로컬에서 줄마다 읽고, 확신이 낮은 몇 줄만 표시해 주기 때문에 손볼 곳이 거의 없는 깔끔한 SRT를 얻을 수 있습니다. 번역과 번인이 필요할 때도 같은 앱에서 할 수 있습니다. 오픈소스 추출기(VSE, VideOCR, VideoSubFinder + RapidVideOCR)는 주로 Linux 사용자, 그리고 NVIDIA GPU가 있고 원본 SRT만 필요한 기술 사용자에게 맞습니다. 아래에서 OCR 엔진 3개를 포함한 8가지 옵션을 한 표로 비교합니다.
핵심 요점
- 가장 적은 수고로 가장 깔끔한 SRT를 주는 것은 GeekLink입니다. 자막 줄 자동 감지(수동 크롭 불필요), 로고·워터마크 필터링, 두 줄·이중 언어 자막의 줄별 언어 모델, 불확실한 줄 표시까지. Python, conda, CUDA가 필요 없습니다.
- SRT 이상이 필요하다면 이어서 해 주는 도구는 GeekLink뿐입니다 — AI 번역과 번인은 같은 앱의 선택 단계입니다.
- 오픈소스 추출기는 기술 사용자를 위한 도구입니다. VSE와 VideOCR은 NVIDIA GPU에 의존해 CPU에서는 느리고, VideOCR과 VideoSubFinder는 Mac 버전이 없습니다.
- VideoSubFinder는 자체적으로 OCR을 하지 않습니다. 실제 텍스트를 얻으려면 두 번째 프로그램(RapidVideOCR 또는 Subtitle Edit)이 필요하고, 두 앱 사이에서 이미지 묶음을 주고받아야 합니다.
- PaddleOCR, Tesseract, Google Lens는 도구가 아니라 엔진입니다. 단일 이미지만 읽을 뿐이며, 자막 프레임 감지·타이밍·중복 제거는 자막 도구가 그 위에 더하는 부분입니다.
올인원 데스크톱 워크플로가 필요하신가요? GeekLink는 Mac과 Windows에서 번인 자막을 로컬로 추출합니다. 박스를 그리고 OCR을 실행하면 타임스탬프가 붙은 SRT를 얻을 수 있습니다. 무료 티어, 계정 필요 없음.
무료 다운로드파트 1: 전용 자막 추출 도구
이 다섯 가지는 영상에서 하드코딩(번인) 자막을 뽑아내기 위해 특별히 만들어졌습니다. 주로 플랫폼, 워크플로가 몇 단계인지, 그리고 SRT를 얻은 다음 무엇을 할 수 있는지에서 차이가 납니다.
1. GeekLink — 종합 1위: 가장 적은 수작업으로 가장 깔끔한 추출(Mac과 Windows)
가격: 무료 티어(OCR 추출 포함); Pro 월 $12.99, 연 $99(월 약 $8.25), 또는 일회성 평생 $129
플랫폼: Mac(Apple Silicon) 및 64비트 Windows
GeekLink는 이 목록의 어떤 도구보다 적은 수작업으로 바로 쓸 수 있는 깔끔한 SRT를 만들어 주며, 네이티브 Mac 앱이 있는 유일한 도구입니다. 영상을 불러오면 GeekLink가 자막 줄을 자동으로 찾기 때문에 직접 잘라낼 필요가 없고, 로고·워터마크·화면 속 다른 텍스트는 자막 목록에 들어가지 않습니다. 두 줄 자막과 이중 언어 자막은 줄 단위로 처리합니다. 줄마다 언어를 고르면 각 줄을 맞는 모델로 읽기 때문에, 같은 프레임의 중국어 줄과 영어 줄이 모두 제대로 인식됩니다. OCR은 로컬에서 실행되고, 편집기가 확신이 낮은 몇 줄을 표시해 주므로 파일 전체를 교정하는 대신 몇 줄만 확인하면 됩니다. 특이한 레이아웃이라 자동 감지가 맞지 않으면 자막 상자를 직접 그릴 수도 있습니다.
대부분은 여기서 끝입니다. SRT를 내보내면 됩니다. 더 필요하다면 같은 앱에서 번역(Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek — 문맥 인식, 40개 이상 언어)과 영상에 자막 번인까지 할 수 있습니다.
돋보이는 점:
- 자막 줄을 자동으로 찾음(수동 크롭 불필요). 로고, 워터마크, 화면 텍스트는 SRT에서 제외
- 두 줄 자막과 여러 언어가 섞인 자막 지원, 줄마다 맞는 인식 모델 사용
- 불확실한 줄을 표시해 파일 전체가 아니라 몇 줄만 확인
- 네이티브 Mac 앱과 Windows 버전. Python, conda, NVIDIA GPU 불필요. OCR은 100% 로컬 실행, 일괄 처리 내장
- 같은 앱의 선택 기능: AI 번역과 스타일 적용 번인
한계:
- Mac 및 Windows 데스크톱 버전 — Linux 버전 없음
- 클로즈드 소스; AI 번역은 유료(Pro) 기능 — 추출 자체는 무료 티어에 포함
가장 적합한 대상: 환경 설정 없이 번인 자막에서 정확한 SRT를 얻고 싶은 모든 사람, 특히 Mac 사용자. 나중에 번역이나 번인이 필요해도 이미 준비되어 있습니다. 단계별 가이드: OCR로 하드코딩 자막 추출하는 방법.
2. Video-Subtitle-Extractor(VSE) — NVIDIA GPU에 맞춰진 오픈소스 추출기
가격: 무료, 오픈소스(Apache 2.0)
플랫폼: Windows, Linux, macOS(NVIDIA GPU에 최적화; CPU 폴백은 느림)
Video-Subtitle-Extractor는 널리 쓰이는 오픈소스 추출기로, 다국어 로컬 OCR로 번인 자막을 SRT로 추출합니다. 프레임별로 자막 영역을 감지하고, 반복되는 줄을 중복 제거하며, Fast/Auto/Precise 모드를 제공합니다. 특히 중국어권 커뮤니티에서 강력합니다.
돋보이는 점:
- 다국어 지원, 완전 로컬, API 키 없음
- 여러 영상에 걸친 배치 추출(동일 해상도/영역)
- 자매 프로젝트(video-subtitle-remover)로 기존 번인 텍스트를 지울 수 있음
한계:
- NVIDIA/CUDA 지향 — Mac에서는 느린 CPU 처리로 폴백됨
- 릴리스 빌드가 작동하지 않으면 Python/conda 설정 필요; 경로에 공백이나 비ASCII 문자를 포함할 수 없음
- 앱 내 에디터, 번역, 번인 없음
가장 적합한 대상: NVIDIA GPU가 있고 무료 대량 추출을 원하는 기술 사용자, 특히 중국어 콘텐츠. 전체 비교: GeekLink vs VSE.
3. VideOCR — Windows와 Linux용 무료 원스텝 추출기
가격: 무료, 오픈소스(MIT)
플랫폼: Windows, Linux, Docker(CPU 및 NVIDIA GPU 빌드)
VideOCR은 번인 자막이 있는 영상에서 완성된 SRT까지 하나의 프로그램으로 가는 가장 간단한 무료 방법입니다. 영상을 불러오고, 자막 영역을 잘라내고, 실행하면 PaddleOCR로 로컬에서, 또는 하이브리드 클라우드 모드에서 Google Lens로 텍스트를 읽어 타임스탬프가 붙은 SRT를 작성합니다.
돋보이는 점:
- 진정한 1단계 워크플로: 영상 입력, SRT 출력
- 로컬 PaddleOCR 모드(다국어 지원) 또는 더 정확한 Google Lens 하이브리드 모드
- GUI와 CLI, 그리고 Docker 이미지; NVIDIA CUDA 가속
한계:
- macOS 빌드 없음
- 자체 문서에 따르면 CPU에서는 느림 — GPU 빌드가 사실상 필수
- 결과를 검수할 에디터, 번역, 번인 없음
가장 적합한 대상: 무료로 번거로움 없는 추출을 원하고 SRT를 얻으면 작업이 끝나는 Windows/Linux 사용자.
4. VideoSubFinder — 2단계 워크플로의 프레임 감지(자체 OCR 없음)
가격: 무료, 오픈소스(GPLv2)
플랫폼: Windows, Linux
VideoSubFinder는 OCR을 전혀 하지 않습니다. 대신 문제의 영상 절반을 누구보다 잘 해결합니다. 자막 텍스트가 있는 프레임을 찾고, 정확한 타이밍을 기록하며, 배경을 제거한 정제된 이미지를 출력합니다. 그런 다음 그 이미지를 OCR 도구(RapidVideOCR, Subtitle Edit, FineReader)에 넣어 텍스트를 얻습니다. 팬섭의 고전입니다.
돋보이는 점:
- 뛰어난 배경 정제 — OCR 도구에 훨씬 쉬운 이미지를 넘김
- 줄마다 정확한 등장/사라짐 타이밍
- 모든 단계를 검사하고 조정할 수 있음
한계:
- 자체 OCR 없음 — 두 번째 프로그램이 필요함
- macOS 빌드 없음
- 여기서 가장 수동적인 워크플로: 두 개의 앱, 그 사이의 이미지 배치
가장 적합한 대상: 최대한의 제어와 OCR을 위한 가능한 최고의 원본 이미지를 원하는 팬서버와 완벽주의자.
5. RapidVideOCR — VideoSubFinder 출력을 처리하는 OCR 단계
가격: 무료, 오픈소스(Apache 2.0)
플랫폼: Windows, Linux, macOS(Python/pip; Windows용 데스크톱 EXE)
RapidVideOCR은 VideoSubFinder 워크플로의 후반부를 위해 특별히 만들어졌습니다. VideoSubFinder의 정제된 이미지 폴더(RGBImages/TXTImages)를 받아 SRT, ASS, 또는 TXT로 OCR합니다. RapidOCR 엔진 위에 구축되었으며 활발히 유지보수되고 있습니다.
돋보이는 점:
- VideoSubFinder 출력을 위해 특별히 설계됨 — 타이밍이 깔끔하게 전달됨
- SRT, ASS, TXT 출력
- pip으로 설치 가능, 크로스 플랫폼 작동
한계:
- 독립형 추출기가 아님 — VideoSubFinder의 이미지 없이는 쓸모없음(그리고 VideoSubFinder 자체가 Mac 빌드가 없으므로, 이 조합은 여전히 Windows/Linux에 묶임)
- CLI 우선; 더 친절한 데스크톱 버전은 Windows 전용
가장 적합한 대상: ABBYY FineReader나 수동 Subtitle Edit OCR 없이 VideoSubFinder 파이프라인을 완성하기.
파트 2: OCR 엔진(완성된 도구가 아님)
아래 세 가지도 자주 추천됩니다. 모두 단일 이미지에서 글자를 읽을 뿐, 자막 프레임을 찾거나 중복을 제거하거나 타임스탬프를 만들지 않으므로 단독으로는 SRT가 나오지 않습니다.
6. PaddleOCR
딥러닝 OCR 툴킷으로 중국어 등 CJK 문자에 강하며, VideOCR 로컬 모드에 쓰이는 엔진입니다. 영상에 쓰려면 프레임 추출, 중복 제거, 타이밍 코드를 직접 작성해야 합니다.
7. Tesseract OCR
인쇄 문서용으로 설계된 오래된 오픈소스 엔진입니다. 저해상도에 스타일이 들어간 영상 글자는 먼저 이미지를 정제하지 않으면 인식하기 어렵습니다(VideoSubFinder가 하는 일이 바로 이것입니다).
8. Google Lens
복잡한 프레임에서도 정확하지만 수동 작업입니다. 스크린샷을 한 장씩 처리해야 하고 타이밍도 없습니다. VideOCR의 하이브리드 모드로 자동화할 수 있지만, 프레임을 Google로 보내야 합니다.
8가지 옵션은 어떻게 비교될까요?
| 도구 | 플랫폼 | 자체 OCR 수행 | SRT까지 단계 | 번역 / 번인 | 가격 |
|---|---|---|---|---|---|
| GeekLink | Mac(Apple Silicon) 및 64비트 Windows | 예(로컬) | 1 | 예 — AI 번역 + 스타일 번인 | 무료 티어; Pro 월 $12.99, 연 $99, 평생 $129 |
| Video-Subtitle-Extractor | Win / Linux / macOS(NVIDIA 최적화) | 예(로컬) | 1 | 아니오 | 무료(Apache 2.0) |
| VideOCR | Windows / Linux / Docker | 예(PaddleOCR 또는 Google Lens) | 1 | 아니오 | 무료(MIT) |
| VideoSubFinder | Windows / Linux | 아니오 — 이미지만 | 2(OCR 도구 필요) | 아니오 | 무료(GPLv2) |
| RapidVideOCR | Win / Linux / macOS(pip) | 예(RapidOCR) — VideoSubFinder 이미지에 대해 | 2(VideoSubFinder와 함께) | 아니오 | 무료(Apache 2.0) |
| PaddleOCR | Python 라이브러리 | 엔진만 | 직접 스크립팅 | 아니오 | 무료 |
| Tesseract | 라이브러리 / CLI | 엔진만 | 직접 / Subtitle Edit 경유 | 아니오 | 무료 |
| Google Lens | 클라우드 | 엔진만(클라우드) | 수동 / VideOCR 하이브리드 경유 | 아니오 | 무료 |
어떤 것을 선택해야 할까요?
Mac이나 Windows에서 자막만 정확하게 뽑고 싶다면: GeekLink. 영상을 불러오고, 찾아낸 자막 줄을 확인한 뒤 SRT로 내보내면 됩니다. 크롭도, Python·conda·NVIDIA GPU도 필요 없고, 로고와 워터마크는 파일에 섞이지 않습니다. 추출 기능과 월 60분의 OCR 내보내기는 무료 플랜에 포함됩니다.
번역이나 번인도 필요하다면: 자막을 검수하고, 번역하고, 완성 영상에 다시 번인해야 한다면 이 모든 것을 한 앱에서 하는 도구는 여기서 GeekLink뿐입니다. 나머지는 SRT를 건네주는 것으로 끝납니다.
Linux를 쓰거나, Python에 익숙하고 NVIDIA GPU가 있다면: 오픈소스 추출기(VideOCR, VSE)나 VideoSubFinder + RapidVideOCR 2단계 방식도 쓸 수 있지만, 설정이 더 많고 이후 편집·번역·번인은 할 수 없습니다.
자주 묻는 질문
하드코딩 자막을 추출하는 최고의 무료 도구는 무엇인가요?
Mac이나 Windows에서는 GeekLink 무료 플랜으로 자막 줄 자동 감지, 로컬 OCR 추출, 월 60분의 OCR 내보내기를 Python이나 GPU 설정 없이 쓸 수 있습니다. Linux에서는 오픈소스 옵션(VideOCR, 또는 VideoSubFinder + RapidVideOCR)이 무료지만, 설정이 더 필요하고 원본 SRT에서 끝납니다.
Mac에서 하드코딩 자막을 어떻게 추출하나요?
GeekLink는 이 목록에서 Mac과 Windows 버전을 모두 제공하는 데스크톱 선택입니다. 오픈소스 추출기는 Windows/Linux 중심이거나(VideoSubFinder, VideOCR) 더 많은 설정이 필요합니다(Video-Subtitle-Extractor). GeekLink는 로컬에서 OCR을 실행합니다: 가져오기, 자막 영역 주위에 박스 그리기, 실행, SRT 내보내기.
하드코딩 자막을 추출하려면 GPU가 필요한가요?
오픈소스 추출기의 경우, 합리적인 속도를 위해서는 사실상 필요합니다 — VideOCR과 Video-Subtitle-Extractor는 둘 다 NVIDIA CUDA를 중심으로 만들어졌고 CPU에서 느립니다. Mac에서는 GeekLink이 별도의 GPU 없이 Apple Silicon에서 네이티브로 OCR을 실행합니다.
이 도구들 중 추출한 자막을 번역할 수 있는 것이 있나요?
GeekLink뿐입니다. 나머지는 원본 언어 SRT(또는 이미지)에서 멈춥니다. GeekLink은 Claude 3.5 Haiku, GPT-4o, GPT-4o mini, 또는 DeepSeek으로 줄 간 문맥을 활용해 앱 내에서 번역하고, 번역된 자막을 다시 영상에 번인할 수 있습니다.
VideoSubFinder와 VideOCR 중 무엇을 써야 하나요?
둘 다 Windows/Linux 전용입니다. VideOCR은 한 번 실행으로 감지와 OCR을 모두 하고, VideoSubFinder는 정제된 텍스트 이미지와 타이밍만 만들기 때문에 RapidVideOCR 같은 두 번째 OCR 도구가 필요합니다. Mac을 쓰거나 추출 후 검수·번역·번인까지 해야 한다면 GeekLink 하나로 전체 과정을 끝낼 수 있습니다.
왜 그냥 Google Lens나 Tesseract를 직접 쓰면 안 되나요?
그것들은 영상 도구가 아니라 OCR 엔진입니다 — 단일 이미지를 읽습니다. 영상에서 자막을 추출하려면 어떤 프레임에 텍스트가 있는지 찾고, 프레임 간 줄을 중복 제거하고, 타임스탬프를 만들어야 합니다. 그 영상 계층이 바로 VideOCR, VSE, VideoSubFinder, GeekLink가 엔진 위에 제공하는 것입니다.