Tóm tắt: Phụ đề cứng (burn-in) là một phần của hình ảnh video, nên lấy lại chữ chỉnh sửa được nghĩa là phải dùng OCR — và điều thực sự phân biệt các công cụ là chúng cần thiết lập bao nhiêu và điều gì xảy ra sau khi có SRT. Trên Mac hoặc Windows, GeekLink là lựa chọn tốt nhất tổng thể: nó tự động tìm các dòng phụ đề, loại bỏ logo và watermark, đọc từng dòng ngay trên máy mà không cần thiết lập Python hay GPU, và đánh dấu vài dòng nó chưa chắc chắn — để bạn có tệp SRT sạch mà ít phải dọn dẹp. Dịch và gắn cứng phụ đề luôn sẵn sàng nếu bạn cần. Các công cụ mã nguồn mở (VSE, VideOCR, VideoSubFinder + RapidVideOCR) chủ yếu phù hợp với người dùng Linux và người dùng kỹ thuật có GPU NVIDIA chỉ cần một tệp SRT thô. Bên dưới: cả 8 lựa chọn, kể cả ba engine OCR, được so sánh trong một bảng.

Điểm chính

  • GeekLink cho tệp SRT sạch nhất với ít công sức nhất. Tự động phát hiện dòng phụ đề (không cần cắt vùng thủ công), lọc logo và watermark, mô hình ngôn ngữ riêng cho từng dòng với phụ đề hai dòng và song ngữ, và đánh dấu các dòng chưa chắc chắn — không cần Python, conda hay CUDA.
  • Nếu bạn cần nhiều hơn tệp SRT, chỉ GeekLink làm tiếp được — dịch bằng AI và gắn cứng phụ đề là các bước tùy chọn trong cùng ứng dụng.
  • Các công cụ mã nguồn mở được làm cho người dùng kỹ thuật. VSE và VideOCR dựa vào GPU NVIDIA và chạy chậm trên CPU; VideOCR và VideoSubFinder không có bản cho Mac.
  • VideoSubFinder không tự làm OCR. Nó cần một chương trình thứ hai (RapidVideOCR hoặc Subtitle Edit) để lấy chữ thực sự — hai ứng dụng, với các lô ảnh chuyển qua lại.
  • PaddleOCR, Tesseract và Google Lens là engine, không phải công cụ hoàn chỉnh. Chúng đọc từng ảnh đơn lẻ; phát hiện khung hình, căn thời gian và loại bỏ trùng lặp là những gì một công cụ phụ đề bổ sung thêm.

Muốn một quy trình desktop tất cả trong một? GeekLink tự động tìm các dòng phụ đề, trích xuất chúng ngay trên máy Mac và Windows, và xuất tệp SRT có mốc thời gian. Có gói miễn phí, không cần tài khoản.

Tải miễn phí

Phần 1: Công cụ chuyên trích xuất phụ đề

Năm công cụ này được làm riêng để lấy phụ đề cứng (burn-in) ra khỏi video. Chúng khác nhau chủ yếu ở nền tảng, số bước trong quy trình và điều gì xảy ra sau khi bạn có SRT.

1. GeekLink — Tốt nhất tổng thể: trích xuất sạch nhất với ít thao tác thủ công nhất (Mac và Windows)

Giá: Gói miễn phí (đã gồm trích xuất OCR); Pro $12.99/tháng, $99/năm (~$8.25/tháng), hoặc $169 trọn đời trả một lần
Nền tảng: Mac (Apple Silicon) và Windows 64-bit

GeekLink cho bạn tệp SRT sạch, dùng được ngay với ít thao tác thủ công hơn mọi công cụ khác trong danh sách — và là công cụ duy nhất có ứng dụng Mac gốc. Nhập video và GeekLink tự động tìm các dòng phụ đề, nên không phải cắt vùng bằng tay, đồng thời loại logo, watermark và chữ khác trên màn hình khỏi danh sách phụ đề. Phụ đề hai dòng và song ngữ được xử lý theo từng dòng: bạn chọn ngôn ngữ cho mỗi dòng, và mỗi dòng được đọc bằng mô hình tương ứng, nên một dòng tiếng Trung và một dòng tiếng Anh trong cùng khung hình đều ra đúng. OCR chạy trên máy, và trình chỉnh sửa đánh dấu vài dòng nó kém chắc chắn nhất, để bạn chỉ kiểm tra vài dòng thay vì soát lại cả tệp. Nếu tính năng tự động phát hiện không hợp với một bố cục bất thường, bạn có thể tự vẽ khung phụ đề.

Với phần lớn mọi người, công việc kết thúc ở đây: xuất SRT là xong. Nếu cần thêm, cùng ứng dụng còn có thể dịch (Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek — hiểu ngữ cảnh, hơn 40 ngôn ngữ) và gắn cứng phụ đề trở lại vào video.

GeekLink trên macOS tự động phát hiện hai dòng phụ đề tiếng Anh trong một clip phóng tàu của NASA, đồng thời tách riêng chữ khác trên màn hình
GeekLink tự động phát hiện các dòng phụ đề tiếng Anh riêng biệt trong video phóng tàu và giữ chữ khác trên màn hình tách khỏi danh sách phụ đề.

Điểm nổi bật:

  • Tự động tìm dòng phụ đề — không cần cắt vùng thủ công — và loại logo, watermark và chữ trên màn hình khỏi tệp SRT
  • Xử lý phụ đề hai dòng và nhiều ngôn ngữ, dùng đúng mô hình nhận dạng cho từng dòng
  • Đánh dấu các dòng chưa chắc chắn, để bạn chỉ rà soát vài dòng thay vì cả tệp
  • Ứng dụng Mac gốc cùng bản Windows — không cần Python, conda hay GPU NVIDIA; OCR chạy 100% trên máy; tích hợp xử lý hàng loạt
  • Tính năng tùy chọn trong cùng ứng dụng: dịch bằng AI và gắn cứng phụ đề có định dạng

Hạn chế:

  • Ứng dụng desktop cho Mac và Windows; không có bản Linux hay bản web
  • Mã nguồn đóng; dịch bằng AI là tính năng trả phí (Pro) — bản thân việc trích xuất nằm trong gói miễn phí

Phù hợp nhất cho: Bất kỳ ai muốn có tệp SRT chính xác từ phụ đề cứng mà không cần thiết lập — đặc biệt trên Mac. Nếu sau này cần dịch hay gắn cứng phụ đề, mọi thứ đã có sẵn. Hướng dẫn từng bước: Cách trích xuất phụ đề cứng bằng OCR.

2. Video-Subtitle-Extractor (VSE) — Công cụ trích xuất mã nguồn mở tối ưu cho GPU NVIDIA

Giá: Miễn phí, mã nguồn mở (Apache 2.0)
Nền tảng: Windows, Linux, macOS (tối ưu cho GPU NVIDIA; chạy bằng CPU thì chậm)

Video-Subtitle-Extractor là công cụ trích xuất mã nguồn mở được dùng rộng rãi, lấy phụ đề cứng ra SRT bằng OCR chạy trên máy với nhiều ngôn ngữ. Nó phát hiện vùng phụ đề theo từng khung hình, loại bỏ các dòng lặp lại và có các chế độ Fast/Auto/Precise. Đặc biệt mạnh trong cộng đồng nói tiếng Trung.

Giao diện Video-Subtitle-Extractor phát hiện một dòng phụ đề cứng tiếng Anh trong khung hình anime, kèm hàng đợi xử lý và nhật ký nhận dạng
VSE phát hiện dòng phụ đề (khung xanh lá) với hàng đợi xử lý ở bên phải — giao diện ưu tiên tiếng Trung. Ảnh chụp màn hình từ kho mã chính thức của VSE (Apache 2.0).

Điểm nổi bật:

  • Nhiều ngôn ngữ, hoàn toàn trên máy, không cần API key
  • Trích xuất hàng loạt cho nhiều video (cùng độ phân giải/vùng)
  • Dự án anh em (video-subtitle-remover) có thể xóa chữ in cứng cũ

Hạn chế:

  • Thiết kế hướng NVIDIA/CUDA — trên Mac phải chạy bằng CPU rất chậm
  • Cần thiết lập Python/conda nếu bản phát hành không chạy được; đường dẫn không được chứa khoảng trắng hay ký tự ngoài ASCII
  • Không có trình chỉnh sửa, dịch hay gắn cứng phụ đề trong ứng dụng

Phù hợp nhất cho: Người dùng kỹ thuật có GPU NVIDIA muốn trích xuất hàng loạt miễn phí, đặc biệt với nội dung tiếng Trung. So sánh đầy đủ: GeekLink và VSE.

3. VideOCR — Công cụ trích xuất một bước miễn phí cho Windows và Linux

Giá: Miễn phí, mã nguồn mở (MIT)
Nền tảng: Windows, Linux, Docker (bản CPU & GPU NVIDIA)

VideOCR là cách miễn phí đơn giản nhất để đi từ video có phụ đề cứng đến tệp SRT hoàn chỉnh trong một chương trình. Mở video, cắt vùng phụ đề, chạy — nó đọc chữ bằng PaddleOCR ngay trên máy, hoặc bằng Google Lens ở chế độ kết hợp đám mây, và ghi ra tệp SRT có mốc thời gian.

Giao diện VideOCR trên Windows với khung cắt quanh phụ đề cứng song ngữ, engine OCR đặt là PaddleOCR phát hiện + Google Lens nhận dạng
Giao diện VideOCR trên Windows: khung cắt quanh dòng phụ đề, engine đặt ở chế độ kết hợp PaddleOCR + Google Lens. Ảnh chụp màn hình từ kho mã chính thức của VideOCR (MIT).

Điểm nổi bật:

  • Quy trình một bước thực sự: đưa video vào, nhận SRT
  • Chế độ PaddleOCR trên máy (nhiều ngôn ngữ) hoặc chế độ kết hợp Google Lens chính xác hơn
  • Có GUI và CLI, cùng image Docker; tăng tốc bằng NVIDIA CUDA

Hạn chế:

  • Không có bản macOS
  • Chạy chậm trên CPU theo chính tài liệu của nó — bạn thực sự cần bản GPU
  • Không có trình chỉnh sửa để rà soát kết quả, không dịch, không gắn cứng phụ đề

Phù hợp nhất cho: Người dùng Windows/Linux muốn trích xuất miễn phí, không rườm rà và chỉ cần có tệp SRT là xong.

4. VideoSubFinder — Phát hiện khung hình cho quy trình hai bước (không tự làm OCR)

Giá: Miễn phí, mã nguồn mở (GPLv2)
Nền tảng: Windows, Linux

VideoSubFinder hoàn toàn không làm OCR — nó giải quyết nửa phần “video” của bài toán tốt hơn bất kỳ ai: tìm khung hình có chữ phụ đề, ghi lại thời gian chính xác và xuất ra ảnh đã làm sạch, bỏ hết nền. Sau đó bạn đưa các ảnh đó qua một công cụ OCR (RapidVideOCR, Subtitle Edit, FineReader) để lấy chữ. Một công cụ kinh điển của giới fansub.

Điểm nổi bật:

  • Làm sạch nền xuất sắc — giao cho công cụ OCR của bạn những ảnh dễ đọc hơn nhiều
  • Thời điểm xuất hiện/biến mất chính xác cho từng dòng
  • Mọi giai đoạn đều kiểm tra và tinh chỉnh được

Hạn chế:

  • Không tự làm OCR — bắt buộc cần chương trình thứ hai
  • Không có bản macOS
  • Quy trình thủ công nhất trong danh sách: hai ứng dụng, các lô ảnh chuyển qua lại

Phù hợp nhất cho: Dân làm fansub và người cầu toàn muốn kiểm soát tối đa và có ảnh gốc tốt nhất cho OCR.

5. RapidVideOCR — Bước OCR cho đầu ra của VideoSubFinder

Giá: Miễn phí, mã nguồn mở (Apache 2.0)
Nền tảng: Windows, Linux, macOS (Python/pip; có bản EXE desktop cho Windows)

RapidVideOCR là nửa sau được làm riêng cho quy trình VideoSubFinder: nó nhận các thư mục ảnh đã làm sạch của VideoSubFinder (RGBImages/TXTImages) và OCR thành SRT, ASS hoặc TXT. Nó được xây dựng trên engine RapidOCR và đang được bảo trì tích cực.

Bản demo trực tuyến của RapidVideOCR yêu cầu tệp ZIP chứa RGBImages hoặc TXTImages do VideoSubFinder xuất ra
Bản demo của RapidVideOCR nói rõ: hãy đưa vào RGBImages/TXTImages mà VideoSubFinder xuất ra. Ảnh chụp màn hình từ bản demo chính thức của RapidVideOCR (Apache 2.0).

Điểm nổi bật:

  • Thiết kế riêng cho đầu ra của VideoSubFinder — thời gian được giữ nguyên gọn gàng
  • Xuất ra SRT, ASS và TXT
  • Cài được bằng pip, chạy đa nền tảng

Hạn chế:

  • Không phải công cụ trích xuất độc lập — vô dụng nếu không có ảnh của VideoSubFinder (mà bản thân VideoSubFinder không có bản Mac, nên cặp công cụ này vẫn gắn với Windows/Linux)
  • Ưu tiên CLI; bản desktop thân thiện hơn chỉ có cho Windows

Phù hợp nhất cho: Hoàn thiện quy trình VideoSubFinder mà không cần ABBYY FineReader hay chạy OCR thủ công bằng Subtitle Edit.

Phần 2: Engine OCR (không phải công cụ hoàn chỉnh)

Bạn cũng sẽ thấy ba engine này được giới thiệu. Chúng đọc chữ từ từng ảnh đơn lẻ; không cái nào tìm khung hình có phụ đề, loại bỏ trùng lặp hay tạo mốc thời gian, nên tự chúng không tạo ra được tệp SRT.

6. PaddleOCR

Bộ công cụ OCR học sâu, mạnh với chữ Trung và các chữ CJK khác, và là engine bên trong chế độ chạy trên máy của VideOCR. Dùng nó cho video nghĩa là phải tự viết mã trích khung hình, loại trùng lặp và căn thời gian.

7. Tesseract OCR

Engine mã nguồn mở lâu đời, thiết kế cho tài liệu in. Chữ video độ phân giải thấp, cách điệu là mục tiêu khó với nó, trừ khi khung hình được làm sạch trước (chính là việc VideoSubFinder làm).

8. Google Lens

Chính xác trên khung hình lộn xộn, nhưng thủ công — mỗi lần một ảnh chụp màn hình, không có thời gian. Chế độ kết hợp của VideOCR tự động hóa việc này, đổi lại khung hình của bạn được gửi đến Google.

Cả 8 lựa chọn so sánh với nhau thế nào?

Công cụ Nền tảng Tự làm OCR Số bước đến SRT Dịch / gắn cứng Giá
GeekLinkMac (Apple Silicon) và Windows 64-bitCó (trên máy)1Có — dịch bằng AI + gắn cứng có định dạngGói miễn phí; Pro $12.99/tháng, $99/năm, $169 trọn đời
Video-Subtitle-ExtractorWin / Linux / macOS (tối ưu cho NVIDIA)Có (trên máy)1Không cóMiễn phí (Apache 2.0)
VideOCRWindows / Linux / DockerCó (PaddleOCR hoặc Google Lens)1Không cóMiễn phí (MIT)
VideoSubFinderWindows / LinuxKhông — chỉ ra ảnh2 (cần công cụ OCR)Không cóMiễn phí (GPLv2)
RapidVideOCRWin / Linux / macOS (pip)Có (RapidOCR) — trên ảnh của VideoSubFinder2 (cùng VideoSubFinder)Không cóMiễn phí (Apache 2.0)
PaddleOCRThư viện PythonChỉ là engineTự viết scriptKhông cóMiễn phí
TesseractThư viện / CLIChỉ là engineTự làm / qua Subtitle EditKhông cóMiễn phí
Google LensĐám mâyChỉ là engine (đám mây)Thủ công / qua chế độ kết hợp của VideOCRKhông cóMiễn phí

Bạn nên chọn công cụ nào?

Bạn chỉ muốn lấy phụ đề ra, chính xác, trên Mac hoặc Windows: GeekLink. Nhập video, xác nhận các dòng phụ đề nó tìm được và xuất SRT — không cần cắt vùng, Python, conda hay GPU NVIDIA, và logo cùng watermark không lọt vào tệp. Trích xuất và 60 phút xuất OCR mỗi tháng nằm trong gói miễn phí.

Bạn còn cần dịch hoặc gắn cứng phụ đề: nếu phụ đề cần được rà soát, dịch và gắn cứng trở lại vào video hoàn chỉnh, GeekLink là công cụ duy nhất ở đây làm được tất cả trong một ứng dụng — mọi công cụ khác đưa bạn tệp SRT rồi dừng lại.

Bạn dùng Linux, hoặc quen với Python và có GPU NVIDIA: các công cụ mã nguồn mở (VideOCR, VSE) hoặc quy trình hai bước VideoSubFinder + RapidVideOCR có thể dùng được, với nhiều bước thiết lập hơn và không có trình chỉnh sửa, dịch hay gắn cứng phụ đề sau đó.

Câu hỏi thường gặp

Công cụ miễn phí tốt nhất để trích xuất phụ đề cứng là gì?

Trên Mac hoặc Windows: gói miễn phí của GeekLink bao gồm tự động phát hiện dòng phụ đề, trích xuất OCR trên máy và 60 phút xuất OCR mỗi tháng, không cần thiết lập Python hay GPU. Trên Linux, các lựa chọn mã nguồn mở (VideOCR, hoặc VideoSubFinder + RapidVideOCR) miễn phí nhưng cần thiết lập nhiều hơn và dừng ở tệp SRT thô.

Làm sao để trích xuất phụ đề cứng trên Mac?

GeekLink là lựa chọn desktop trong danh sách có cả bản Mac và Windows. Các công cụ mã nguồn mở tập trung vào Windows/Linux (VideoSubFinder, VideOCR) hoặc cần thiết lập nhiều hơn (Video-Subtitle-Extractor). GeekLink chạy OCR trên máy: nhập, rà soát các dòng phụ đề nó tự động phát hiện, chạy và xuất SRT.

Tôi có cần GPU để trích xuất phụ đề cứng không?

Với các công cụ mã nguồn mở, trên thực tế là có nếu muốn tốc độ hợp lý — VideOCR và Video-Subtitle-Extractor đều được xây dựng quanh NVIDIA CUDA và chạy chậm trên CPU. Trên Mac, GeekLink chạy OCR gốc trên phần cứng desktop đời mới mà không cần GPU rời.

Có công cụ nào trong số này dịch được phụ đề đã trích xuất không?

Chỉ GeekLink. Các công cụ khác dừng ở tệp SRT ngôn ngữ gốc (hoặc ảnh). GeekLink dịch ngay trong ứng dụng bằng Claude 3.5 Haiku, GPT-4o, GPT-4o mini hoặc DeepSeek, dùng ngữ cảnh xuyên suốt các dòng, và có thể gắn cứng phụ đề đã dịch trở lại vào video.

Tôi nên dùng VideoSubFinder hay VideOCR?

Cả hai chỉ có cho Windows/Linux. VideOCR phát hiện và OCR trong một lần chạy; VideoSubFinder chỉ tạo ảnh chữ đã làm sạch và thời gian, nên bạn cần thêm một công cụ OCR như RapidVideOCR. Nếu bạn dùng Mac, hoặc muốn rà soát, dịch hay gắn cứng kết quả sau đó, GeekLink bao trọn quy trình trong một ứng dụng.

Sao không dùng thẳng Google Lens hay Tesseract?

Chúng là engine OCR, không phải công cụ video — chúng đọc từng ảnh đơn lẻ. Trích xuất phụ đề từ video còn cần tìm khung hình nào có chữ, loại bỏ dòng trùng lặp qua các khung hình và tạo mốc thời gian. Lớp xử lý video đó chính là thứ VideOCR, VSE, VideoSubFinder và GeekLink bổ sung bên trên một engine.

Bài viết liên quan