Tóm tắt: Phụ đề cứng (burn-in) là một phần của hình ảnh video, nên lấy lại chữ chỉnh sửa được nghĩa là phải dùng OCR — và điều thực sự phân biệt các công cụ là chúng cần thiết lập bao nhiêu và điều gì xảy ra sau khi có SRT. Trên Mac hoặc Windows, GeekLink là lựa chọn tốt nhất tổng thể: nó tự động tìm các dòng phụ đề, loại bỏ logo và watermark, đọc từng dòng ngay trên máy mà không cần thiết lập Python hay GPU, và đánh dấu vài dòng nó chưa chắc chắn — để bạn có tệp SRT sạch mà ít phải dọn dẹp. Dịch và gắn cứng phụ đề luôn sẵn sàng nếu bạn cần. Các công cụ mã nguồn mở (VSE, VideOCR, VideoSubFinder + RapidVideOCR) chủ yếu phù hợp với người dùng Linux và người dùng kỹ thuật có GPU NVIDIA chỉ cần một tệp SRT thô. Bên dưới: cả 8 lựa chọn, kể cả ba engine OCR, được so sánh trong một bảng.
Điểm chính
- GeekLink cho tệp SRT sạch nhất với ít công sức nhất. Tự động phát hiện dòng phụ đề (không cần cắt vùng thủ công), lọc logo và watermark, mô hình ngôn ngữ riêng cho từng dòng với phụ đề hai dòng và song ngữ, và đánh dấu các dòng chưa chắc chắn — không cần Python, conda hay CUDA.
- Nếu bạn cần nhiều hơn tệp SRT, chỉ GeekLink làm tiếp được — dịch bằng AI và gắn cứng phụ đề là các bước tùy chọn trong cùng ứng dụng.
- Các công cụ mã nguồn mở được làm cho người dùng kỹ thuật. VSE và VideOCR dựa vào GPU NVIDIA và chạy chậm trên CPU; VideOCR và VideoSubFinder không có bản cho Mac.
- VideoSubFinder không tự làm OCR. Nó cần một chương trình thứ hai (RapidVideOCR hoặc Subtitle Edit) để lấy chữ thực sự — hai ứng dụng, với các lô ảnh chuyển qua lại.
- PaddleOCR, Tesseract và Google Lens là engine, không phải công cụ hoàn chỉnh. Chúng đọc từng ảnh đơn lẻ; phát hiện khung hình, căn thời gian và loại bỏ trùng lặp là những gì một công cụ phụ đề bổ sung thêm.
Muốn một quy trình desktop tất cả trong một? GeekLink tự động tìm các dòng phụ đề, trích xuất chúng ngay trên máy Mac và Windows, và xuất tệp SRT có mốc thời gian. Có gói miễn phí, không cần tài khoản.
Tải miễn phíPhần 1: Công cụ chuyên trích xuất phụ đề
Năm công cụ này được làm riêng để lấy phụ đề cứng (burn-in) ra khỏi video. Chúng khác nhau chủ yếu ở nền tảng, số bước trong quy trình và điều gì xảy ra sau khi bạn có SRT.
1. GeekLink — Tốt nhất tổng thể: trích xuất sạch nhất với ít thao tác thủ công nhất (Mac và Windows)
Giá: Gói miễn phí (đã gồm trích xuất OCR); Pro $12.99/tháng, $99/năm (~$8.25/tháng), hoặc $169 trọn đời trả một lần
Nền tảng: Mac (Apple Silicon) và Windows 64-bit
GeekLink cho bạn tệp SRT sạch, dùng được ngay với ít thao tác thủ công hơn mọi công cụ khác trong danh sách — và là công cụ duy nhất có ứng dụng Mac gốc. Nhập video và GeekLink tự động tìm các dòng phụ đề, nên không phải cắt vùng bằng tay, đồng thời loại logo, watermark và chữ khác trên màn hình khỏi danh sách phụ đề. Phụ đề hai dòng và song ngữ được xử lý theo từng dòng: bạn chọn ngôn ngữ cho mỗi dòng, và mỗi dòng được đọc bằng mô hình tương ứng, nên một dòng tiếng Trung và một dòng tiếng Anh trong cùng khung hình đều ra đúng. OCR chạy trên máy, và trình chỉnh sửa đánh dấu vài dòng nó kém chắc chắn nhất, để bạn chỉ kiểm tra vài dòng thay vì soát lại cả tệp. Nếu tính năng tự động phát hiện không hợp với một bố cục bất thường, bạn có thể tự vẽ khung phụ đề.
Với phần lớn mọi người, công việc kết thúc ở đây: xuất SRT là xong. Nếu cần thêm, cùng ứng dụng còn có thể dịch (Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek — hiểu ngữ cảnh, hơn 40 ngôn ngữ) và gắn cứng phụ đề trở lại vào video.
Điểm nổi bật:
- Tự động tìm dòng phụ đề — không cần cắt vùng thủ công — và loại logo, watermark và chữ trên màn hình khỏi tệp SRT
- Xử lý phụ đề hai dòng và nhiều ngôn ngữ, dùng đúng mô hình nhận dạng cho từng dòng
- Đánh dấu các dòng chưa chắc chắn, để bạn chỉ rà soát vài dòng thay vì cả tệp
- Ứng dụng Mac gốc cùng bản Windows — không cần Python, conda hay GPU NVIDIA; OCR chạy 100% trên máy; tích hợp xử lý hàng loạt
- Tính năng tùy chọn trong cùng ứng dụng: dịch bằng AI và gắn cứng phụ đề có định dạng
Hạn chế:
- Ứng dụng desktop cho Mac và Windows; không có bản Linux hay bản web
- Mã nguồn đóng; dịch bằng AI là tính năng trả phí (Pro) — bản thân việc trích xuất nằm trong gói miễn phí
Phù hợp nhất cho: Bất kỳ ai muốn có tệp SRT chính xác từ phụ đề cứng mà không cần thiết lập — đặc biệt trên Mac. Nếu sau này cần dịch hay gắn cứng phụ đề, mọi thứ đã có sẵn. Hướng dẫn từng bước: Cách trích xuất phụ đề cứng bằng OCR.
2. Video-Subtitle-Extractor (VSE) — Công cụ trích xuất mã nguồn mở tối ưu cho GPU NVIDIA
Giá: Miễn phí, mã nguồn mở (Apache 2.0)
Nền tảng: Windows, Linux, macOS (tối ưu cho GPU NVIDIA; chạy bằng CPU thì chậm)
Video-Subtitle-Extractor là công cụ trích xuất mã nguồn mở được dùng rộng rãi, lấy phụ đề cứng ra SRT bằng OCR chạy trên máy với nhiều ngôn ngữ. Nó phát hiện vùng phụ đề theo từng khung hình, loại bỏ các dòng lặp lại và có các chế độ Fast/Auto/Precise. Đặc biệt mạnh trong cộng đồng nói tiếng Trung.
Điểm nổi bật:
- Nhiều ngôn ngữ, hoàn toàn trên máy, không cần API key
- Trích xuất hàng loạt cho nhiều video (cùng độ phân giải/vùng)
- Dự án anh em (video-subtitle-remover) có thể xóa chữ in cứng cũ
Hạn chế:
- Thiết kế hướng NVIDIA/CUDA — trên Mac phải chạy bằng CPU rất chậm
- Cần thiết lập Python/conda nếu bản phát hành không chạy được; đường dẫn không được chứa khoảng trắng hay ký tự ngoài ASCII
- Không có trình chỉnh sửa, dịch hay gắn cứng phụ đề trong ứng dụng
Phù hợp nhất cho: Người dùng kỹ thuật có GPU NVIDIA muốn trích xuất hàng loạt miễn phí, đặc biệt với nội dung tiếng Trung. So sánh đầy đủ: GeekLink và VSE.
3. VideOCR — Công cụ trích xuất một bước miễn phí cho Windows và Linux
Giá: Miễn phí, mã nguồn mở (MIT)
Nền tảng: Windows, Linux, Docker (bản CPU & GPU NVIDIA)
VideOCR là cách miễn phí đơn giản nhất để đi từ video có phụ đề cứng đến tệp SRT hoàn chỉnh trong một chương trình. Mở video, cắt vùng phụ đề, chạy — nó đọc chữ bằng PaddleOCR ngay trên máy, hoặc bằng Google Lens ở chế độ kết hợp đám mây, và ghi ra tệp SRT có mốc thời gian.
Điểm nổi bật:
- Quy trình một bước thực sự: đưa video vào, nhận SRT
- Chế độ PaddleOCR trên máy (nhiều ngôn ngữ) hoặc chế độ kết hợp Google Lens chính xác hơn
- Có GUI và CLI, cùng image Docker; tăng tốc bằng NVIDIA CUDA
Hạn chế:
- Không có bản macOS
- Chạy chậm trên CPU theo chính tài liệu của nó — bạn thực sự cần bản GPU
- Không có trình chỉnh sửa để rà soát kết quả, không dịch, không gắn cứng phụ đề
Phù hợp nhất cho: Người dùng Windows/Linux muốn trích xuất miễn phí, không rườm rà và chỉ cần có tệp SRT là xong.
4. VideoSubFinder — Phát hiện khung hình cho quy trình hai bước (không tự làm OCR)
Giá: Miễn phí, mã nguồn mở (GPLv2)
Nền tảng: Windows, Linux
VideoSubFinder hoàn toàn không làm OCR — nó giải quyết nửa phần “video” của bài toán tốt hơn bất kỳ ai: tìm khung hình có chữ phụ đề, ghi lại thời gian chính xác và xuất ra ảnh đã làm sạch, bỏ hết nền. Sau đó bạn đưa các ảnh đó qua một công cụ OCR (RapidVideOCR, Subtitle Edit, FineReader) để lấy chữ. Một công cụ kinh điển của giới fansub.
Điểm nổi bật:
- Làm sạch nền xuất sắc — giao cho công cụ OCR của bạn những ảnh dễ đọc hơn nhiều
- Thời điểm xuất hiện/biến mất chính xác cho từng dòng
- Mọi giai đoạn đều kiểm tra và tinh chỉnh được
Hạn chế:
- Không tự làm OCR — bắt buộc cần chương trình thứ hai
- Không có bản macOS
- Quy trình thủ công nhất trong danh sách: hai ứng dụng, các lô ảnh chuyển qua lại
Phù hợp nhất cho: Dân làm fansub và người cầu toàn muốn kiểm soát tối đa và có ảnh gốc tốt nhất cho OCR.
5. RapidVideOCR — Bước OCR cho đầu ra của VideoSubFinder
Giá: Miễn phí, mã nguồn mở (Apache 2.0)
Nền tảng: Windows, Linux, macOS (Python/pip; có bản EXE desktop cho Windows)
RapidVideOCR là nửa sau được làm riêng cho quy trình VideoSubFinder: nó nhận các thư mục ảnh đã làm sạch của VideoSubFinder (RGBImages/TXTImages) và OCR thành SRT, ASS hoặc TXT. Nó được xây dựng trên engine RapidOCR và đang được bảo trì tích cực.
Điểm nổi bật:
- Thiết kế riêng cho đầu ra của VideoSubFinder — thời gian được giữ nguyên gọn gàng
- Xuất ra SRT, ASS và TXT
- Cài được bằng pip, chạy đa nền tảng
Hạn chế:
- Không phải công cụ trích xuất độc lập — vô dụng nếu không có ảnh của VideoSubFinder (mà bản thân VideoSubFinder không có bản Mac, nên cặp công cụ này vẫn gắn với Windows/Linux)
- Ưu tiên CLI; bản desktop thân thiện hơn chỉ có cho Windows
Phù hợp nhất cho: Hoàn thiện quy trình VideoSubFinder mà không cần ABBYY FineReader hay chạy OCR thủ công bằng Subtitle Edit.
Phần 2: Engine OCR (không phải công cụ hoàn chỉnh)
Bạn cũng sẽ thấy ba engine này được giới thiệu. Chúng đọc chữ từ từng ảnh đơn lẻ; không cái nào tìm khung hình có phụ đề, loại bỏ trùng lặp hay tạo mốc thời gian, nên tự chúng không tạo ra được tệp SRT.
6. PaddleOCR
Bộ công cụ OCR học sâu, mạnh với chữ Trung và các chữ CJK khác, và là engine bên trong chế độ chạy trên máy của VideOCR. Dùng nó cho video nghĩa là phải tự viết mã trích khung hình, loại trùng lặp và căn thời gian.
7. Tesseract OCR
Engine mã nguồn mở lâu đời, thiết kế cho tài liệu in. Chữ video độ phân giải thấp, cách điệu là mục tiêu khó với nó, trừ khi khung hình được làm sạch trước (chính là việc VideoSubFinder làm).
8. Google Lens
Chính xác trên khung hình lộn xộn, nhưng thủ công — mỗi lần một ảnh chụp màn hình, không có thời gian. Chế độ kết hợp của VideOCR tự động hóa việc này, đổi lại khung hình của bạn được gửi đến Google.
Cả 8 lựa chọn so sánh với nhau thế nào?
| Công cụ | Nền tảng | Tự làm OCR | Số bước đến SRT | Dịch / gắn cứng | Giá |
|---|---|---|---|---|---|
| GeekLink | Mac (Apple Silicon) và Windows 64-bit | Có (trên máy) | 1 | Có — dịch bằng AI + gắn cứng có định dạng | Gói miễn phí; Pro $12.99/tháng, $99/năm, $169 trọn đời |
| Video-Subtitle-Extractor | Win / Linux / macOS (tối ưu cho NVIDIA) | Có (trên máy) | 1 | Không có | Miễn phí (Apache 2.0) |
| VideOCR | Windows / Linux / Docker | Có (PaddleOCR hoặc Google Lens) | 1 | Không có | Miễn phí (MIT) |
| VideoSubFinder | Windows / Linux | Không — chỉ ra ảnh | 2 (cần công cụ OCR) | Không có | Miễn phí (GPLv2) |
| RapidVideOCR | Win / Linux / macOS (pip) | Có (RapidOCR) — trên ảnh của VideoSubFinder | 2 (cùng VideoSubFinder) | Không có | Miễn phí (Apache 2.0) |
| PaddleOCR | Thư viện Python | Chỉ là engine | Tự viết script | Không có | Miễn phí |
| Tesseract | Thư viện / CLI | Chỉ là engine | Tự làm / qua Subtitle Edit | Không có | Miễn phí |
| Google Lens | Đám mây | Chỉ là engine (đám mây) | Thủ công / qua chế độ kết hợp của VideOCR | Không có | Miễn phí |
Bạn nên chọn công cụ nào?
Bạn chỉ muốn lấy phụ đề ra, chính xác, trên Mac hoặc Windows: GeekLink. Nhập video, xác nhận các dòng phụ đề nó tìm được và xuất SRT — không cần cắt vùng, Python, conda hay GPU NVIDIA, và logo cùng watermark không lọt vào tệp. Trích xuất và 60 phút xuất OCR mỗi tháng nằm trong gói miễn phí.
Bạn còn cần dịch hoặc gắn cứng phụ đề: nếu phụ đề cần được rà soát, dịch và gắn cứng trở lại vào video hoàn chỉnh, GeekLink là công cụ duy nhất ở đây làm được tất cả trong một ứng dụng — mọi công cụ khác đưa bạn tệp SRT rồi dừng lại.
Bạn dùng Linux, hoặc quen với Python và có GPU NVIDIA: các công cụ mã nguồn mở (VideOCR, VSE) hoặc quy trình hai bước VideoSubFinder + RapidVideOCR có thể dùng được, với nhiều bước thiết lập hơn và không có trình chỉnh sửa, dịch hay gắn cứng phụ đề sau đó.
Câu hỏi thường gặp
Công cụ miễn phí tốt nhất để trích xuất phụ đề cứng là gì?
Trên Mac hoặc Windows: gói miễn phí của GeekLink bao gồm tự động phát hiện dòng phụ đề, trích xuất OCR trên máy và 60 phút xuất OCR mỗi tháng, không cần thiết lập Python hay GPU. Trên Linux, các lựa chọn mã nguồn mở (VideOCR, hoặc VideoSubFinder + RapidVideOCR) miễn phí nhưng cần thiết lập nhiều hơn và dừng ở tệp SRT thô.
Làm sao để trích xuất phụ đề cứng trên Mac?
GeekLink là lựa chọn desktop trong danh sách có cả bản Mac và Windows. Các công cụ mã nguồn mở tập trung vào Windows/Linux (VideoSubFinder, VideOCR) hoặc cần thiết lập nhiều hơn (Video-Subtitle-Extractor). GeekLink chạy OCR trên máy: nhập, rà soát các dòng phụ đề nó tự động phát hiện, chạy và xuất SRT.
Tôi có cần GPU để trích xuất phụ đề cứng không?
Với các công cụ mã nguồn mở, trên thực tế là có nếu muốn tốc độ hợp lý — VideOCR và Video-Subtitle-Extractor đều được xây dựng quanh NVIDIA CUDA và chạy chậm trên CPU. Trên Mac, GeekLink chạy OCR gốc trên phần cứng desktop đời mới mà không cần GPU rời.
Có công cụ nào trong số này dịch được phụ đề đã trích xuất không?
Chỉ GeekLink. Các công cụ khác dừng ở tệp SRT ngôn ngữ gốc (hoặc ảnh). GeekLink dịch ngay trong ứng dụng bằng Claude 3.5 Haiku, GPT-4o, GPT-4o mini hoặc DeepSeek, dùng ngữ cảnh xuyên suốt các dòng, và có thể gắn cứng phụ đề đã dịch trở lại vào video.
Tôi nên dùng VideoSubFinder hay VideOCR?
Cả hai chỉ có cho Windows/Linux. VideOCR phát hiện và OCR trong một lần chạy; VideoSubFinder chỉ tạo ảnh chữ đã làm sạch và thời gian, nên bạn cần thêm một công cụ OCR như RapidVideOCR. Nếu bạn dùng Mac, hoặc muốn rà soát, dịch hay gắn cứng kết quả sau đó, GeekLink bao trọn quy trình trong một ứng dụng.
Sao không dùng thẳng Google Lens hay Tesseract?
Chúng là engine OCR, không phải công cụ video — chúng đọc từng ảnh đơn lẻ. Trích xuất phụ đề từ video còn cần tìm khung hình nào có chữ, loại bỏ dòng trùng lặp qua các khung hình và tạo mốc thời gian. Lớp xử lý video đó chính là thứ VideOCR, VSE, VideoSubFinder và GeekLink bổ sung bên trên một engine.