Resumen: cuánto de la extracción de subtítulos puedes automatizar depende de cuál de los tres tipos de subtítulos tengas. Las pistas de subtítulos activables dentro de archivos MKV/MP4 son un comando de ffmpeg, totalmente automatizable. Los videos sin subtítulos en absoluto se manejan con reconocimiento de voz: Whisper se ejecuta localmente desde la línea de comandos, o la carpeta vigilada de GeekLink transcribe y traduce automáticamente cada video que se suelta en una carpeta, sin clics por archivo. Los subtítulos quemados (texto horneado en los píxeles) son el paso que se resiste a los scripts —no existe un pipeline de OCR de código abierto maduro y mantenido para esto en macOS— que es donde el OCR por lotes de GeekLink (más de 50 videos por pasada, totalmente local) llena el hueco. Cada vía produce SRT estándar, la interfaz universal que cualquier script, editor o agente de IA posterior puede consumir.
¿Por qué la gente está automatizando la extracción de subtítulos en 2026?
La extracción de subtítulos solía ser una tarea puntual: abres una app, cargas un video, haces clics. En 2026 es cada vez más un paso dentro de un flujo de trabajo mayor. Los creadores reaprovechan catálogos enteros para nuevos idiomas. Los estudiantes de idiomas alimentan herramientas de sentence-mining como subs2srs. Los equipos conectan agentes de codificación con IA —Claude Code y herramientas similares— para orquestar pipelines de video de principio a fin: descargar, extraer subtítulos, traducir, controlar calidad, publicar.
En el momento en que la extracción de subtítulos se convierte en un paso de un pipeline en lugar de una tarea puntual, las preguntas cambian: ¿puede ejecutarse sin supervisión, puede ejecutarse por lotes, y puede un script o un agente de IA activarla y recoger la salida? Esta guía responde esas tres preguntas con honestidad para cada tipo de subtítulo, incluidas las partes donde la respuesta es "no con un script por sí solo".
Una restricción da forma a todo lo que sigue: el pipeline se mantiene local. Existen APIs de subtítulos en la nube, pero para los creadores que procesan horas de material cobran por minuto, y requieren subir el video original, algo inviable para material sin publicar o de clientes. Todo en esta guía se ejecuta en tu propio Mac, sin subir ningún video.
¿Qué tipos de subtítulos se pueden extraer automáticamente?
Cada video cae en uno de tres casos, y cada caso tiene una historia de automatización completamente distinta:
- Subtítulos activables (pistas incrustadas): una pista de texto separada dentro del contenedor (común en MKV, algunos MP4). El texto ya existe como datos. La extracción es trivial y 100% automatizable.
- Sin subtítulos: el video solo tiene audio. Necesitas reconocimiento de voz. Muy automatizable localmente, con salvedades de calidad.
- Subtítulos quemados (hardcoded): el texto es parte de la imagen, común en rips de anime, programas de variedades chinos y coreanos, reposts de TikTok/Reels y material de emisión antiguo. Los datos de texto originales ya no existen; necesitas OCR sobre los fotogramas del video. Este es el paso que se resiste a los scripts caseros.
Una regla práctica útil: si puedes desactivar los subtítulos en un reproductor, un comando los extrae; si oyes el habla pero no ves subtítulos, el reconocimiento de voz local lo maneja; si los subtítulos son parte de la imagen, necesitas una herramienta de OCR dedicada. Si no estás seguro de qué caso tienes, nuestra guía de incrustados vs. quemados muestra cómo distinguirlos en diez segundos.
¿Cómo se extraen automáticamente las pistas de subtítulos activables?
Este es el caso fácil, y no necesitas ninguna herramienta especial para él. ffmpeg (gratuito, instalable con Homebrew) extrae una pista de subtítulos con un solo comando:
ffmpeg -i input.mkv -map 0:s:0 output.srt
Eso toma el primer flujo de subtítulos (0:s:0) y lo escribe como SRT. Envuélvelo en un bucle de shell y tienes extracción por lotes de una carpeta entera. Cualquier agente de codificación con IA puede escribirlo y ejecutarlo por ti: extraer pistas de subtítulos activables es un problema resuelto, totalmente automatizable y no necesita software de pago.
Dos salvedades que conviene saber. Primero, las pistas de subtítulos de DVD y Blu-ray (VobSub/PGS) se almacenan como imágenes, no como texto: -map por sí solo no puede convertirlas a SRT; también necesitan OCR. Segundo, muchos archivos tienen varias pistas en distintos idiomas, así que lístalas primero con ffprobe antes de elegir un índice. Nuestras guías de MKV y MP4 cubren los detalles.
¿Cómo se automatiza la transcripción de voz a subtítulos en Mac?
Cuando no hay datos de subtítulos en absoluto, el reconocimiento de voz los genera. En un Mac hay dos vías de automatización local.
Vía 1: automatizar Whisper directamente
Whisper de OpenAI es de código abierto y se ejecuta desde la línea de comandos: whisper video.mp4 --model small --output_format srt. Es genuinamente automatizable, y si ya estás manejando tu Mac con un agente de IA, hacer que orqueste Whisper sobre una carpeta de videos funciona. Las carencias aparecen después de la transcripción: la salida en bruto de Whisper no te da un paso de traducción, ni una verificación visual de los resultados contra el video, ni forma de saber qué líneas salieron mal sin mirarlo todo.
Vía 2: automatización con carpeta vigilada (sin scripts)
La función de carpeta vigilada de GeekLink es la versión sin código de la misma automatización. Apuntas GeekLink a una carpeta una vez, eliges tus ajustes de reconocimiento y traducción, y cada video que se suelta después en esa carpeta se importa, transcribe y traduce automáticamente, sin clics por archivo, sin scripts que mantener. Un descargador, un agente de IA o una persona pueden alimentar la carpeta; la app hace el resto.
Esto importa para la automatización porque una carpeta vigilada es en sí misma un punto de integración. Cualquier cosa que pueda mover un archivo —un script de yt-dlp, una regla de Hazel, un agente, un recurso compartido de red— puede activar el procesamiento sin que GeekLink exponga una API. El reconocimiento cubre 49 idiomas mediante Whisper, y la traducción cubre más de 40 idiomas usando modelos que tú eliges (Claude 3.5 Haiku, GPT-4o, GPT-4o mini, DeepSeek), así que la carpeta puede producir subtítulos bilingües, no solo transcripciones.
¿Por qué la extracción de subtítulos quemados es el paso más difícil de automatizar?
Aquí viene la parte honesta de esta guía. Si tus videos tienen los subtítulos horneados en los píxeles, el enfoque de "solo automatízalo con un script" que funciona en todo lo demás se desmorona. A fecha de 2026 no existe un pipeline de código abierto maduro y mantenido que convierta de forma fiable los subtítulos quemados en SRT sincronizado en macOS: los proyectos de OCR de código abierto en este ámbito están orientados a Windows, dependen de GPU o no tienen mantenimiento. (Comparamos todo el panorama en nuestro resumen de extractores de subtítulos incrustados.)
La razón por la que un script de fin de semana no puede hacerlo: el OCR de video no es "captura de pantalla más reconocimiento de texto". Un script ingenuo que muestrea un fotograma por segundo y le aplica OCR choca con cuatro muros a la vez:
- Precisión de sincronización. Muestrear cada segundo significa que los tiempos de inicio y fin del subtítulo pueden desviarse hasta un segundo por línea, algo que se nota al instante contra el habla.
- Deduplicación. Un subtítulo que permanece en pantalla tres segundos aparece en decenas de fotogramas muestreados, cada uno con un OCR ligeramente distinto. Fusionarlos en una línea limpia con la duración correcta es el verdadero problema difícil.
- Subtítulos vs. todo lo demás. Las marcas de agua, los logos de canal, los gráficos en pantalla y las letras de canciones parecen texto para un motor de OCR. Sin saber dónde viven los subtítulos reales, la salida se llena de líneas basura.
- Precisión en CJK. Los subtítulos en chino, japonés y coreano —los idiomas con más probabilidad de estar quemados— son justamente donde la precisión del OCR genérico cae más fuerte.
El OCR por lotes de GeekLink está construido en torno a esos cuatro muros. Dibujas un recuadro alrededor del área de subtítulos en el primer video —un paso único de diez segundos que le dice al motor dónde viven los subtítulos y qué ignorar— y el resto se ejecuta sin supervisión. Una pasada procesa más de 50 videos seguidos en tu Mac, y cada video sale como un SRT sincronizado, con confianza por línea para que veas qué revisar. El flujo de trabajo completo está en nuestra guía de OCR de subtítulos quemados.
¿Cómo encaja una app de Mac en un flujo de trabajo automatizado sin una API?
Una pregunta justa de cualquiera que esté montando un pipeline dirigido por agentes: GeekLink es una app de Mac, no una herramienta de línea de comandos, entonces ¿cómo se combina con scripts?
El contrato de integración es el sistema de archivos: los archivos entran en una carpeta, salen archivos SRT estándar, y todo lo intermedio se ejecuta sin supervisión. En concreto:
- Lado de entrada: la carpeta vigilada acepta cualquier cosa que aterrice en ella (para reconocimiento de voz y traducción), y la importación por lotes acepta una carpeta entera de una vez (para OCR y todo lo demás).
- Lado de salida: las exportaciones son SRT estándar (también transcripciones TXT y video con subtítulos quemados). SRT es texto plano con un formato estable y de décadas de antigüedad: cualquier script, editor, paso de traducción o agente de IA posterior puede analizarlo. No hay archivos de proyecto propietarios que desbloquear.
Para ser transparentes sobre los límites: GeekLink no tiene hoy una CLI ni una API pública. La automatización basada en carpetas cubre el caso de uso de lotes sin supervisión que realmente ejecutan los creadores en solitario y los equipos pequeños; si el control programático importa para tu flujo de trabajo, cuéntanoslo en el Discord de GeekLink: escuchar flujos de trabajo reales es como priorizamos.
¿Cómo se ve un pipeline local completo de subtítulos?
Uniendo las piezas, aquí hay un pipeline que maneja cualquier mezcla de videos, enteramente en el dispositivo:
- Clasifica por tipo de subtítulo. Comprueba cada archivo: ¿el reproductor muestra una pista de subtítulos (activable), texto horneado visible (quemado), o ninguno (voz)? Un agente puede hacer la primera comprobación automáticamente con
ffprobe; las otras dos requieren un vistazo de dos segundos. - Pistas activables → ffmpeg. Un comando automatizado por archivo, listo.
- Sin subtítulos → carpeta vigilada. Suelta los archivos; el reconocimiento y la traducción se ejecutan sin supervisión, con tus idiomas de origen y destino elegidos.
- Quemados → OCR por lotes de GeekLink. Importa el lote, dibuja el recuadro de subtítulos una vez, ejecuta. Más de 50 videos por pasada.
- Recoge la salida SRT. Las tres vías convergen en archivos SRT sincronizados, listos para lo que venga después: traducción, edición, sentence-mining, reincrustación o publicación.
El principio de diseño: automatiza enrutando cada video al extractor adecuado, no forzando a una sola herramienta a hacerlo todo. ffmpeg es imbatible para la extracción de pistas; el reconocimiento basado en Whisper maneja la voz; el OCR dedicado maneja el texto quemado. El formato SRT es lo que les permite combinarse.
¿Dónde sigue necesitando la automatización a un humano?
Un pipeline sin supervisión produce subtítulos; no garantiza que sean correctos. Los nombres, la jerga, el habla superpuesta y todo lo que hay bajo música fuerte son donde se concentran los errores de reconocimiento, y un pipeline totalmente automatizado propagará alegremente esos errores a tus traducciones y videos publicados.
La solución escalable no es leer cada línea: es hacer que el pipeline marque qué líneas es probable que estén mal, de modo que el paso de revisión humana se reduzca del transcript completo a una lista corta. GeekLink lee la confianza por palabra del reconocedor y marca la palabra de menor confianza de cada línea, además de los segmentos cubiertos por música, y luego exporta un paquete de revisión para el gratuito Subtitle Edit. El flujo de revisión de principio a fin se cubre en encontrar las líneas que la IA equivocó.
En cuanto al presupuesto, el pipeline automatizado de arriba se ejecuta en el plan gratuito de GeekLink para probarlo; el uso completo por lotes cuesta $99/año (~$8.25/mes) o $169 de por vida, ambos con 1M de créditos de traducción con IA. Requisitos: macOS 13.0+ en Apple Silicon (M1–M4).
Preguntas frecuentes
¿Puedo extraer subtítulos automáticamente de videos en Mac?
Sí, pero el método depende del tipo de subtítulo. Las pistas de subtítulos activables se extraen con un comando gratuito de ffmpeg. Los videos sin subtítulos necesitan reconocimiento de voz local (Whisper automatizable, o la carpeta vigilada de GeekLink para una versión sin código con traducción). Los subtítulos quemados necesitan OCR dedicado: GeekLink procesa por lotes más de 50 videos por pasada de forma local.
¿Pueden agentes de IA como Claude Code extraer subtítulos de videos?
Parcialmente. Un agente de codificación con IA puede automatizar ffmpeg para sacar pistas de subtítulos activables y ejecutar Whisper para voz a texto: ambas son herramientas de línea de comandos que maneja bien. Lo que un agente no puede automatizar de forma fiable en un Mac es el OCR de subtítulos quemados, porque no existe un pipeline de código abierto mantenido para ello. La división práctica: deja que el agente maneje pistas y voz, y enruta los videos quemados a través de una herramienta de OCR por lotes mediante una carpeta compartida.
¿Tiene GeekLink una CLI o API para automatización?
No: GeekLink no tiene hoy una interfaz de línea de comandos ni una API pública. Su modelo de automatización es basado en carpetas: la carpeta vigilada transcribe y traduce automáticamente cualquier video que se suelte en ella, la importación por lotes maneja más de 50 videos por pasada de OCR, y toda la salida es SRT estándar que los scripts pueden recoger. Si tu flujo de trabajo necesita control programático, cuéntanoslo en Discord: los casos de uso reales guían la hoja de ruta.
¿Cómo extraigo por lotes subtítulos quemados de muchos videos?
Usa una herramienta de OCR por lotes en lugar de automatizar por archivo. En GeekLink importas la carpeta entera, dibujas un recuadro alrededor del área de subtítulos una vez, y el lote se ejecuta sin supervisión en tu Mac: más de 50 videos por pasada, cada uno exportado como un SRT sincronizado con confianza por línea para revisión.
¿La extracción automatizada de subtítulos es privada? ¿Se sube mi video?
El pipeline de esta guía es local: ffmpeg, el reconocimiento con Whisper y el OCR de GeekLink se ejecutan todos en tu propio Mac, y no se sube ningún video a ningún sitio. El único paso opcional en la nube es la traducción con IA: si la activas, el texto de los subtítulos (no el video) se envía al modelo de traducción que elijas (Claude 3.5 Haiku, GPT-4o, GPT-4o mini o DeepSeek).
¿Qué formato de salida debería usar un pipeline de subtítulos automatizado?
SRT. Es texto plano, compatible con prácticamente todos los editores, reproductores, plataformas y herramientas de traducción, y trivial de analizar para scripts y agentes de IA. Sea cual sea el extractor que uses, converge en SRT sincronizado como formato de intercambio; convierte a formatos específicos de plataforma (VTT, ASS) solo en el paso final si es necesario.
Divulgación: GeekLink es nuestra propia app de Mac; la carpeta vigilada, el OCR por lotes, el marcado de confianza y las funciones de traducción descritas aquí son funciones de GeekLink. ffmpeg y Whisper son proyectos independientes de código abierto, no afiliados a nosotros, recomendados por sus propios méritos.