MediaChef

MediaChef Vídeo a SRT

Generar subtítulos SRT desde un vídeo

Arrastra el vídeo a MediaChef, elige «Crear subtítulos SRT para un vídeo», deja el modelo en small y el idioma en automático, y ejecútalo. Junto al vídeo aparecerá un archivo .srt ya con sus tiempos. Todo se calcula en tu máquina: la voz no sale del disco y, una vez descargado el modelo, la receta funciona con la red apagada. En un portátil con M5, 2 minutos y 43 segundos de habla tardaron 6,2 segundos con el modelo por defecto —unas 26 veces más rápido que el tiempo real— y dieron 73 líneas de 39 caracteres de media, lo bastante cortas para leerlas con calma.

Qué necesitas
MediaChef 0.8.5 más una descarga única del modelo
Modelo por defecto
small — 488 MB, se descarga una vez y se queda
Velocidad
≈26× el tiempo real con el modelo por defecto (medido, M5)
Funciona sin conexión
Sí, en cuanto el modelo está en el disco
Formatos
SRT, VTT, TXT normal y JSON — una receta para cada uno
Qué obtienes
clip.subs.srt junto al vídeo, y el vídeo intacto

Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión

Cómo hacer subtítulos para un vídeo

  1. Descarga MediaChef

    Un archivo para macOS, Windows o Linux. Tanto FFmpeg como el motor de Whisper viajan dentro de la descarga: no hay nada que instalar aparte ni nada que añadir al PATH.

  2. Descarga un modelo, una sola vez

    La primera transcripción te pedirá un modelo de voz. Por defecto es small, de 488 MB, y es con el que están hechas estas mediciones; tiny ocupa 78 MB, base 148 MB y large-v3-turbo 1,62 GB. Se descarga una vez, se queda en el disco y a partir de ahí la receta ya no toca la red.

  3. Suelta el vídeo y elige la receta

    «Crear subtítulos SRT para un vídeo» acepta el vídeo directamente: no hace falta extraer el audio antes. MediaChef decodifica la pista al mono de 16 kHz que Whisper exige, en una carpeta temporal que nunca llegas a ver.

  4. Ejecútalo y abre el .srt

    El archivo aparece junto al vídeo con el nombre clip.subs.srt, con las líneas numeradas y sus tiempos. Reproductores, editores y plataformas lo leen tal cual y, como es texto plano, puedes corregir un nombre o un término en cualquier editor.

MediaChef listo para convertir: la mesa de trabajo espera un archivo de vídeo, la cola de tareas está a la derecha.
La mesa donde cae el vídeo. Las recetas aparecen cuando MediaChef ha leído el archivo.

Qué modelo elegir

Cuatro modelos, los mismos 2 minutos y 43 segundos de habla, la misma máquina: un portátil con M5 y 16 GB, cada modelo calentado antes y quedándonos con la mejor de dos pasadas.

ModeloDescargaTiempoFrente al tiempo realPalabras falladas
tiny78 MB2,1 s×785 de 540
base148 MB2,6 s×633 de 540
small — el de por defecto488 MB6,2 s×260 de 540
large-v3-turbo1,62 GB11,5 s×141 de 540

Lee la última columna con cuidado, porque el audio de prueba es una voz sintetizada leyendo un texto preparado: sin acento, sin ruido de fondo y sin nadie hablando encima. Por eso aquí hasta el modelo más pequeño acierta casi todo, y eso no se parece a la grabación de una reunión real: con audio difícil la distancia entre estos modelos se abre mucho. La columna del tiempo, en cambio, se traslada tal cual a tu caso. Y algo que la comparación en bruto esconde: casi todas las discrepancias eran números escritos en cifras en vez de en letras —large-v3-turbo escribió «70», «10», «50», «30» donde el texto los decía completos—, y eso es formato, no un error de oído.

Cómo salen de largas las líneas

Un subtítulo técnicamente correcto puede ser igualmente inservible si echa veinte palabras a la pantalla de golpe. Los modelos trocean el mismo discurso de maneras muy distintas, y esto está medido en la misma pasada de arriba.

ModeloLíneasDuración mediaCaracteres de mediaLa más larga
tiny354,7 s8397 caracteres
base354,7 s83100 caracteres
small — el de por defecto732,2 s3958 caracteres
large-v3-turbo305,4 s97112 caracteres

La norma habitual en televisión ronda los 42 caracteres por línea en dos líneas, es decir, unos 84 caracteres en pantalla a la vez. Con esa medida, de los cuatro solo small entra con holgura: 39 caracteres de media y 58 en la línea más larga, mientras que large-v3-turbo se pasa del límite ya en una línea corriente. Así que el modelo por defecto no es solo el equilibrado en acierto: también trocea el habla en los pedazos más legibles.

SRT, VTT, texto plano o JSON

La misma transcripción escrita de cuatro maneras. Los tamaños salen de los mismos 2 minutos y 43 segundos de habla, así que se comparan directamente.

FormatoTamañoQué lleva dentroCuándo usarlo
SRT5,5 KBLíneas numeradas, tiempos con coma: 00:00:00,000Casi siempre. Lo aceptan reproductores, editores y plataformas
VTT5,3 KBCabecera WEBVTT, tiempos con punto: 00:00:00.000Subtítulos para un reproductor web, la pista del navegador
TXT3,0 KBTexto corrido, sin tiempos de ningún tipoQuieres las palabras, no los subtítulos
JSON15,2 KBCada línea más el modelo y los parámetros usadosEsto lo va a leer un programa, no una persona

SRT y VTT se diferencian sobre todo en el carácter que separa segundos y milisegundos, así que si un reproductor rechaza uno, el otro es cambiar de receta y no volver a transcribir. El JSON pesa unas tres veces más que el SRT porque lleva los datos de la pasada junto al texto.

Qué receta para cada caso

Los subtítulos no son una receta sino varias, y elegir la correcta te ahorra un paso. Todas están en el catálogo de 17 recetas.

Qué tienesQué quieresReceta
Un vídeoSubtítulos a su ladoCrear subtítulos SRT para un vídeo
Un archivo de audioSubtítulosTranscribir audio a subtítulos SRT
Voz en otro idiomaSubtítulos en inglés de una pasadaTraducir la voz a subtítulos en inglés
Cualquier cosa con vozSolo el textoTranscribir audio a texto
Cualquier cosa con vozUna pista para reproductor webTranscribir audio a WebVTT

La receta de traducción va de la voz extranjera directamente a subtítulos en inglés con tiempos, en una sola pasada: no hay que transcribir primero y traducir después. Eso sí, solo va al inglés; es un límite del modelo, no de la aplicación.

Por qué hacer los subtítulos en tu propio ordenador

La voz no sale de tu disco. Las grabaciones de reuniones, entrevistas y llamadas son el tipo de archivo más delicado que maneja la mayoría, y una transcripción en línea es por definición una copia de esa conversación en el servidor de otro. Aquí no hay subida sobre la que pensar.

Nada de pagar por minuto. Los servicios de transcripción cobran por minuto de audio, y eso convierte un archivo largo en una factura de verdad. La descarga del modelo es única y, después, una grabación de dos horas cuesta lo mismo que una de dos minutos: nada.

Funciona con la red apagada. En cuanto el archivo del modelo está en el disco, esta receta no toca internet para nada. Funciona en un avión, en un equipo cerrado y en una sala donde el wifi es lo menos fiable que hay.

Sin límite de duración. Los transcriptores web gratuitos suelen cortarte a unos pocos minutos por archivo, justo cuando una grabación merece transcribirse precisamente por ser larga. Aquí no hay tope.

Una carpeta entera de golpe. Suelta un directorio de grabaciones y la cola las irá procesando una a una, diciéndote dónde ha quedado cada archivo de subtítulos.

Cuándo no es la herramienta adecuada

La receta escribe un archivo de subtítulos. Eso es más estrecho que «poner subtítulos a un vídeo», y la diferencia importa en estos casos.

  1. Quieres los subtítulos incrustados en la imagen.

    Aquí sale un .srt aparte que el reproductor carga junto al vídeo. Grabar el texto dentro de los fotogramas es otra operación: recodifica el vídeo, y luego esas palabras ya no se pueden apagar ni corregir.

  2. Necesitas precisión de emisión.

    Incluso con el audio limpio de las mediciones de arriba los modelos tropezaron en unas cuantas palabras, y las grabaciones reales son más duras. Todo lo que se publica bajo una exigencia legal de accesibilidad lo repasa una persona antes de salir, sea lo que sea que hiciera el borrador.

  3. El audio es realmente malo.

    Mucha gente hablando encima, la grabación de una sala hecha con el móvil o música más alta que la voz tumbarán a los cuatro modelos. Arreglar antes el audio —aunque solo sea extraer una pista más limpia— hace más por el resultado que subir de tamaño de modelo.

  4. Necesitas traducción a algo que no sea el inglés.

    Whisper traduce al inglés y solo al inglés. Para cualquier otro idioma de destino, transcribe primero en el idioma original y traduce ese texto con una herramienta pensada para eso.

Preguntas

¿Esto es gratis?

Sí, todo. MediaChef es de código abierto bajo GPL-3.0: no hay versión de pago, ni cobro por minuto, ni tope de duración. Los modelos también se descargan gratis. La versión actual es la 0.8.5.

¿Se sube mi vídeo a algún sitio?

No. La voz la procesa un archivo de modelo que está en tu propio disco. Lo único que cruza la red es la descarga única del modelo, y después la receta funciona con internet apagado.

¿Cuánto tarda?

Unas 26 veces más rápido que el tiempo real con el modelo por defecto: medimos 6,2 segundos para 2 minutos y 43 segundos de habla en un portátil con M5. Con esa proporción, una grabación de una hora se despacha en un par de minutos. Con el mismo audio, tiny dio ×78 y large-v3-turbo ×14.

¿Qué modelo debería elegir?

Empieza por small, el que viene por defecto. En nuestras mediciones acertó todas las palabras del audio de prueba y dio las líneas más legibles: 39 caracteres de media frente a 97 de large-v3-turbo. Sube solo si tu audio es difícil; baja a tiny o base si lo que quieres es un borrador en un par de segundos.

¿Cuánto ocupa el modelo?

78 MB tiny, 148 MB base, 488 MB small y 1,62 GB large-v3-turbo. La descarga es única. Después el archivo se queda en el disco y cada pasada posterior lo usa sin preguntar.

¿Tengo que decirle en qué idioma se habla?

No. El idioma viene en automático y el modelo lo deduce del audio. Aun así puedes indicarlo a mano, y merece la pena hacerlo cuando la grabación arranca con unas frases en otro idioma.

¿Puede traducir los subtítulos al inglés?

Sí, con la receta «Traducir la voz a subtítulos en inglés»: entra voz extranjera y sale un SRT en inglés con tiempos, de una sola pasada en lugar de transcribir y luego traducir. El inglés es el único idioma de destino que admite el modelo.

¿En qué se diferencian SRT y VTT?

Sobre todo en la puntuación de los tiempos: SRT escribe 00:00:00,000 con coma y numera las líneas, VTT escribe 00:00:00.000 con punto y empieza con una línea WEBVTT. El SRT es lo que esperan reproductores y editores; el VTT es lo que quiere un reproductor web para su propia pista de subtítulos. Son recetas distintas, así que cambiar de formato es volver a ejecutar, no reescribir el archivo.

¿Puedo editar los subtítulos después?

Sí: un .srt es texto plano. Ábrelo en cualquier editor para corregir un nombre propio, un tecnicismo o un tiempo. Ese es el modo normal de trabajar: el modelo pone el noventa y tantos por ciento y tú corriges el resto a mano.

¿Por qué me salen líneas demasiado largas?

Porque el modelo decide dónde cortar, y los modelos grandes cortan menos. Medimos 39 caracteres por línea con small frente a 97 con large-v3-turbo, sobre el mismo audio. Si tus líneas se alargan, volver a small suele arreglarlo, y con voz limpia no cuesta nada en acierto.

¿Distingue a los hablantes?

No. Whisper escribe lo que se dijo, no quién lo dijo. Si necesitas etiquetas de «Hablante 1 / Hablante 2», tendrás que ponerlas a mano o usar una herramienta hecha justo para eso.

¿Qué pasa si en el archivo no hay voz?

La pasada se detiene y te dice que no ha oído nada reconocible, en lugar de escribir en silencio un archivo vacío. El silencio no produce subtítulos, y es a propósito.

¿Funciona en Windows y Linux?

En las tres plataformas. La voz se procesa en la CPU en todas ellas y además aprovecha la GPU en Apple Silicon, que es de donde salen los números rápidos de arriba. La misma receta en un portátil modesto con Windows irá más lenta, aunque seguirá siendo más rápida que escuchar la grabación entera.

¿Puedo subtitular varios archivos a la vez?

Sí. Suelta una carpeta entera, añade la receta y la cola irá pasando por ellos uno detrás de otro. Cada archivo de subtítulos se escribe junto a su propia fuente.

¿Se modifica el archivo de vídeo?

No. Se escribe un .srt aparte a su lado —clip.subs.srt— y el vídeo no se modifica, ni se renombra, ni se recodifica. Esta receta no toca la imagen para nada.

Saca los subtítulos de ese vídeo

MediaChef 0.8.5 — gratis, código abierto, macOS · Windows · Linux.

Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión

MediaChef es joven: las compilaciones todavía no están firmadas por Apple ni por Microsoft, así que el primer arranque pide confirmación — dentro de cada descarga hay unas instrucciones en texto plano.

¿Algo no funciona o falta algo? Escríbenos: hello@mediachef.app