MediaChef

MediaChef Audio a texto

Transcribir audio a texto — sin conexión, en tu propio ordenador

MediaChef ejecuta Whisper de OpenAI en local a través de whisper.cpp. Descarga un modelo una vez, suelta una grabación o un vídeo en el tablero y elige qué quieres obtener: texto plano, subtítulos SRT o VTT con tiempos, o JSON con el tiempo de cada segmento. El audio no se sube nunca y no hay precio por minuto.

Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión

Lo que obtienes

00:00:04 Hola a todos, empezamos… 00:00:11 Primer punto: los planes del trimestre. 00:00:19 Hay tres escenarios, os enseño la tabla.

TXT sin tiempos, SRT y VTT con ellos, JSON con el inicio y el final de cada segmento.

Cómo transcribir una grabación

  1. Descarga MediaChef

    Un archivo para macOS, Windows o Linux. whisper.cpp v1.7.6 ya viene dentro de la descarga; solo el modelo se baja aparte.

  2. Elige un modelo de Whisper

    Abre Modelos y descarga uno — small (488 MB) es el equilibrio por defecto. Se descarga una vez; después la transcripción funciona con la red apagada.

  3. Suelta la grabación o el vídeo

    Sirven tanto audio como vídeo: MediaChef extrae el sonido del vídeo por su cuenta, así que la grabación de una reunión y un MP4 siguen el mismo camino.

  4. Elige la salida que necesitas

    «Transcribir audio a texto» para TXT, «Transcribir audio a subtítulos SRT» o «Transcribir audio a WebVTT» para subtítulos con tiempos, «Transcribir audio a JSON con tiempos» para herramientas.

  5. Pulsa iniciar y lee el resultado

    El texto aparece junto al archivo como talk.transcript.txt. La cola muestra el progreso; si en el archivo no hay voz, MediaChef lo dice en lugar de escribir uno vacío.

MediaChef antes de transcribir: el tablero para soltar una grabación, con Modelos en el menú lateral, desde donde se descargan los modelos de Whisper.
Los modelos viven en el menú lateral: descarga una vez y transcribe sin conexión a partir de entonces.

Qué modelo de Whisper elegir

El catálogo trae cuatro modelos, que se descargan dentro de la aplicación. Más grande significa mejor texto y más tiempo de cálculo en la misma máquina, así que elige según la tarea y no de una vez para siempre.

ModeloDescargaCuándo elegirlo
tiny 78 MB Una primera pasada sobre voz clara, o cuando solo necesitas localizar dónde empieza un tema.
base 148 MB Notas para ti: texto legible que vas a repasar y editar de todos modos.
small 488 MB El valor por defecto en todas las recetas de transcripción, y el que casi todo el mundo se queda. Entrevistas, reuniones, clases.
large-v3-turbo 1,62 GB Texto que va a leer otra persona: subtítulos que publicas, citas que reproduces. Optimizado para Apple Silicon.

El idioma se detecta automáticamente, y también puedes fijarlo. Dos recetas adicionales traducen cualquier idioma al inglés — como texto o como subtítulos con tiempos — en la misma pasada.

Por qué transcribir en tu ordenador

El audio confidencial sigue siendo confidencial. Entrevistas, notas clínicas, llamadas jurídicas, cualquier cosa bajo acuerdo de confidencialidad: el archivo lo lee un proceso de tu propia máquina y nadie más.

Sin precio por minuto. La transcripción en la nube factura por minuto. En local, la décima hora de audio cuesta lo mismo que la primera: nada.

Sin límite de duración ni de tamaño. Una grabación de cuatro horas es una tarea en la cola, no un plan de pago ni un apaño de partir el archivo.

Funciona sin red alguna. Una vez que el modelo está en disco, la transcripción es sin conexión: en un avión, en un laboratorio, en una máquina aislada.

Subtítulos y texto de la misma pasada. SRT y VTT llevan los tiempos para un reproductor, TXT es prosa limpia y JSON trae los tiempos de cada segmento para tus propios scripts.

Preguntas frecuentes

¿Qué precisión tiene la transcripción de Whisper?

La precisión depende del modelo: tiny es un borrador, small es el equilibrio por defecto y large-v3-turbo roza el nivel humano con voz clara. El audio limpio de un solo hablante es el que mejor sale; los acentos marcados, la gente hablando a la vez y la música bajo la voz restan precisión — como en cualquier reconocedor de voz.

¿Qué idiomas admite?

Whisper cubre alrededor de cien idiomas y detecta el idioma por su cuenta; también puedes fijarlo si acierta mal. Dos recetas traducen la voz en cualquiera de ellos al inglés en una sola pasada, como texto o como subtítulos SRT.

¿En qué formatos sale la transcripción?

TXT para texto plano, SRT y VTT con marcas de tiempo para reproductores y editores de vídeo, y JSON con el inicio y el final de cada segmento para scripts y herramientas.

¿Necesito internet?

Una vez, para descargar un modelo de Whisper en la pantalla Modelos — de 78 MB a 1,62 GB según cuál elijas. Después la transcripción funciona íntegramente sin conexión.

¿Y si la grabación no tiene voz?

MediaChef informa de que «No se ha detectado voz» en lugar de escribir un archivo vacío y marcar la tarea en verde. El silencio, la música sin voces y un archivo elegido por error terminan igual de honestamente.

Convierte esa grabación en texto

MediaChef 0.4.1 — Whisper en local, gratis y de código abierto.

Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión

MediaChef es joven: las compilaciones todavía no están firmadas por Apple ni por Microsoft, así que el primer arranque pide confirmación — dentro de cada descarga hay unas instrucciones en texto plano.