MediaChef Audio a texto
Transcribir audio a texto — sin conexión, en tu propio ordenador
MediaChef ejecuta Whisper de OpenAI en local a través de whisper.cpp. Descarga un modelo una vez, suelta una grabación o un vídeo en el tablero y elige qué quieres obtener: texto plano, subtítulos SRT o VTT con tiempos, o JSON con el tiempo de cada segmento. El audio no se sube nunca y no hay precio por minuto.
Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión
Lo que obtienes
TXT sin tiempos, SRT y VTT con ellos, JSON con el inicio y el final de cada segmento.
Cómo transcribir una grabación
-
Descarga MediaChef
Un archivo para macOS, Windows o Linux. whisper.cpp v1.7.6 ya viene dentro de la descarga; solo el modelo se baja aparte.
-
Elige un modelo de Whisper
Abre Modelos y descarga uno — small (488 MB) es el equilibrio por defecto. Se descarga una vez; después la transcripción funciona con la red apagada.
-
Suelta la grabación o el vídeo
Sirven tanto audio como vídeo: MediaChef extrae el sonido del vídeo por su cuenta, así que la grabación de una reunión y un MP4 siguen el mismo camino.
-
Elige la salida que necesitas
«Transcribir audio a texto» para TXT, «Transcribir audio a subtítulos SRT» o «Transcribir audio a WebVTT» para subtítulos con tiempos, «Transcribir audio a JSON con tiempos» para herramientas.
-
Pulsa iniciar y lee el resultado
El texto aparece junto al archivo como talk.transcript.txt. La cola muestra el progreso; si en el archivo no hay voz, MediaChef lo dice en lugar de escribir uno vacío.
Qué modelo de Whisper elegir
El catálogo trae cuatro modelos, que se descargan dentro de la aplicación. Más grande significa mejor texto y más tiempo de cálculo en la misma máquina, así que elige según la tarea y no de una vez para siempre.
| Modelo | Descarga | Cuándo elegirlo |
|---|---|---|
tiny | 78 MB | Una primera pasada sobre voz clara, o cuando solo necesitas localizar dónde empieza un tema. |
base | 148 MB | Notas para ti: texto legible que vas a repasar y editar de todos modos. |
small | 488 MB | El valor por defecto en todas las recetas de transcripción, y el que casi todo el mundo se queda. Entrevistas, reuniones, clases. |
large-v3-turbo | 1,62 GB | Texto que va a leer otra persona: subtítulos que publicas, citas que reproduces. Optimizado para Apple Silicon. |
El idioma se detecta automáticamente, y también puedes fijarlo. Dos recetas adicionales traducen cualquier idioma al inglés — como texto o como subtítulos con tiempos — en la misma pasada.
Por qué transcribir en tu ordenador
El audio confidencial sigue siendo confidencial. Entrevistas, notas clínicas, llamadas jurídicas, cualquier cosa bajo acuerdo de confidencialidad: el archivo lo lee un proceso de tu propia máquina y nadie más.
Sin precio por minuto. La transcripción en la nube factura por minuto. En local, la décima hora de audio cuesta lo mismo que la primera: nada.
Sin límite de duración ni de tamaño. Una grabación de cuatro horas es una tarea en la cola, no un plan de pago ni un apaño de partir el archivo.
Funciona sin red alguna. Una vez que el modelo está en disco, la transcripción es sin conexión: en un avión, en un laboratorio, en una máquina aislada.
Subtítulos y texto de la misma pasada. SRT y VTT llevan los tiempos para un reproductor, TXT es prosa limpia y JSON trae los tiempos de cada segmento para tus propios scripts.
Preguntas frecuentes
¿Qué precisión tiene la transcripción de Whisper?
La precisión depende del modelo: tiny es un borrador, small es el equilibrio por defecto y large-v3-turbo roza el nivel humano con voz clara. El audio limpio de un solo hablante es el que mejor sale; los acentos marcados, la gente hablando a la vez y la música bajo la voz restan precisión — como en cualquier reconocedor de voz.
¿Qué idiomas admite?
Whisper cubre alrededor de cien idiomas y detecta el idioma por su cuenta; también puedes fijarlo si acierta mal. Dos recetas traducen la voz en cualquiera de ellos al inglés en una sola pasada, como texto o como subtítulos SRT.
¿En qué formatos sale la transcripción?
TXT para texto plano, SRT y VTT con marcas de tiempo para reproductores y editores de vídeo, y JSON con el inicio y el final de cada segmento para scripts y herramientas.
¿Necesito internet?
Una vez, para descargar un modelo de Whisper en la pantalla Modelos — de 78 MB a 1,62 GB según cuál elijas. Después la transcripción funciona íntegramente sin conexión.
¿Y si la grabación no tiene voz?
MediaChef informa de que «No se ha detectado voz» en lugar de escribir un archivo vacío y marcar la tarea en verde. El silencio, la música sin voces y un archivo elegido por error terminan igual de honestamente.
Convierte esa grabación en texto
MediaChef 0.4.1 — Whisper en local, gratis y de código abierto.
Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión
MediaChef es joven: las compilaciones todavía no están firmadas por Apple ni por Microsoft, así que el primer arranque pide confirmación — dentro de cada descarga hay unas instrucciones en texto plano.