MediaChef Dictado por voz
Escribir con la voz sin que salga del ordenador
Pulse la tecla ⌥ derecha en cualquier parte del Mac, diga una frase y púlselo otra vez: el texto se escribe directamente en el campo donde está el cursor, sea un terminal, un chat o un formulario del navegador. Reconoce el mismo Whisper que MediaChef ya lleva dentro, así que el audio no sale de su disco y nadie cuenta los minutos. En nuestra medición una frase de cinco segundos volvió en 780 milisegundos.
- Estado
- Publicada desde la versión 0.8.0, por ahora solo macOS
- Dónde se calcula
- Enteramente en su máquina, sin cuenta y sin subidas
- Velocidad
- 780 ms de la tecla al texto en una frase de cinco segundos (medido)
- Cuánto cuesta
- Nada. Ni suscripción ni cobro por minuto
- Plataforma
- macOS primero; Windows y Linux después
- Descarga única
- Un modelo de voz, 488 MB el que viene por defecto
Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión
Cómo funciona el dictado
-
Encenderlo una vez
En la pestaña Dictado hay un interruptor y un disparador a elegir: la ⌥ derecha, la ⌘ derecha o una de dos combinaciones. Hasta que lo encienda, MediaChef no registra ningún atajo global: una aplicación que se queda con una combinación del sistema en silencio es una aplicación que rompe las demás.
-
Pulsar el atajo en cualquier sitio
Funciona con MediaChef en segundo plano o con su ventana cerrada. Dos maneras: mantener la tecla mientras habla, o pulsarla una vez para empezar y otra para parar, según lo largo que sea el pensamiento.
-
Hablar
El micrófono se abre solo mientras dicta, así que el punto naranja de la barra de menús se apaga en cuanto termina. Entre pulsación y pulsación nadie escucha.
-
El texto aparece donde está el cursor
Se escribe directo en el campo con el foco, sin tocar el portapapeles. Si prefiere lo contrario, que vaya al portapapeles, es el ajuste de al lado.
Lo rápido que es de verdad
Medición de extremo a extremo en un portátil con M5: desde que se suelta la tecla hasta que el texto está entregado. La primera fila es un dictado real de la compilación viva; el resto, una frase fija de quince segundos pasada por cada modelo.
| Qué se midió | Modelo | Tiempo |
|---|---|---|
| Frase real de cinco segundos, de la tecla al texto escrito | small | 780 ms |
| Frase de quince segundos | tiny | no medido aparte |
| Frase de quince segundos | small | 0,66–0,75 s |
| Frase de quince segundos | large-v3-turbo | 1,64–1,97 s |
Estos números esconden dos cosas y las dos conviene saberlas. El micrófono tarda 56 milisegundos en entregar su primera muestra, así que una palabra empezada en el mismo instante que la pulsación puede recortarse; en la práctica uno habla después de la tecla y nadie lo nota. Y el primerísimo dictado tras conceder el permiso del micrófono se pierde: el sistema pasa unos 1,8 segundos mostrando su diálogo. Pulse otra vez y funciona.
Qué modelo usar
Los mismos cuatro modelos que usan las recetas de transcripción, así que si ya transcribe archivos con MediaChef el modelo está en su disco y el dictado no le cuesta ninguna descarga.
| Modelo | Descarga | Carácter |
|---|---|---|
| tiny | 78 MB | El más rápido, tosco — vale para una nota para uno mismo |
| base | 148 MB | Rápido, decente |
| small — el de por defecto | 488 MB | El equilibrio, y el que ya usan las recetas |
| large-v3-turbo | 1,62 GB | La mejor calidad, unas dos veces más de espera |
Empiece por small. Está por defecto por una razón práctica más que técnica: es el mismo modelo que usan las recetas, así que a un usuario existente el dictado le funciona sin descargar nada. Suba a large-v3-turbo si su audio es difícil — mucho acento, una sala ruidosa, dos idiomas en una misma frase — y acepte aproximadamente el doble de espera por frase.
Enseñarle sus palabras
Todo oficio tiene palabras que el reconocimiento destroza: nombres de productos, jerga, el apellido de un compañero. Puede darle la lista al modelo y deja de adivinar. Abajo, la misma grabación con y sin un diccionario de cuarenta términos.
| Sin diccionario | Con él |
|---|---|
| «медиашиф» | MediaChef |
| «ходкий» | хоткей |
| «виспер» | whisper |
| «распознаванию» | распознавание |
Costó 0,04 segundos: 0,87 frente a 0,83 en el mismo corte. El techo son unos 224 tokens, es decir alrededor de 400 caracteres en cirílico o el triple en alfabeto latino; MediaChef los cuenta por usted y recorta, porque Whisper trunca una lista demasiado larga en silencio. Esto es justo lo que el dictado integrado de macOS no puede: no se le enseña su vocabulario.
Adónde va el texto
Dos opciones, y la diferencia pesa más de lo que parece cuando se dicta varias veces por hora.
| Ajuste | Qué pasa | Qué necesita |
|---|---|---|
| Escribirlo | Las palabras aparecen en el campo con el foco. El portapapeles queda intacto | El permiso de Accesibilidad, una vez |
| Portapapeles | El texto se copia y usted lo pega con ⌘V | Nada más que el micrófono |
Escribir deja el portapapeles en paz, y por eso conviene preferirlo: si cada dictado lo sobrescribiera, no podría guardar un enlace ahí mientras trabaja. macOS considera escribir en otra aplicación como entrada sintética y pide el permiso de Accesibilidad — el primer intento abre por sí solo el panel correspondiente de Ajustes del Sistema. Cuando el permiso falta, el texto igualmente acaba en el portapapeles: un dictado nunca se pierde.
Por qué hacerlo en local es lo importante
Su voz no se sube. Se dicta precisamente lo que uno no pegaría en un formulario web: ideas a medio hacer, nombres de clientes, la frase que está a punto de enviar. El dictado en la nube es por definición una copia de todo eso en el servidor de otro.
Sin contador por minutos. Los servicios que transcriben cobran por minuto, y eso hace pensar antes de hablar. Aquí la descarga del modelo es única y el centésimo dictado del día cuesta exactamente lo que costó el primero.
Funciona con la red apagada. En un avión, en un equipo cerrado, en una sala donde el wifi es lo menos fiable que hay. Una vez el modelo está en el disco, el dictado no toca internet.
Aprende su vocabulario. El diccionario es una simple lista de sus palabras, y es lo único que el dictado integrado en macOS no sabe hacer.
Código abierto, sin suscripción. GPL-3.0, todo legible en GitHub. Las herramientas de pago de este nicho cobran al mes por lo que por debajo es el mismo modelo abierto.
Cuándo no le servirá
Dicho claramente, porque enterarse después es peor que leerlo ahora.
-
No usa un Mac.
macOS va primero porque ahí se construyó y se probó. Windows y Linux siguen: el motor de reconocimiento ya es multiplataforma, lo que necesita trabajo por plataforma es el atajo y la escritura del texto.
-
Necesita que escriba mientras habla.
El texto llega al campo cuando terminas, no palabra a palabra mientras hablas: así la frase se reconoce entera y con más precisión. Mientras hablas, un borrador del reconocimiento se ve en el panel bajo el notch, pero lo que se escribe es un único resultado limpio, no una cadena de correcciones.
-
Necesita distinguir hablantes.
Escribe lo que se dijo, no quién lo dijo. Para una entrevista a dos voces hace falta una herramienta de transcripción pensada para eso, no un atajo de dictado.
Preguntas
¿Se envía mi voz a algún sitio?
No. El audio lo reconoce un archivo de modelo que está en su propio disco, y se borra junto con la carpeta temporal en la que vivió. Lo único que cruza la red es la descarga única del modelo; después el dictado funciona con la red completamente apagada.
¿Lo rápido que es?
780 milisegundos desde soltar la tecla hasta que aparece el texto, medido sobre una frase real de cinco segundos con el modelo por defecto en un portátil con M5. Una frase de quince segundos tardó 0,66–0,75 segundos. El modelo pesado large-v3-turbo tarda aproximadamente el doble.
¿Funciona en cualquier aplicación?
Sí: el atajo se registra en todo el sistema, así que dispara en un terminal, un navegador, un mensajero o un editor, con MediaChef en segundo plano o incluso con su ventana cerrada.
¿Qué combinación usa?
Por defecto, la tecla ⌥ derecha — un modificador solo: mantenla y habla, o púlsala una vez para empezar y otra para terminar; con Shift el texto se envía con Enter. Un modificador solo no escribe nada ni choca con nada. Combinaciones como ⌥ Space escribían un espacio en modo mantenido si soltabas antes ⌥, así que se retiraron; ⌃⌥ Space y ⌃⌥ D quedan como alternativas.
¿Por qué necesita el permiso de Accesibilidad?
Para dos cosas. Oír la tecla de activación: un modificador solo no puede registrarse como atajo normal, así que MediaChef escucha el teclado por su cuenta, y macOS solo lo permite con Accesibilidad. Y escribir texto en la ventana de otra aplicación, que el sistema considera entrada sintética. Un solo permiso cubre ambas y se concede una vez; después reinicia la aplicación.
¿Y si no lo concedo?
El texto va al portapapeles y una notificación explica por qué, con el panel correspondiente de Ajustes del Sistema ya abierto. Nada dictado se pierde nunca por un permiso que falta.
¿Cuánto disco necesita?
La aplicación más un modelo de voz: 488 MB el de por defecto, 78 MB si elige el más pequeño, 1,62 GB el mayor. Si ya usa MediaChef para transcribir archivos, el modelo ya está en su disco y el dictado no añade nada.
¿Entiende español, o dos idiomas a la vez?
Whisper admite 99 idiomas y usted puede nombrar el suyo o dejar que lo detecte. Mezclar idiomas en una misma frase es justo el caso donde el modelo pesado se gana su tamaño y donde el diccionario ayuda más.
¿Cuánto puede durar un dictado?
Cinco minutos, tras los cuales se detiene solo y transcribe lo que oyó en lugar de descartarlo. En la práctica se dicta por frases, no por monólogos.
¿Puedo cancelar a mitad de frase?
Escape mientras graba descarta la toma y no entrega nada. Se registra solo mientras usted dicta, así que no interfiere con Escape en ningún otro sitio.
¿Sustituye al dictado integrado de macOS?
Hace el mismo trabajo con dos diferencias que importan: a este se le puede enseñar su vocabulario, y el audio se queda en su máquina. Si ninguna de las dos le importa, el integrado ya está ahí y también es gratis.
¿De verdad es gratis?
Sí. MediaChef es de código abierto bajo GPL-3.0, sin versión de pago ni suscripción — el dictado incluido. La versión publicada es la 0.8.5, con el dictado incluido.
¿Por qué el panel muestra un texto distinto del que se escribe?
Son dos pasadas distintas. Mientras hablas, el panel muestra un borrador que produce un modelo ligero cada segundo y medio para poder seguir el habla. Lo que se escribe es el resultado final del modelo principal sobre la grabación completa, con tu diccionario de términos. Ambos modelos se eligen en la pestaña Dictado: pon en la vista previa el mismo modelo que el principal y la diferencia desaparece, a cambio de que el panel se retrase.
¿Por qué vuelve a pedir permisos después de una actualización?
macOS vincula el permiso a la firma de la aplicación, no a su nombre. MediaChef no tiene certificado de Apple —no vamos a pagarlo—, así que cada versión va firmada distinto y el sistema trata la aplicación actualizada como nueva. La propia aplicación borra la entrada caducada y vuelve a pedir el permiso: un interruptor y un «Permitir» por actualización.
El interruptor en Ajustes del Sistema está activado, pero el dictado no funciona.
Entonces esa entrada pertenece a la copia anterior de la aplicación, que es lo que pasa tras una actualización. Desactivarlo y volver a activarlo no lo reasocia: lo comprobamos. MediaChef borra esa entrada por su cuenta y provoca el aviso del sistema: actívalo en la lista y reinicia la aplicación.
La grabación salió vacía aunque el micrófono funciona.
Casi siempre es el auricular: unos AirPods en su estuche siguen conectados y siguen siendo la entrada por defecto, y macOS entrega ceros planos desde ellos, a cualquier aplicación y no solo a la nuestra. La notificación nombra el dispositivo del que vino el silencio. Ponte el auricular o elige el micrófono explícitamente en la pestaña Dictado.
¿Puedo elegir un micrófono concreto?
Sí: la pestaña Dictado lista los dispositivos de entrada. «Como el sistema» significa el último auricular conectado, no el micrófono del portátil, y por eso una elección explícita es más fiable.
¿Qué pasa si pulso el disparador y no digo nada?
No se escribe nada. Una grabación vacía ni llega al reconocimiento: Whisper no se calla ante el silencio, se lo inventa — el modelo ruso escribía créditos de subtítulos. Esas firmas de subtituladores se reconocen y se tratan como silencio, y en su lugar recibes «no se oye habla».
¿Por qué la primera pulsación tras abrir la aplicación es más lenta?
El subsistema de audio de macOS está despertando: hasta dos segundos la primera vez que se abre el micrófono en cada arranque. El panel aparece de inmediato, antes de que empiece la grabación, así que mantén la tecla hasta que diga que está escuchando. Después, abrirlo cuesta decenas de milisegundos.
¿Cómo envío un mensaje con la voz sin pulsar Enter?
Pulsa el disparador junto con Shift: el texto se escribe y Enter se pulsa solo. Un dictado vacío nunca pulsa Enter; de lo contrario, callarse enviaría un mensaje vacío o ejecutaría el comando anterior en un terminal.
¿Qué ocurre si pulso otra tecla mientras mantengo el disparador?
La grabación se cancela y no se escribe nada. La ⌥ derecha más una letra es el atajo de otra aplicación, no un dictado, y así lo interpreta el programa.
¿Lo que dicto se guarda en el disco?
No. La grabación vive en una carpeta temporal y se borra con ella, y guardar un historial de transcripciones está desactivado por defecto. La aplicación promete que tu contenido no sale del ordenador; escribir en él todo lo que dictas en texto plano encajaría mal con eso: la gente dicta contraseñas y trozos de conversaciones privadas.
¿Funciona sobre aplicaciones a pantalla completa?
Sí. El panel se dibuja por encima de las ventanas a pantalla completa y en todos los escritorios: los editores y terminales a pantalla completa son justo donde se dicta.
Otra aplicación ya usa el disparador. ¿Qué hago?
La pestaña Dictado ofrece también la ⌘ derecha —el otro modificador solo al que macOS no asigna ninguna acción propia— y dos combinaciones normales, ⌃⌥ Espacio y ⌃⌥ D, por si ambos modificadores ya están ocupados.
MediaChef hoy
Versión 0.8.5 — gratis, código abierto, macOS · Windows · Linux. El dictado ya está dentro.
Gratis y de código abierto — mira el código en GitHub Todos los archivos y notas de la versión
MediaChef es joven: las compilaciones todavía no están firmadas por Apple ni por Microsoft, así que el primer arranque pide confirmación — dentro de cada descarga hay unas instrucciones en texto plano.
¿Algo no funciona o falta algo? Escríbenos: hello@mediachef.app