MediaChef Áudio em texto
Transcrever áudio para texto — offline, no seu próprio computador
O MediaChef roda o Whisper da OpenAI localmente através do whisper.cpp. Baixe um modelo uma vez, solte uma gravação ou um vídeo na área de arquivos e escolha o que quer de saída: texto simples, legendas SRT ou VTT com tempos, ou JSON com o tempo de cada segmento. O áudio nunca é enviado e não há preço por minuto.
Gratuito e de código aberto — veja o código no GitHub Todos os arquivos e notas da versão
O que você recebe
TXT sem tempos, SRT e VTT com eles, JSON com o início e o fim de cada segmento.
Como transcrever uma gravação
-
Baixe o MediaChef
Um arquivo para macOS, Windows ou Linux. O whisper.cpp v1.7.6 já vem dentro do download; só o modelo é baixado à parte.
-
Escolha um modelo do Whisper
Abra Modelos e baixe um — small (488 MB) é o equilíbrio padrão. Baixa uma vez; depois a transcrição funciona com a rede desligada.
-
Solte a gravação ou o vídeo
Áudio e vídeo funcionam igual: o MediaChef extrai o som do vídeo sozinho, então a gravação de uma reunião e um MP4 seguem o mesmo caminho.
-
Escolha a saída que precisa
«Transcrever áudio para texto» para TXT, «Transcrever áudio para legendas SRT» ou «Transcrever áudio para WebVTT» para legendas com tempos, «Transcrever áudio para JSON com tempos» para ferramentas.
-
Clique em iniciar e leia o resultado
O texto aparece ao lado do arquivo como talk.transcript.txt. A fila mostra o progresso; se não houver fala no arquivo, o MediaChef avisa em vez de gravar um vazio.
Qual modelo do Whisper escolher
O catálogo traz quatro modelos, baixados dentro do aplicativo. Maior significa texto melhor e execução mais longa na mesma máquina, então escolha por tarefa, e não de uma vez para sempre.
| Modelo | Download | Quando escolher |
|---|---|---|
tiny | 78 MB | Uma primeira passada em fala clara, ou quando você só precisa achar onde um assunto começa. |
base | 148 MB | Anotações para você mesmo: texto legível que vai reler e editar de qualquer forma. |
small | 488 MB | O padrão em todas as receitas de transcrição, e o que a maioria mantém. Entrevistas, reuniões, aulas. |
large-v3-turbo | 1,62 GB | Texto que vai para outra pessoa: legendas que você publica, citações que reproduz. Otimizado para Apple Silicon. |
O idioma é detectado automaticamente, e você também pode fixá-lo. Duas receitas extras traduzem qualquer idioma para o inglês — como texto ou como legendas com tempos — na mesma passagem.
Por que transcrever no seu computador
Áudio confidencial continua confidencial. Entrevistas, anotações clínicas, ligações jurídicas, qualquer coisa sob acordo de confidencialidade: o arquivo é lido por um processo da sua própria máquina e por mais nada.
Sem cobrança por minuto. A transcrição na nuvem cobra por minuto. No computador, a décima hora de áudio custa o mesmo que a primeira: nada.
Sem limite de duração ou tamanho. Uma gravação de quatro horas é uma tarefa na fila, não um plano pago nem uma gambiarra de dividir o arquivo.
Funciona sem rede nenhuma. Com o modelo em disco, a transcrição é offline: num avião, num laboratório, numa máquina isolada.
Legendas e texto da mesma passagem. SRT e VTT carregam os tempos para um player, TXT é prosa limpa, JSON traz os tempos dos segmentos para os seus próprios scripts.
Perguntas frequentes
Qual a precisão da transcrição do Whisper?
A precisão acompanha o modelo: tiny é um rascunho, small é o equilíbrio padrão, large-v3-turbo chega perto do nível humano com fala clara. Áudio limpo de um único falante sai melhor; sotaques fortes, pessoas falando por cima e música sob a voz custam precisão — como em qualquer reconhecedor de fala.
Quais idiomas ele atende?
O Whisper cobre cerca de cem idiomas e detecta o idioma sozinho; você também pode fixá-lo se o palpite estiver errado. Duas receitas traduzem a fala em qualquer um deles para o inglês numa única passagem, como texto ou como legendas SRT.
Em que formatos sai a transcrição?
TXT para texto simples, SRT e VTT com marcações de tempo para players e editores de vídeo, e JSON com o início e o fim de cada segmento para scripts e ferramentas.
Preciso de internet?
Uma vez, para baixar um modelo do Whisper na tela Modelos — de 78 MB a 1,62 GB, conforme o escolhido. Depois disso a transcrição roda inteiramente offline.
E se a gravação não tiver fala?
O MediaChef informa «Nenhuma fala detectada» em vez de gravar um arquivo vazio e marcar a tarefa como concluída. Silêncio, música sem vocais e um arquivo escolhido por engano terminam com a mesma honestidade.
Transforme essa gravação em texto
MediaChef 0.4.1 — Whisper rodando localmente, grátis e de código aberto.
Gratuito e de código aberto — veja o código no GitHub Todos os arquivos e notas da versão
O MediaChef é novo: as compilações ainda não são assinadas pela Apple nem pela Microsoft, então a primeira execução pede confirmação — dentro de cada download há instruções em texto simples.