MediaChef

MediaChef Áudio em texto

Transcrever áudio para texto — offline, no seu próprio computador

O MediaChef roda o Whisper da OpenAI localmente através do whisper.cpp. Baixe um modelo uma vez, solte uma gravação ou um vídeo na área de arquivos e escolha o que quer de saída: texto simples, legendas SRT ou VTT com tempos, ou JSON com o tempo de cada segmento. O áudio nunca é enviado e não há preço por minuto.

Gratuito e de código aberto — veja o código no GitHub Todos os arquivos e notas da versão

O que você recebe

00:00:04 Oi, pessoal, vamos começar… 00:00:11 Primeiro ponto: os planos do trimestre. 00:00:19 São três cenários, vou mostrar a tabela.

TXT sem tempos, SRT e VTT com eles, JSON com o início e o fim de cada segmento.

Como transcrever uma gravação

  1. Baixe o MediaChef

    Um arquivo para macOS, Windows ou Linux. O whisper.cpp v1.7.6 já vem dentro do download; só o modelo é baixado à parte.

  2. Escolha um modelo do Whisper

    Abra Modelos e baixe um — small (488 MB) é o equilíbrio padrão. Baixa uma vez; depois a transcrição funciona com a rede desligada.

  3. Solte a gravação ou o vídeo

    Áudio e vídeo funcionam igual: o MediaChef extrai o som do vídeo sozinho, então a gravação de uma reunião e um MP4 seguem o mesmo caminho.

  4. Escolha a saída que precisa

    «Transcrever áudio para texto» para TXT, «Transcrever áudio para legendas SRT» ou «Transcrever áudio para WebVTT» para legendas com tempos, «Transcrever áudio para JSON com tempos» para ferramentas.

  5. Clique em iniciar e leia o resultado

    O texto aparece ao lado do arquivo como talk.transcript.txt. A fila mostra o progresso; se não houver fala no arquivo, o MediaChef avisa em vez de gravar um vazio.

MediaChef antes da transcrição: a área para soltar uma gravação, com Modelos no menu lateral, de onde os modelos do Whisper são baixados.
Os modelos ficam no menu lateral — baixe uma vez e transcreva offline daí em diante.

Qual modelo do Whisper escolher

O catálogo traz quatro modelos, baixados dentro do aplicativo. Maior significa texto melhor e execução mais longa na mesma máquina, então escolha por tarefa, e não de uma vez para sempre.

ModeloDownloadQuando escolher
tiny 78 MB Uma primeira passada em fala clara, ou quando você só precisa achar onde um assunto começa.
base 148 MB Anotações para você mesmo: texto legível que vai reler e editar de qualquer forma.
small 488 MB O padrão em todas as receitas de transcrição, e o que a maioria mantém. Entrevistas, reuniões, aulas.
large-v3-turbo 1,62 GB Texto que vai para outra pessoa: legendas que você publica, citações que reproduz. Otimizado para Apple Silicon.

O idioma é detectado automaticamente, e você também pode fixá-lo. Duas receitas extras traduzem qualquer idioma para o inglês — como texto ou como legendas com tempos — na mesma passagem.

Por que transcrever no seu computador

Áudio confidencial continua confidencial. Entrevistas, anotações clínicas, ligações jurídicas, qualquer coisa sob acordo de confidencialidade: o arquivo é lido por um processo da sua própria máquina e por mais nada.

Sem cobrança por minuto. A transcrição na nuvem cobra por minuto. No computador, a décima hora de áudio custa o mesmo que a primeira: nada.

Sem limite de duração ou tamanho. Uma gravação de quatro horas é uma tarefa na fila, não um plano pago nem uma gambiarra de dividir o arquivo.

Funciona sem rede nenhuma. Com o modelo em disco, a transcrição é offline: num avião, num laboratório, numa máquina isolada.

Legendas e texto da mesma passagem. SRT e VTT carregam os tempos para um player, TXT é prosa limpa, JSON traz os tempos dos segmentos para os seus próprios scripts.

Perguntas frequentes

Qual a precisão da transcrição do Whisper?

A precisão acompanha o modelo: tiny é um rascunho, small é o equilíbrio padrão, large-v3-turbo chega perto do nível humano com fala clara. Áudio limpo de um único falante sai melhor; sotaques fortes, pessoas falando por cima e música sob a voz custam precisão — como em qualquer reconhecedor de fala.

Quais idiomas ele atende?

O Whisper cobre cerca de cem idiomas e detecta o idioma sozinho; você também pode fixá-lo se o palpite estiver errado. Duas receitas traduzem a fala em qualquer um deles para o inglês numa única passagem, como texto ou como legendas SRT.

Em que formatos sai a transcrição?

TXT para texto simples, SRT e VTT com marcações de tempo para players e editores de vídeo, e JSON com o início e o fim de cada segmento para scripts e ferramentas.

Preciso de internet?

Uma vez, para baixar um modelo do Whisper na tela Modelos — de 78 MB a 1,62 GB, conforme o escolhido. Depois disso a transcrição roda inteiramente offline.

E se a gravação não tiver fala?

O MediaChef informa «Nenhuma fala detectada» em vez de gravar um arquivo vazio e marcar a tarefa como concluída. Silêncio, música sem vocais e um arquivo escolhido por engano terminam com a mesma honestidade.

Transforme essa gravação em texto

MediaChef 0.4.1 — Whisper rodando localmente, grátis e de código aberto.

Gratuito e de código aberto — veja o código no GitHub Todos os arquivos e notas da versão

O MediaChef é novo: as compilações ainda não são assinadas pela Apple nem pela Microsoft, então a primeira execução pede confirmação — dentro de cada download há instruções em texto simples.