MediaChef

MediaChef Vídeo para SRT

Gerar legendas SRT a partir de um vídeo

Arraste o vídeo para o MediaChef, escolha «Criar legendas SRT para um vídeo», deixe o modelo em small e o idioma em automático e execute. Um arquivo .srt aparece ao lado do vídeo, já com os tempos. Tudo é calculado na sua máquina: a fala não sai do disco e, depois que o modelo é baixado, a receita funciona com a rede desligada. Num notebook com M5, 2 minutos e 43 segundos de fala levaram 6,2 segundos no modelo padrão — cerca de 26 vezes mais rápido que o tempo real — e deram 73 legendas com média de 39 caracteres, curtas o bastante para dar tempo de ler.

O que você precisa
MediaChef 0.8.5 mais um download único do modelo
Modelo padrão
small — 488 MB, baixado uma vez e mantido
Velocidade
≈26× o tempo real no modelo padrão (medido, M5)
Funciona offline
Sim, depois que o modelo está no disco
Formatos
SRT, VTT, TXT comum e JSON — uma receita para cada
O que você recebe
clip.subs.srt ao lado do vídeo, com o original intacto

Gratuito e de código aberto — veja o código no GitHub Todos os arquivos e notas da versão

Como fazer legendas para um vídeo

  1. Baixe o MediaChef

    Um arquivo para macOS, Windows ou Linux. Tanto o FFmpeg quanto o motor do Whisper viajam dentro do download: não há nada para instalar à parte nem nada para acrescentar ao PATH.

  2. Baixe um modelo, uma vez só

    A primeira transcrição pede um modelo de fala. O padrão é o small, de 488 MB, e é com ele que estas medições foram feitas; o tiny tem 78 MB, o base 148 MB e o large-v3-turbo 1,62 GB. É baixado uma vez, fica no disco e daí em diante a receita não encosta mais na rede.

  3. Solte o vídeo e escolha a receita

    «Criar legendas SRT para um vídeo» aceita o vídeo direto — não é preciso extrair o áudio antes. O MediaChef decodifica a faixa para o mono de 16 kHz que o Whisper exige, numa pasta temporária que você nunca chega a ver.

  4. Execute e abra o .srt

    O arquivo cai ao lado do vídeo com o nome clip.subs.srt, com as legendas numeradas e seus tempos. Players, editores e plataformas leem direto e, como é texto puro, dá para corrigir um nome ou um termo em qualquer editor.

MediaChef pronto para converter: a bancada espera um arquivo de vídeo, a fila de tarefas fica à direita.
A bancada onde o vídeo cai. As receitas aparecem quando o MediaChef termina de ler o arquivo.

Qual modelo escolher

Quatro modelos, os mesmos 2 minutos e 43 segundos de fala, a mesma máquina: um notebook com M5 e 16 GB, cada modelo aquecido antes e valendo a melhor de duas passadas.

ModeloDownloadTempoContra o tempo realPalavras erradas
tiny78 MB2,1 s×785 de 540
base148 MB2,6 s×633 de 540
small — o padrão488 MB6,2 s×260 de 540
large-v3-turbo1,62 GB11,5 s×141 de 540

Leia a última coluna com cuidado, porque o áudio de teste é uma voz sintetizada lendo um texto preparado: sem sotaque, sem ruído de fundo e sem ninguém falando por cima. É por isso que aqui até o menor modelo acerta quase tudo, e isso não se parece com a gravação de uma reunião de verdade — em áudio difícil a distância entre estes modelos se abre bastante. Já a coluna do tempo se transfere direto para o seu caso. E uma coisa que a comparação crua esconde: quase todas as divergências eram números escritos em algarismos em vez de por extenso — o large-v3-turbo escreveu «70», «10», «50», «30» onde o texto dizia tudo por extenso —, e isso é formatação, não erro de escuta.

De que tamanho saem as legendas

Uma legenda tecnicamente correta ainda pode ser inútil se jogar vinte palavras na tela de uma vez. Os modelos picotam a mesma fala de maneiras bem diferentes, e isto foi medido na mesma passada acima.

ModeloLegendasDuração médiaCaracteres em médiaA mais longa
tiny354,7 s8397 caracteres
base354,7 s83100 caracteres
small — o padrão732,2 s3958 caracteres
large-v3-turbo305,4 s97112 caracteres

A regra comum na televisão fica em torno de 42 caracteres por linha em duas linhas, ou seja, cerca de 84 caracteres na tela ao mesmo tempo. Por essa medida, dos quatro só o small cabe com folga: 39 caracteres em média e 58 na legenda mais longa, enquanto o large-v3-turbo já passa do limite numa legenda comum. Ou seja, o modelo padrão não é só a escolha equilibrada em acerto — ele também corta a fala nos pedaços mais legíveis.

SRT, VTT, texto puro ou JSON

A mesma transcrição escrita de quatro jeitos. Os tamanhos vêm dos mesmos 2 minutos e 43 segundos de fala, então dá para comparar direto.

FormatoTamanhoO que tem dentroQuando usar
SRT5,5 KBLegendas numeradas, tempos com vírgula: 00:00:00,000Quase sempre. Players, editores e plataformas aceitam
VTT5,3 KBCabeçalho WEBVTT, tempos com ponto: 00:00:00.000Legendas para player web, a faixa do navegador
TXT3,0 KBTexto corrido, sem tempo nenhumVocê quer as palavras, não as legendas
JSON15,2 KBCada legenda mais o modelo e os parâmetros usadosQuem vai ler isso é um programa, não uma pessoa

SRT e VTT diferem principalmente no caractere entre segundos e milissegundos, então, se um player recusar um deles, o outro é trocar de receita e não transcrever de novo. O JSON pesa cerca de três vezes mais que o SRT porque carrega os dados da execução junto com o texto.

Qual receita para cada caso

Legenda não é uma receita só, são várias, e escolher a certa economiza um passo. Todas estão no catálogo de 17 receitas.

O que você temO que você querReceita
Um vídeoLegendas ao lado deleCriar legendas SRT para um vídeo
Um arquivo de áudioLegendasTranscrever áudio para legendas SRT
Fala em outro idiomaLegendas em inglês numa passadaTraduzir a fala para legendas em inglês
Qualquer coisa com falaSó o textoTranscrever áudio para texto
Qualquer coisa com falaUma faixa para player webTranscrever áudio para WebVTT

A receita de tradução vai da fala estrangeira direto para legendas em inglês com tempos, numa única passada — não é transcrever primeiro e traduzir depois. Mas só vai para o inglês; esse é um limite do modelo, não do aplicativo.

Por que fazer legendas no seu próprio computador

A fala não sai do seu disco. Gravações de reuniões, entrevistas e chamadas são o tipo de arquivo mais delicado que a maioria das pessoas manuseia, e uma transcrição online é, por definição, uma cópia daquela conversa no servidor de outra pessoa. Aqui não existe upload sobre o qual pensar.

Nada de pagar por minuto. Serviços de transcrição cobram por minuto de áudio, e isso transforma um acervo longo numa fatura de verdade. O download do modelo é único e, depois dele, uma gravação de duas horas custa o mesmo que uma de dois minutos: nada.

Roda com a rede desligada. Assim que o arquivo do modelo está no disco, esta receita não encosta na internet. Funciona no avião, numa máquina fechada e numa sala onde o wi-fi é a coisa menos confiável presente.

Sem limite de duração. Transcritores web gratuitos costumam travar em poucos minutos por arquivo, justamente quando a gravação vale a pena transcrever por ser longa. Aqui não há teto.

Uma pasta inteira de uma vez. Solte um diretório de gravações e a fila passa por elas uma a uma, dizendo onde cada arquivo de legenda foi escrito.

Quando não é a ferramenta certa

A receita escreve um arquivo de legenda. Isso é mais estreito do que «colocar legenda no vídeo», e a diferença pesa nestes casos.

  1. Você quer a legenda queimada na imagem.

    Aqui sai um .srt separado que o player carrega junto com o vídeo. Gravar o texto dentro dos quadros é outra operação: ela recodifica o vídeo, e depois disso as palavras não podem mais ser desligadas nem corrigidas.

  2. Você precisa de precisão de broadcast.

    Mesmo no áudio limpo das medições acima os modelos tropeçaram em algumas palavras, e gravações reais são mais difíceis. Tudo que é publicado sob exigência legal de acessibilidade passa por revisão humana antes de sair, seja lá o que tenha feito o rascunho.

  3. O áudio é realmente ruim.

    Muita gente falando por cima, a gravação de uma sala feita no celular ou música mais alta que a voz derrubam os quatro modelos. Consertar o áudio antes — nem que seja só extrair uma faixa mais limpa — rende mais do que subir de tamanho de modelo.

  4. Você precisa de tradução para outra coisa além do inglês.

    O Whisper traduz para o inglês e só para ele. Para qualquer outro idioma de destino, transcreva primeiro no idioma original e traduza esse texto com uma ferramenta feita para isso.

Perguntas

Isso é grátis?

Sim, tudo. O MediaChef é de código aberto sob GPL-3.0: não há versão paga, nem cobrança por minuto, nem limite de duração. Os modelos também são baixados de graça. A versão atual é a 0.8.5.

Meu vídeo é enviado para algum lugar?

Não. A fala é processada por um arquivo de modelo que está no seu próprio disco. A única coisa que atravessa a rede é o download único do modelo, e depois disso a receita roda com a internet desligada.

Quanto tempo leva?

Cerca de 26 vezes mais rápido que o tempo real no modelo padrão: medimos 6,2 segundos para 2 minutos e 43 segundos de fala num notebook com M5. Nessa proporção, uma gravação de uma hora sai em poucos minutos. No mesmo áudio, o tiny deu ×78 e o large-v3-turbo ×14.

Qual modelo eu devo escolher?

Comece pelo small, o padrão. Nas nossas medições ele acertou todas as palavras do áudio de teste e produziu as legendas mais legíveis — 39 caracteres em média contra 97 do large-v3-turbo. Suba só se o seu áudio for difícil; desça para tiny ou base se quiser um rascunho em poucos segundos.

Qual o tamanho do modelo?

78 MB o tiny, 148 MB o base, 488 MB o small e 1,62 GB o large-v3-turbo. O download é único. Depois o arquivo fica no disco e cada execução seguinte o usa sem perguntar.

Preciso dizer em que idioma é a fala?

Não. O idioma vem em automático e o modelo descobre pelo áudio. Ainda assim dá para informar explicitamente, e vale a pena quando a gravação começa com algumas frases em outro idioma.

Ele consegue traduzir as legendas para o inglês?

Sim, com a receita «Traduzir a fala para legendas em inglês»: entra fala estrangeira e sai um SRT em inglês com tempos, numa passada só em vez de transcrever e depois traduzir. O inglês é o único idioma de destino que o modelo suporta.

Qual a diferença entre SRT e VTT?

Principalmente a pontuação nos tempos: o SRT escreve 00:00:00,000 com vírgula e numera as legendas, o VTT escreve 00:00:00.000 com ponto e começa com uma linha WEBVTT. O SRT é o que players e editores esperam; o VTT é o que um player web quer para a própria faixa de legenda. São receitas diferentes, então trocar de formato é rodar de novo, não reescrever o arquivo.

Dá para editar as legendas depois?

Dá — um .srt é texto puro. Abra em qualquer editor para corrigir um nome próprio, um jargão ou um tempo. Esse é o jeito normal de trabalhar: o modelo entrega noventa e tantos por cento e você acerta o resto na mão.

Por que minhas legendas estão longas demais?

Porque o modelo decide onde cortar, e os modelos maiores cortam menos. Medimos 39 caracteres por legenda no small contra 97 no large-v3-turbo, no mesmo áudio. Se as suas legendas estão se esticando, voltar para o small costuma resolver — e em fala limpa isso não custa nada em acerto.

Ele separa os falantes?

Não. O Whisper escreve o que foi dito, não quem disse. Se você precisa de marcações «Falante 1 / Falante 2», vai ter que colocá-las à mão ou usar uma ferramenta feita justamente para isso.

O que acontece se não houver fala no arquivo?

A execução para e avisa que não ouviu nada reconhecível, em vez de escrever calada um arquivo vazio. Silêncio não gera legenda, e isso é de propósito.

Funciona no Windows e no Linux?

Nas três plataformas. A fala é processada na CPU em todas elas e, no Apple Silicon, usa também a GPU — daí os números rápidos acima. A mesma receita num notebook modesto com Windows vai ser mais lenta, mas ainda assim mais rápida do que ouvir a gravação inteira.

Dá para legendar vários arquivos de uma vez?

Dá. Solte uma pasta inteira, acrescente a receita e a fila passa por eles um atrás do outro. Cada arquivo de legenda é escrito ao lado da própria fonte.

O arquivo de vídeo é alterado?

Não. É escrito um .srt separado ao lado dele — clip.subs.srt — e o vídeo não é modificado, nem renomeado, nem recodificado. Esta receita não toca na imagem.

Tire as legendas desse vídeo

MediaChef 0.8.5 — grátis, código aberto, macOS · Windows · Linux.

Gratuito e de código aberto — veja o código no GitHub Todos os arquivos e notas da versão

O MediaChef é novo: as compilações ainda não são assinadas pela Apple nem pela Microsoft, então a primeira execução pede confirmação — dentro de cada download há instruções em texto simples.

Algo não funciona ou está faltando? Escreva para nós: hello@mediachef.app