MediaChef

MediaChef Video in SRT

Creare sottotitoli SRT da un video

Trascina il video in MediaChef, scegli «Crea sottotitoli SRT per un video», lascia il modello su small e la lingua su automatico, e avvia. Accanto al video comparirà un file .srt, tempi compresi. Tutto viene calcolato sulla tua macchina: il parlato non esce dal disco e, una volta scaricato il modello, la ricetta funziona con la rete spenta. Su un portatile M5, 2 minuti e 43 secondi di parlato hanno richiesto 6,2 secondi con il modello predefinito — circa 26 volte più veloce del tempo reale — e hanno prodotto 73 battute da 39 caratteri in media, abbastanza corte da leggersi con comodo.

Cosa serve
MediaChef 0.8.5 più uno scaricamento del modello, una volta sola
Modello predefinito
small — 488 MB, scaricato una volta e poi tenuto
Velocità
≈26× il tempo reale con il modello predefinito (misurato, M5)
Funziona offline
Sì, una volta che il modello è sul disco
Formati
SRT, VTT, TXT semplice e JSON — una ricetta per ciascuno
Cosa ottieni
clip.subs.srt accanto al video, con l'originale intatto

Gratuito e open source — guarda il codice su GitHub Tutti i file e le note di rilascio

Come sottotitolare un video

  1. Scarica MediaChef

    Un file per macOS, Windows o Linux. Sia FFmpeg sia il motore di Whisper viaggiano dentro lo scaricamento: non c'è nulla da installare a parte né nulla da aggiungere al PATH.

  2. Scarica un modello, una volta sola

    La prima trascrizione chiede un modello vocale. Quello predefinito è small, da 488 MB, ed è con lui che sono fatte tutte le misure qui sotto; tiny pesa 78 MB, base 148 MB e large-v3-turbo 1,62 GB. Viene preso una volta, resta sul disco e da lì in poi la ricetta non tocca più la rete.

  3. Butta dentro il video e scegli la ricetta

    «Crea sottotitoli SRT per un video» prende il video direttamente: non serve estrarre prima l'audio. MediaChef decodifica la traccia nel mono a 16 kHz che Whisper pretende, in una cartella temporanea che non vedrai mai.

  4. Avvia e apri il .srt

    Il file arriva accanto al video con il nome clip.subs.srt, con le battute numerate e i loro tempi. Lettori, programmi di montaggio e piattaforme lo leggono così com'è e, dato che è testo semplice, un nome o un termine si corregge in qualsiasi editor.

MediaChef pronto a convertire: il piano di lavoro aspetta un file video, la coda dei lavori è a destra.
Il piano di lavoro dove arriva il video. Le ricette compaiono quando MediaChef ha letto il file.

Quale modello scegliere

Quattro modelli, gli stessi 2 minuti e 43 secondi di parlato, la stessa macchina: un portatile M5 con 16 GB, ogni modello scaldato prima e conteggiata la migliore di due passate.

ModelloScaricamentoTempoContro il tempo realeParole sbagliate
tiny78 MB2,1 s×785 su 540
base148 MB2,6 s×633 su 540
small — quello predefinito488 MB6,2 s×260 su 540
large-v3-turbo1,62 GB11,5 s×141 su 540

Leggi l'ultima colonna con cautela, perché l'audio di prova è una voce sintetica che legge un testo preparato: senza accento, senza rumore di fondo, senza nessuno che parli sopra. Ecco perché qui persino il modello più piccolo è quasi perfetto, e non è così che suona la registrazione di una riunione vera — su audio difficile la distanza fra questi modelli si allarga parecchio. La colonna del tempo, invece, si trasferisce al tuo caso di peso. E c'è una cosa che il confronto grezzo nascondeva: quasi tutte le discrepanze erano numeri scritti in cifre anziché in lettere — large-v3-turbo ha scritto «70», «10», «50», «30» dove il testo li diceva per esteso — e questa è formattazione, non un errore d'ascolto.

Quanto vengono lunghe le battute

Un sottotitolo tecnicamente giusto resta inutilizzabile se butta venti parole sullo schermo tutte insieme. I modelli spezzano lo stesso parlato in modi molto diversi, e questo è misurato sulla stessa passata di sopra.

ModelloBattuteDurata mediaCaratteri in mediaLa più lunga
tiny354,7 s8397 caratteri
base354,7 s83100 caratteri
small — quello predefinito732,2 s3958 caratteri
large-v3-turbo305,4 s97112 caratteri

La regola diffusa in televisione sta intorno ai 42 caratteri per riga su due righe, quindi circa 84 caratteri sullo schermo insieme. Con questo metro, dei quattro solo small ci sta comodo: 39 caratteri in media e 58 nella battuta più lunga, mentre large-v3-turbo sfora il limite già su una battuta qualunque. Il modello predefinito, insomma, non è solo la scelta equilibrata sull'accuratezza — è anche quello che spezza il parlato nei pezzi più leggibili.

SRT, VTT, testo semplice o JSON

La stessa trascrizione scritta in quattro modi. Le dimensioni vengono dagli stessi 2 minuti e 43 secondi di parlato, quindi si confrontano direttamente.

FormatoDimensioneCosa c'è dentroQuando prenderlo
SRT5,5 KBBattute numerate, tempi con la virgola: 00:00:00,000Quasi sempre. Lo prendono lettori, montaggio e piattaforme
VTT5,3 KBIntestazione WEBVTT, tempi con il punto: 00:00:00.000Sottotitoli per un lettore web, la traccia del browser
TXT3,0 KBTesto di seguito, senza alcun tempoVuoi le parole, non i sottotitoli
JSON15,2 KBOgni battuta più il modello e i parametri usatiA leggerlo sarà un programma, non una persona

SRT e VTT si distinguono soprattutto per il carattere fra secondi e millesimi, quindi se un lettore rifiuta l'uno, l'altro è un cambio di ricetta e non una nuova trascrizione. Il JSON pesa circa il triplo dell'SRT perché porta i dati della passata accanto al testo.

Quale ricetta per quale caso

I sottotitoli non sono una ricetta ma diverse, e scegliere quella giusta ti risparmia un passaggio. Sono tutte nel catalogo da 17 ricette.

Cosa haiCosa vuoiRicetta
Un videoSottotitoli accantoCrea sottotitoli SRT per un video
Un file audioSottotitoliTrascrivi audio in sottotitoli SRT
Parlato in un'altra linguaSottotitoli inglesi in una passataTraduci il parlato in sottotitoli inglesi
Qualsiasi cosa con del parlatoSolo il testoTrascrivi audio in testo
Qualsiasi cosa con del parlatoUna traccia per lettore webTrascrivi audio in WebVTT

La ricetta di traduzione va dal parlato straniero direttamente a sottotitoli inglesi con i tempi, in una passata sola — niente «prima trascrivi, poi traduci». Va però solo verso l'inglese: è un limite del modello, non dell'applicazione.

Perché sottotitolare sul proprio computer

Il parlato non esce dal tuo disco. Le registrazioni di riunioni, interviste e telefonate sono il tipo di file più delicato che la maggior parte delle persone si trovi a maneggiare, e una trascrizione online è per definizione una copia di quella conversazione sul server di qualcun altro. Qui non c'è nessun caricamento su cui ragionare.

Niente tariffa al minuto. I servizi di trascrizione contano al minuto di audio, e questo trasforma un archivio lungo in una fattura vera. Il modello si scarica una volta e poi una registrazione di due ore costa quanto una di due minuti: niente.

Funziona con la rete spenta. Appena il file del modello è sul disco, questa ricetta non tocca più internet. Funziona in aereo, su una macchina blindata e in una stanza dove il wifi è la cosa meno affidabile presente.

Nessun limite di durata. I trascrittori web gratuiti in genere ti fermano a pochi minuti per file, proprio quando una registrazione merita di essere trascritta perché è lunga. Qui non c'è tetto.

Una cartella intera in una volta. Butta dentro una cartella di registrazioni: la coda le smaltisce una alla volta e ti dice dove è finito ogni file di sottotitoli.

Quando non è lo strumento giusto

La ricetta scrive un file di sottotitoli. È un lavoro più stretto di «mettere i sottotitoli a un video», e la differenza conta in questi casi.

  1. Vuoi i sottotitoli impressi nell'immagine.

    Qui esce un .srt separato che il lettore carica accanto al video. Bruciare il testo dentro i fotogrammi è un'altra operazione: ricodifica il video, e dopo quelle parole non si possono più spegnere né correggere.

  2. Ti serve un'accuratezza da messa in onda.

    Anche sull'audio pulito misurato sopra i modelli sono inciampati su qualche parola, e le registrazioni vere sono più difficili. Tutto ciò che si pubblica sotto un obbligo di accessibilità lo rilegge una persona prima di uscire, qualunque cosa abbia prodotto la bozza.

  3. L'audio è davvero brutto.

    Voci fitte che si accavallano, una stanza registrata col telefono o la musica più alta della voce mettono a terra tutti e quattro i modelli. Sistemare prima l'audio — anche solo estrarne una traccia più pulita — rende più che salire di taglia di modello.

  4. Ti serve una traduzione in qualcosa che non sia l'inglese.

    Whisper traduce in inglese e solo in inglese. Per qualsiasi altra lingua di arrivo, trascrivi prima nella lingua originale e traduci quel testo con uno strumento fatto per quello.

Domande

È gratis?

Sì, tutto quanto. MediaChef è open source con licenza GPL-3.0: nessuna versione a pagamento, nessun addebito al minuto, nessun tetto di durata. Anche i modelli si scaricano gratis. La versione attuale è la 0.8.5.

Il mio video viene caricato da qualche parte?

No. Il parlato lo elabora un file di modello che sta sul tuo disco. L'unica cosa che attraversa la rete è lo scaricamento del modello, una volta sola, e dopo la ricetta gira anche con internet spento.

Quanto ci mette?

Circa 26 volte più veloce del tempo reale con il modello predefinito: abbiamo misurato 6,2 secondi per 2 minuti e 43 secondi di parlato su un portatile M5. Con quel rapporto, una registrazione di un'ora se ne va in un paio di minuti. Sullo stesso audio tiny ha fatto ×78 e large-v3-turbo ×14.

Quale modello dovrei scegliere?

Parti da small, quello predefinito. Nelle nostre misure ha azzeccato ogni parola dell'audio di prova e ha prodotto le battute più leggibili — 39 caratteri in media contro 97 di large-v3-turbo. Sali solo se il tuo audio è difficile; scendi a tiny o base se vuoi una bozza in un paio di secondi.

Quanto pesa il modello?

78 MB tiny, 148 MB base, 488 MB small e 1,62 GB large-v3-turbo. Lo scaricamento avviene una volta sola. Dopo il file resta sul disco e ogni passata successiva lo usa senza chiedere.

Devo dirgli in che lingua si parla?

No. La lingua è su automatico e il modello la ricava dall'audio. Puoi comunque indicarla esplicitamente, e conviene farlo quando una registrazione si apre con qualche frase in un'altra lingua.

Può tradurre i sottotitoli in inglese?

Sì, con la ricetta «Traduci il parlato in sottotitoli inglesi»: entra parlato straniero, esce un SRT inglese con i tempi, in una passata sola invece di trascrivere e poi tradurre. L'inglese è l'unica lingua di arrivo che il modello sostiene.

Che differenza c'è fra SRT e VTT?

Soprattutto la punteggiatura nei tempi: l'SRT scrive 00:00:00,000 con la virgola e numera le battute, il VTT scrive 00:00:00.000 con il punto e comincia con una riga WEBVTT. L'SRT è ciò che si aspettano lettori e programmi di montaggio; il VTT è ciò che vuole un lettore web per la propria traccia di sottotitoli. Sono ricette distinte, quindi cambiare formato è rilanciare, non riscrivere il file.

Posso correggere i sottotitoli dopo?

Sì, un .srt è testo semplice. Aprilo in qualsiasi editor per sistemare un nome proprio, un termine tecnico o un tempo. È il modo normale di lavorare: il modello fa il novanta e qualcosa per cento, il resto lo recuperi a mano.

Perché alcune mie battute sono troppo lunghe?

Perché è il modello a decidere dove spezzare, e i modelli grandi spezzano meno spesso. Abbiamo misurato 39 caratteri per battuta con small contro 97 con large-v3-turbo, sullo stesso audio. Se le tue battute si allungano, tornare a small di solito risolve — e su parlato pulito non costa nulla in accuratezza.

Distingue chi parla?

No. Whisper scrive cosa è stato detto, non chi l'ha detto. Se ti servono le etichette «Interlocutore 1 / Interlocutore 2», dovrai metterle a mano o usare uno strumento fatto proprio per quello.

Cosa succede se nel file non c'è parlato?

La passata si ferma e ti dice che non ha sentito nulla di riconoscibile, invece di scrivere in silenzio un file vuoto. Il silenzio non produce sottotitoli, ed è voluto.

Funziona su Windows e Linux?

Su tutte e tre le piattaforme. Il parlato viene elaborato dalla CPU ovunque e, su Apple Silicon, anche dalla GPU: da lì vengono i numeri veloci qui sopra. La stessa ricetta su un portatile Windows modesto sarà più lenta, ma comunque più rapida che ascoltarsi la registrazione.

Posso sottotitolare più file insieme?

Sì. Butta dentro una cartella intera, aggiungi la ricetta e la coda li smaltisce uno dopo l'altro. Ogni file di sottotitoli viene scritto accanto alla propria sorgente.

Il file video viene modificato?

No. Accanto viene scritto un .srt separato — clip.subs.srt — e il video non viene modificato, né rinominato, né ricodificato. Questa ricetta non tocca affatto l'immagine.

Prenditi i sottotitoli di quel video

MediaChef 0.8.5 — gratis, open source, macOS · Windows · Linux.

Gratuito e open source — guarda il codice su GitHub Tutti i file e le note di rilascio

MediaChef è giovane: le build non sono ancora firmate da Apple né da Microsoft, quindi il primo avvio chiede conferma — dentro ogni download c'è una guida in testo semplice.

Qualcosa non funziona o manca? Scrivici: hello@mediachef.app