MediaChef

MediaChef Audio in testo

Trascrivere audio in testo — offline, sul tuo computer

MediaChef esegue Whisper di OpenAI in locale tramite whisper.cpp. Scarica un modello una volta, poi trascina una registrazione o un video e scegli cosa vuoi in uscita: testo semplice, sottotitoli SRT o VTT con i tempi, oppure JSON con il tempo di ogni segmento. L'audio non viene mai caricato e non c'è un prezzo al minuto.

Gratuito e open source — guarda il codice su GitHub Tutti i file e le note di rilascio

Cosa ottieni

00:00:04 Ciao a tutti, cominciamo… 00:00:11 Primo punto: i piani del trimestre. 00:00:19 Ci sono tre scenari, vi mostro la tabella.

TXT senza tempi, SRT e VTT con i tempi, JSON con inizio e fine di ogni segmento.

Come trascrivere una registrazione

  1. Scarica MediaChef

    Un file per macOS, Windows o Linux. whisper.cpp v1.7.6 è già dentro il download; solo il modello si scarica a parte.

  2. Scegli un modello Whisper

    Apri Modelli e scaricane uno — small (488 MB) è l'equilibrio predefinito. Si scarica una volta; dopo la trascrizione funziona con la rete spenta.

  3. Trascina la registrazione o il video

    Vanno bene sia audio sia video: MediaChef estrae il suono dal video da solo, quindi la registrazione di una riunione e un MP4 seguono la stessa strada.

  4. Scegli l'uscita che ti serve

    «Trascrivi audio in testo» per il TXT, «Trascrivi audio in sottotitoli SRT» o «Trascrivi audio in WebVTT» per sottotitoli con i tempi, «Trascrivi audio in JSON con i tempi» per gli strumenti.

  5. Premi avvia e leggi il risultato

    Il testo finisce accanto al file come talk.transcript.txt. La coda mostra l'avanzamento; se nel file non c'è parlato, MediaChef lo dice invece di scriverne uno vuoto.

MediaChef prima della trascrizione: l'area per trascinare una registrazione, con Modelli nel menu laterale da cui si scaricano i modelli Whisper.
I modelli stanno nel menu laterale — scarichi una volta e poi trascrivi offline.

Quale modello Whisper scegliere

Nel catalogo ci sono quattro modelli, scaricati dentro l'app. Più grande significa testo migliore ed elaborazione più lunga sulla stessa macchina, quindi scegli in base al lavoro e non una volta per sempre.

ModelloDownloadQuando sceglierlo
tiny 78 MB Un primo passaggio su parlato chiaro, o quando ti serve solo trovare dove inizia un argomento.
base 148 MB Appunti per te: testo leggibile che comunque riguarderai e correggerai.
small 488 MB Il predefinito in tutte le ricette di trascrizione, e quello con cui restano quasi tutti. Interviste, riunioni, lezioni.
large-v3-turbo 1,62 GB Testo destinato ad altri: sottotitoli che pubblichi, citazioni che riporti. Ottimizzato per Apple Silicon.

La lingua viene rilevata automaticamente, e puoi anche fissarla. Due ricette aggiuntive traducono qualsiasi lingua in inglese — come testo o come sottotitoli con i tempi — nello stesso passaggio.

Perché trascrivere sul tuo computer

L'audio riservato resta riservato. Interviste, appunti clinici, telefonate legali, qualsiasi cosa sotto accordo di riservatezza: il file lo legge un processo sulla tua macchina e nient'altro.

Nessuna tariffa al minuto. La trascrizione nel cloud fattura al minuto. In locale la decima ora di audio costa quanto la prima: nulla.

Nessun limite di durata o dimensione. Una registrazione di quattro ore è un lavoro in coda, non un piano a pagamento né un espediente per spezzare il file.

Funziona senza alcuna rete. Una volta che il modello è sul disco, la trascrizione è offline: in aereo, in laboratorio, su una macchina isolata.

Sottotitoli e testo dallo stesso passaggio. SRT e VTT portano i tempi per un lettore, TXT è prosa pulita, JSON ha i tempi dei segmenti per i tuoi script.

Domande frequenti

Quanto è accurata la trascrizione di Whisper?

L'accuratezza dipende dal modello: tiny è una bozza, small è l'equilibrio predefinito, large-v3-turbo sfiora il livello umano su parlato chiaro. L'audio pulito con un solo parlante è quello che riesce meglio; accenti marcati, persone che parlano sovrapposte e musica sotto la voce costano accuratezza — come per qualsiasi sistema di riconoscimento vocale.

Quali lingue gestisce?

Whisper copre un centinaio di lingue e rileva la lingua da solo; puoi anche fissarla se sbaglia. Due ricette traducono il parlato da qualsiasi di esse in inglese in un solo passaggio, come testo o come sottotitoli SRT.

In quali formati esce la trascrizione?

TXT per il testo semplice, SRT e VTT con i tempi per lettori e programmi di montaggio, e JSON con inizio e fine di ogni segmento per script e strumenti.

Serve internet?

Una volta, per scaricare un modello Whisper dalla schermata Modelli — da 78 MB a 1,62 GB a seconda di quale scegli. Dopo, la trascrizione gira interamente offline.

E se la registrazione non contiene parlato?

MediaChef segnala «Nessun parlato rilevato» invece di scrivere un file vuoto e spuntare il lavoro in verde. Silenzio, musica senza voce e un file scelto per errore finiscono con la stessa onestà.

Trasforma quella registrazione in testo

MediaChef 0.4.1 — Whisper in locale, gratuito e open source.

Gratuito e open source — guarda il codice su GitHub Tutti i file e le note di rilascio

MediaChef è giovane: le build non sono ancora firmate da Apple né da Microsoft, quindi il primo avvio chiede conferma — dentro ogni download c'è una guida in testo semplice.