MediaChef Audio in Text
Audio in Text transkribieren — offline, auf dem eigenen Rechner
MediaChef führt Whisper von OpenAI lokal über whisper.cpp aus. Ein Modell einmal laden, dann eine Aufnahme oder ein Video ablegen und wählen, was herauskommen soll: reiner Text, SRT- oder VTT-Untertitel mit Zeitmarken, oder JSON mit der Zeit jedes Abschnitts. Das Audio wird nie hochgeladen, und es gibt keinen Minutenpreis.
Kostenlos und quelloffen — Code auf GitHub ansehen Alle Dateien und Versionshinweise
Was dabei herauskommt
TXT ohne Zeitmarken, SRT und VTT mit ihnen, JSON mit Anfang und Ende jedes Abschnitts.
Eine Aufnahme transkribieren
-
MediaChef herunterladen
Eine Datei für macOS, Windows oder Linux. whisper.cpp v1.7.6 steckt bereits im Download; nur das Modell kommt separat.
-
Whisper-Modell wählen
Öffnen Sie „Modelle“ und laden Sie eines — small (488 MB) ist die ausgewogene Vorgabe. Einmal geladen, danach transkribiert die App mit abgeschaltetem Netz.
-
Aufnahme oder Video ablegen
Audio und Video gehen beide: MediaChef holt den Ton aus einem Video selbst heraus, ein Meeting-Mitschnitt und ein MP4 nehmen denselben Weg.
-
Gewünschte Ausgabe wählen
„Audio in Text transkribieren“ für TXT, „Audio in SRT-Untertitel transkribieren“ oder „Audio in WebVTT transkribieren“ für Untertitel mit Zeitmarken, „Audio in JSON mit Zeitmarken“ für eigene Werkzeuge.
-
Start drücken und lesen
Der Text landet neben der Datei als talk.transcript.txt. Die Warteschlange zeigt den Fortschritt; enthält die Datei keine Sprache, sagt MediaChef das, statt eine leere zu schreiben.
Welches Whisper-Modell wählen
Vier Modelle stehen im Katalog und werden in der App geladen. Größer heißt besserer Text und längere Rechenzeit auf derselben Maschine — wählen Sie also je Aufgabe statt ein für alle Mal.
| Modell | Download | Wann es passt |
|---|---|---|
tiny | 78 MB | Ein erster Durchgang bei klarer Sprache, oder wenn Sie nur finden müssen, wo ein Thema beginnt. |
base | 148 MB | Notizen für sich selbst: lesbarer Text, den Sie ohnehin überfliegen und nachbessern. |
small | 488 MB | Die Vorgabe in allen Transkriptionsrezepten und das Modell, bei dem die meisten bleiben. Interviews, Meetings, Vorlesungen. |
large-v3-turbo | 1,62 GB | Text, der an andere geht: veröffentlichte Untertitel, zitierte Passagen. Auf Apple Silicon optimiert. |
Die Sprache wird automatisch erkannt, lässt sich aber auch festlegen. Zwei zusätzliche Rezepte übersetzen jede Sprache ins Englische — als Text oder als Untertitel mit Zeitmarken — im selben Durchgang.
Warum lokal transkribieren
Vertrauliches Audio bleibt vertraulich. Interviews, Therapienotizen, Anwaltsgespräche, alles unter Verschwiegenheitspflicht: Die Datei liest ein Prozess auf Ihrem eigenen Rechner und sonst nichts.
Kein Minutenpreis. Transkription in der Cloud rechnet pro Minute ab. Lokal kostet die zehnte Stunde Audio so viel wie die erste: nichts.
Keine Längen- oder Größengrenze. Eine vierstündige Aufnahme ist eine Aufgabe in der Warteschlange, kein Bezahltarif und kein Behelf, die Datei zu zerteilen.
Funktioniert ganz ohne Netz. Liegt das Modell auf der Platte, läuft die Transkription offline: im Flugzeug, im Labor, auf einer abgeschotteten Maschine.
Untertitel und Text aus einem Durchgang. SRT und VTT tragen die Zeitmarken für einen Player, TXT ist sauberer Fließtext, JSON enthält die Abschnittszeiten für eigene Skripte.
Häufige Fragen
Wie genau ist die Whisper-Transkription?
Die Genauigkeit hängt am Modell: tiny ist ein Rohentwurf, small die ausgewogene Vorgabe, large-v3-turbo kommt bei klarer Sprache nah an menschliches Niveau. Sauberes Audio mit einer Stimme gelingt am besten; starke Akzente, Durcheinanderreden und Musik unter der Stimme kosten Genauigkeit — wie bei jeder Spracherkennung.
Welche Sprachen kann es?
Whisper deckt rund hundert Sprachen ab und erkennt die Sprache selbst; Sie können sie auch festlegen, wenn die Erkennung danebenliegt. Zwei Rezepte übersetzen Sprache aus jeder davon in einem Durchgang ins Englische, als Text oder als SRT-Untertitel.
In welchen Formaten kommt der Text?
TXT für reinen Text, SRT und VTT mit Zeitmarken für Player und Schnittprogramme, und JSON mit Anfang und Ende jedes Abschnitts für Skripte und Werkzeuge.
Brauche ich Internet?
Einmal, um im Bildschirm „Modelle“ ein Whisper-Modell zu laden — je nach Wahl 78 MB bis 1,62 GB. Danach läuft die Transkription vollständig offline.
Was, wenn die Aufnahme keine Sprache enthält?
MediaChef meldet „Keine Sprache erkannt“, statt eine leere Datei zu schreiben und die Aufgabe grün abzuhaken. Stille, Musik ohne Gesang und eine versehentlich gewählte Datei enden gleich ehrlich.
Machen Sie Text aus dieser Aufnahme
MediaChef 0.4.1 — Whisper lokal, kostenlos und quelloffen.
Kostenlos und quelloffen — Code auf GitHub ansehen Alle Dateien und Versionshinweise
MediaChef ist jung: Die Builds sind noch nicht von Apple oder Microsoft signiert, der erste Start fragt deshalb nach — in jedem Download liegt eine Anleitung als reiner Text bei.