MediaChef Audio na tekst
Transkrypcja audio na tekst — offline, na własnym komputerze
MediaChef uruchamia Whisper od OpenAI lokalnie, przez whisper.cpp. Pobierz model raz, potem upuść nagranie albo wideo i wybierz, co ma z tego wyjść: zwykły tekst, napisy SRT lub VTT z czasami, albo JSON z czasem każdego fragmentu. Dźwięk nigdy nie jest wysyłany i nie ma opłaty za minutę.
Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu
Co z tego wychodzi
TXT bez czasów, SRT i VTT z nimi, JSON z początkiem i końcem każdego fragmentu.
Jak przepisać nagranie
-
Pobierz MediaChef
Jeden plik na macOS, Windows albo Linux. whisper.cpp v1.7.6 jest już w pobraniu; osobno pobiera się tylko model.
-
Wybierz model Whisper
Otwórz Modele i pobierz jeden — small (488 MB) to zrównoważona wartość domyślna. Pobiera się raz; potem transkrypcja działa przy wyłączonej sieci.
-
Upuść nagranie albo wideo
Działa i audio, i wideo: MediaChef sam wyciąga dźwięk z filmu, więc nagranie spotkania i MP4 idą tą samą drogą.
-
Wybierz potrzebne wyjście
„Przepisz audio na tekst” dla TXT, „Przepisz audio na napisy SRT” albo „Przepisz audio na WebVTT” dla napisów z czasami, „Przepisz audio na JSON z czasami” dla narzędzi.
-
Naciśnij start i czytaj
Tekst ląduje obok pliku jako talk.transcript.txt. Kolejka pokazuje postęp; jeśli w pliku nie ma mowy, MediaChef to powie zamiast zapisać pusty.
Który model Whisper wybrać
W katalogu są cztery modele, pobierane w aplikacji. Większy oznacza lepszy tekst i dłuższe liczenie na tej samej maszynie, więc wybieraj pod zadanie, a nie raz na zawsze.
| Model | Pobranie | Kiedy wybrać |
|---|---|---|
tiny | 78 MB | Pierwsze przejście po wyraźnej mowie albo gdy trzeba tylko znaleźć, gdzie zaczyna się temat. |
base | 148 MB | Notatki dla siebie: czytelny tekst, który i tak przejrzysz i poprawisz. |
small | 488 MB | Wartość domyślna we wszystkich przepisach transkrypcji i model, przy którym większość zostaje. Wywiady, spotkania, wykłady. |
large-v3-turbo | 1,62 GB | Tekst, który pójdzie do kogoś innego: publikowane napisy, cytowane fragmenty. Zoptymalizowany pod Apple Silicon. |
Język wykrywany jest automatycznie, można go też ustawić na sztywno. Dwa dodatkowe przepisy tłumaczą dowolny język na angielski — jako tekst albo jako napisy z czasami — w tym samym przebiegu.
Dlaczego przepisywać u siebie
Poufne nagranie zostaje poufne. Wywiady, notatki terapeutyczne, rozmowy prawne, wszystko objęte poufnością: plik czyta proces na twojej własnej maszynie i nic poza tym.
Bez opłaty za minutę. Transkrypcja w chmurze liczy za minutę. Lokalnie dziesiąta godzina dźwięku kosztuje tyle co pierwsza: nic.
Bez limitu długości i rozmiaru. Czterogodzinne nagranie to jedno zadanie w kolejce, a nie płatny plan ani obejście z dzieleniem pliku.
Działa całkiem bez sieci. Gdy model leży na dysku, transkrypcja jest offline: w samolocie, w laboratorium, na maszynie odciętej od sieci.
Napisy i tekst z jednego przebiegu. SRT i VTT niosą czasy dla odtwarzacza, TXT to czysta proza, JSON ma czasy fragmentów do twoich własnych skryptów.
Częste pytania
Jak dokładna jest transkrypcja Whisper?
Dokładność zależy od modelu: tiny to szkic, small to zrównoważona wartość domyślna, large-v3-turbo przy wyraźnej mowie zbliża się do poziomu człowieka. Najlepiej wychodzi czysty dźwięk z jednym mówcą; mocne akcenty, mówienie jeden przez drugiego i muzyka pod głosem kosztują dokładność — tak jak w każdym systemie rozpoznawania mowy.
Jakie języki obsługuje?
Whisper obejmuje około stu języków i sam wykrywa język; można go też ustawić, jeśli trafi źle. Dwa przepisy tłumaczą mowę z każdego z nich na angielski w jednym przebiegu, jako tekst albo jako napisy SRT.
W jakich formatach wychodzi transkrypcja?
TXT dla zwykłego tekstu, SRT i VTT ze znacznikami czasu dla odtwarzaczy i programów montażowych oraz JSON z początkiem i końcem każdego fragmentu dla skryptów i narzędzi.
Czy potrzebuję internetu?
Raz, żeby pobrać model Whisper na ekranie Modele — od 78 MB do 1,62 GB, zależnie od wyboru. Potem transkrypcja działa całkowicie offline.
A jeśli w nagraniu nie ma mowy?
MediaChef zgłasza „Nie wykryto mowy” zamiast zapisać pusty plik i odhaczyć zadanie na zielono. Cisza, muzyka bez wokalu i omyłkowo wybrany plik kończą się tak samo uczciwie.
Zamień to nagranie w tekst
MediaChef 0.4.1 — Whisper lokalnie, za darmo i z otwartym kodem.
Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu
MediaChef jest młody: kompilacje nie są jeszcze podpisane przez Apple ani Microsoft, więc pierwsze uruchomienie prosi o potwierdzenie — w każdym pobraniu jest instrukcja w zwykłym tekście.