MediaChef

MediaChef Audio na tekst

Transkrypcja audio na tekst — offline, na własnym komputerze

MediaChef uruchamia Whisper od OpenAI lokalnie, przez whisper.cpp. Pobierz model raz, potem upuść nagranie albo wideo i wybierz, co ma z tego wyjść: zwykły tekst, napisy SRT lub VTT z czasami, albo JSON z czasem każdego fragmentu. Dźwięk nigdy nie jest wysyłany i nie ma opłaty za minutę.

Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu

Co z tego wychodzi

00:00:04 Cześć wszystkim, zaczynamy… 00:00:11 Pierwszy punkt: plany na kwartał. 00:00:19 Są trzy scenariusze, pokażę tabelę.

TXT bez czasów, SRT i VTT z nimi, JSON z początkiem i końcem każdego fragmentu.

Jak przepisać nagranie

  1. Pobierz MediaChef

    Jeden plik na macOS, Windows albo Linux. whisper.cpp v1.7.6 jest już w pobraniu; osobno pobiera się tylko model.

  2. Wybierz model Whisper

    Otwórz Modele i pobierz jeden — small (488 MB) to zrównoważona wartość domyślna. Pobiera się raz; potem transkrypcja działa przy wyłączonej sieci.

  3. Upuść nagranie albo wideo

    Działa i audio, i wideo: MediaChef sam wyciąga dźwięk z filmu, więc nagranie spotkania i MP4 idą tą samą drogą.

  4. Wybierz potrzebne wyjście

    „Przepisz audio na tekst” dla TXT, „Przepisz audio na napisy SRT” albo „Przepisz audio na WebVTT” dla napisów z czasami, „Przepisz audio na JSON z czasami” dla narzędzi.

  5. Naciśnij start i czytaj

    Tekst ląduje obok pliku jako talk.transcript.txt. Kolejka pokazuje postęp; jeśli w pliku nie ma mowy, MediaChef to powie zamiast zapisać pusty.

MediaChef przed transkrypcją: pole na nagranie, w menu bocznym Modele, skąd pobiera się modele Whisper.
Modele mieszkają w menu bocznym — pobierz raz i przepisuj offline.

Który model Whisper wybrać

W katalogu są cztery modele, pobierane w aplikacji. Większy oznacza lepszy tekst i dłuższe liczenie na tej samej maszynie, więc wybieraj pod zadanie, a nie raz na zawsze.

ModelPobranieKiedy wybrać
tiny 78 MB Pierwsze przejście po wyraźnej mowie albo gdy trzeba tylko znaleźć, gdzie zaczyna się temat.
base 148 MB Notatki dla siebie: czytelny tekst, który i tak przejrzysz i poprawisz.
small 488 MB Wartość domyślna we wszystkich przepisach transkrypcji i model, przy którym większość zostaje. Wywiady, spotkania, wykłady.
large-v3-turbo 1,62 GB Tekst, który pójdzie do kogoś innego: publikowane napisy, cytowane fragmenty. Zoptymalizowany pod Apple Silicon.

Język wykrywany jest automatycznie, można go też ustawić na sztywno. Dwa dodatkowe przepisy tłumaczą dowolny język na angielski — jako tekst albo jako napisy z czasami — w tym samym przebiegu.

Dlaczego przepisywać u siebie

Poufne nagranie zostaje poufne. Wywiady, notatki terapeutyczne, rozmowy prawne, wszystko objęte poufnością: plik czyta proces na twojej własnej maszynie i nic poza tym.

Bez opłaty za minutę. Transkrypcja w chmurze liczy za minutę. Lokalnie dziesiąta godzina dźwięku kosztuje tyle co pierwsza: nic.

Bez limitu długości i rozmiaru. Czterogodzinne nagranie to jedno zadanie w kolejce, a nie płatny plan ani obejście z dzieleniem pliku.

Działa całkiem bez sieci. Gdy model leży na dysku, transkrypcja jest offline: w samolocie, w laboratorium, na maszynie odciętej od sieci.

Napisy i tekst z jednego przebiegu. SRT i VTT niosą czasy dla odtwarzacza, TXT to czysta proza, JSON ma czasy fragmentów do twoich własnych skryptów.

Częste pytania

Jak dokładna jest transkrypcja Whisper?

Dokładność zależy od modelu: tiny to szkic, small to zrównoważona wartość domyślna, large-v3-turbo przy wyraźnej mowie zbliża się do poziomu człowieka. Najlepiej wychodzi czysty dźwięk z jednym mówcą; mocne akcenty, mówienie jeden przez drugiego i muzyka pod głosem kosztują dokładność — tak jak w każdym systemie rozpoznawania mowy.

Jakie języki obsługuje?

Whisper obejmuje około stu języków i sam wykrywa język; można go też ustawić, jeśli trafi źle. Dwa przepisy tłumaczą mowę z każdego z nich na angielski w jednym przebiegu, jako tekst albo jako napisy SRT.

W jakich formatach wychodzi transkrypcja?

TXT dla zwykłego tekstu, SRT i VTT ze znacznikami czasu dla odtwarzaczy i programów montażowych oraz JSON z początkiem i końcem każdego fragmentu dla skryptów i narzędzi.

Czy potrzebuję internetu?

Raz, żeby pobrać model Whisper na ekranie Modele — od 78 MB do 1,62 GB, zależnie od wyboru. Potem transkrypcja działa całkowicie offline.

A jeśli w nagraniu nie ma mowy?

MediaChef zgłasza „Nie wykryto mowy” zamiast zapisać pusty plik i odhaczyć zadanie na zielono. Cisza, muzyka bez wokalu i omyłkowo wybrany plik kończą się tak samo uczciwie.

Zamień to nagranie w tekst

MediaChef 0.4.1 — Whisper lokalnie, za darmo i z otwartym kodem.

Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu

MediaChef jest młody: kompilacje nie są jeszcze podpisane przez Apple ani Microsoft, więc pierwsze uruchomienie prosi o potwierdzenie — w każdym pobraniu jest instrukcja w zwykłym tekście.