MediaChef

MediaChef Dyktowanie głosem

Pisanie głosem, które nie opuszcza komputera

Naciśnij prawy ⌥ gdziekolwiek na Macu, powiedz zdanie, naciśnij ponownie — a tekst wpisze się prosto w to pole, w którym stoi kursor: w terminalu, w czacie, w formularzu przeglądarki. Rozpoznaje ten sam Whisper, który MediaChef już ze sobą nosi, więc dźwięk nie opuszcza twojego dysku i nikt nie liczy minut. W naszym pomiarze pięciosekundowe zdanie wróciło w 780 milisekund.

Stan
W wydaniu od wersji 0.8.0, na razie tylko macOS
Gdzie działa
Całkowicie na twoim komputerze, bez konta i bez wysyłki
Szybkość
780 ms od klawisza do tekstu na pięciosekundowym zdaniu (pomiar)
Ile kosztuje
Nic. Ani subskrypcji, ani opłat za minutę
Platforma
Najpierw macOS; Windows i Linux potem
Jednorazowe pobranie
Model mowy, 488 MB w domyślnym

Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu

Jak działa dyktowanie

  1. Włączyć raz

    Na karcie Dyktowanie jest przełącznik i wyzwalacz do wyboru: prawy ⌥, prawy ⌘ albo jedna z dwu kombinacji. Dopóki nie włączysz, MediaChef nie rejestruje żadnego skrótu globalnego: program, który po cichu zabiera systemowe skróty, to program, który psuje inne programy.

  2. Nacisnąć skrót gdziekolwiek

    Działa, gdy MediaChef jest w tle albo jego okno jest zamknięte. Dwa sposoby: trzymać klawisz, kiedy mówisz, albo nacisnąć raz na start i drugi raz na stop — zależnie od długości myśli.

  3. Powiedzieć

    Mikrofon otwiera się tylko na czas dyktowania, więc pomarańczowa kropka na pasku menu gaśnie w chwili, gdy skończysz. Między naciśnięciami nikt nie słucha.

  4. Tekst pojawia się tam, gdzie kursor

    Wpisywany prosto w aktywne pole, bez ruszania schowka. Jeśli wolisz odwrotnie, żeby trafiał do schowka — to ustawienie obok.

MediaChef gotowy do konwersji: blat czeka na plik wideo, po prawej kolejka zadań.
Karta Dyktowanie w MediaChef: wyzwalacz, modele, język, słownik i stan uprawnienia — wszystko w jednym miejscu.

Jak szybko działa naprawdę

Pomiar od końca do końca na laptopie z M5: od puszczenia klawisza do dostarczonego tekstu. Pierwszy wiersz to prawdziwe dyktowanie z żywej sesji, pozostałe — stałe piętnastosekundowe zdanie przepuszczone przez każdy model.

Co mierzonoModelCzas
Prawdziwe pięciosekundowe zdanie, od klawisza do wpisanego tekstusmall780 ms
Zdanie na piętnaście sekundtinynie mierzone osobno
Zdanie na piętnaście sekundsmall0,66–0,75 s
Zdanie na piętnaście sekundlarge-v3-turbo1,64–1,97 s

Te liczby ukrywają dwie rzeczy i obie warto znać. Mikrofon oddaje pierwszą próbkę po 56 milisekundach, więc słowo zaczęte w tej samej chwili co naciśnięcie może zostać przycięte — w praktyce mówi się po klawiszu i nikt tego nie zauważa. A najpierwsze dyktowanie po wydaniu uprawnienia do mikrofonu przepada: system spędza wtedy około 1,8 sekundy na pokazywaniu swojego okienka. Naciśnij ponownie i działa.

Który model wziąć

Te same cztery modele, których używają przepisy transkrypcji — więc jeśli już przepisujesz pliki w MediaChefie, model leży na twoim dysku i dyktowanie nie kosztuje żadnego pobierania.

ModelPobranieCharakter
tiny78 MBNajszybszy, zgrubny — na notatkę dla siebie wystarczy
base148 MBSzybki, przyzwoity
small — domyślny488 MBRównowaga, i to, czego już używają przepisy
large-v3-turbo1,62 GBNajlepsza jakość, około dwa razy dłuższe czekanie

Zacznij od small. Jest domyślny z powodu praktycznego, a nie technicznego: to ten sam model, którego używają przepisy, więc u istniejącego użytkownika dyktowanie zadziała bez pobierania czegokolwiek. Przejdź na large-v3-turbo, jeśli twój dźwięk jest trudny — mocny akcent, hałaśliwa sala, dwa języki w jednym zdaniu — i przyjmij mniej więcej dwukrotne czekanie na zdanie.

Jak nauczyć go twoich słów

Każdy fach ma słowa, które rozpoznawanie kaleczy: nazwy produktów, żargon, nazwisko kolegi. Taką listę można oddać modelowi i przestaje zgadywać. Poniżej to samo nagranie bez słownika i ze słownikiem czterdziestu terminów.

Bez słownikaZe słownikiem
«медиашиф»MediaChef
«ходкий»хоткей
«виспер»whisper
«распознаванию»распознавание

Kosztowało 0,04 sekundy: 0,87 wobec 0,83 na tym samym fragmencie. Pułap to około 224 tokenów, czyli mniej więcej 400 znaków cyrylicy albo trzy razy tyle alfabetu łacińskiego; MediaChef liczy za ciebie i przycina, bo Whisper zbyt długą listę obcina po cichu. To właśnie tego nie umie wbudowane dyktowanie macOS: nie da się go nauczyć twojego słownictwa.

Dokąd trafia tekst

Dwie możliwości, a różnica waży więcej, niż brzmi, kiedy dyktuje się kilka razy na godzinę.

UstawienieCo się dziejeCzego wymaga
WpiszSłowa pojawiają się w aktywnym polu. Twój schowek zostaje nietkniętyUprawnienie Dostępność, raz
Do schowkaTekst zostaje skopiowany, a ty wklejasz go ⌘VNiczego poza mikrofonem

Wpisywanie zostawia schowek w spokoju i właśnie dlatego warto je wybrać: gdyby każde dyktowanie go nadpisywało, nie dałoby się trzymać tam odnośnika podczas pracy. macOS uznaje pisanie w cudzym programie za wejście syntetyczne i prosi o uprawnienie Dostępność — pierwsza próba sama otworzy właściwą sekcję Ustawień systemowych. Gdy uprawnienia brakuje, tekst i tak trafia do schowka: dyktowanie nigdy nie przepada.

Dlaczego robienie tego lokalnie to cała rzecz

Twój głos nie jest wysyłany. Dyktuje się właśnie to, czego nie wklejałoby się w formularz w przeglądarce: myśli w połowie, nazwiska klientów, zdanie, które właśnie zamierzasz wysłać. Dyktowanie w chmurze to z definicji kopia wszystkiego tego na cudzym serwerze.

Bez licznika minut. Usługi transkrypcji liczą po minutach, a to każe myśleć, zanim się powie. Tu model pobiera się raz, a setne dyktowanie w ciągu dnia kosztuje dokładnie tyle, ile pierwsze.

Działa przy wyłączonej sieci. W samolocie, na zamkniętej maszynie, w sali, gdzie wi-fi jest najmniej niezawodną obecną rzeczą. Gdy model leży na dysku, dyktowanie nie rusza internetu.

Uczy się twojego słownictwa. Słownik to prosta lista twoich słów i to jedyna rzecz, której wbudowane w macOS dyktowanie nie potrafi.

Otwarty kod, bez subskrypcji. GPL-3.0, wszystko do przeczytania na GitHubie. Płatne narzędzia w tej niszy biorą miesięcznie za to, co pod spodem jest tym samym otwartym modelem.

Kiedy nie pomoże

Mówimy wprost, bo dowiedzieć się później jest gorzej niż przeczytać teraz.

  1. Nie masz Maca.

    macOS jest pierwszy, bo tam wszystko powstało i było sprawdzane. Windows i Linux idą dalej: silnik rozpoznawania jest już wieloplatformowy, roboty na platformę wymagają skrót i samo wpisywanie tekstu.

  2. Potrzebujesz pisania na bieżąco.

    Tekst trafia do pola, gdy skończysz, a nie słowo po słowie w trakcie mówienia: tak fraza jest rozpoznawana w całości i dokładniej. Gdy mówisz, szkic rozpoznania widać w panelu pod notchem — ale wpisywany jest jeden czysty wynik, nie ciąg poprawek.

  3. Potrzebujesz rozdzielenia mówiących.

    Zapisuje, co powiedziano, a nie kto powiedział. Do wywiadu na dwa głosy potrzebne jest narzędzie transkrypcji zrobione do tego, a nie skrót dyktowania.

Pytania

Czy mój głos jest gdzieś wysyłany?

Nie. Dźwięk rozpoznaje plik modelu leżący na twoim własnym dysku i jest usuwany razem z katalogiem tymczasowym, w którym żył. Przez sieć przechodzi wyłącznie jednorazowe pobranie modelu; potem dyktowanie działa przy całkowicie wyłączonej sieci.

Jak szybko to działa?

780 milisekund od puszczenia klawisza do pojawienia się tekstu, zmierzone na prawdziwym pięciosekundowym zdaniu z modelem domyślnym na laptopie z M5. Piętnastosekundowe zdanie zajęło 0,66–0,75 sekundy. Ciężki large-v3-turbo trwa około dwa razy dłużej.

Czy działa w dowolnym programie?

Tak: skrót jest zarejestrowany dla całego systemu, więc odpala się w terminalu, w przeglądarce, w komunikatorze czy w edytorze — z MediaChefem w tle albo nawet z zamkniętym oknem.

Jakiej kombinacji używa?

Domyślnie prawy ⌥ — sam modyfikator: trzymaj i mów albo naciśnij raz, by zacząć, i jeszcze raz, by skończyć; z Shiftem tekst zostanie wysłany Enterem. Sam modyfikator nic nie wpisuje i z niczym nie koliduje. Kombinacje takie jak ⌥ Space w trybie trzymania wpisywały spację, gdy ⌥ puszczano wcześniej — dlatego zniknęły; ⌃⌥ Space i ⌃⌥ D zostają jako zapasowe.

Po co mu uprawnienie Dostępność?

Do dwóch rzeczy. Żeby słyszeć klawisz wyzwalający: samego modyfikatora nie da się zarejestrować jako zwykłego skrótu, więc MediaChef sam nasłuchuje klawiatury, a macOS pozwala na to tylko z uprawnieniem Dostępność. I żeby wpisywać tekst do okna innej aplikacji, co system traktuje jako syntetyczne wejście. Jedno uprawnienie obejmuje oba, nadaje się raz; potem uruchom aplikację ponownie.

A jeśli nie dam?

Tekst pójdzie do schowka, a powiadomienie powie dlaczego, z otwartą już właściwą sekcją Ustawień systemowych. Nic z podyktowanego nigdy nie ginie z powodu brakującego uprawnienia.

Ile miejsca na dysku potrzebuje?

Program plus jeden model mowy: 488 MB w domyślnym, 78 MB jeśli wybierzesz najmniejszy, 1,62 GB w największym. Jeśli już używasz MediaChefa do przepisywania plików, model masz na dysku i dyktowanie nie dodaje nic.

Rozumie polski, albo dwa języki naraz?

Whisper obsługuje 99 języków, a ty możesz albo wskazać swój, albo pozwolić mu go rozpoznać. Mieszanie języków w jednym zdaniu to właśnie ten przypadek, w którym ciężki model odpracowuje swój rozmiar i w którym słownik pomaga najbardziej.

Jak długie może być jedno dyktowanie?

Pięć minut, potem zatrzymuje się samo i przepisuje to, co usłyszało, zamiast wyrzucać. W praktyce dyktuje się zdaniami, nie monologami.

Da się przerwać w połowie zdania?

Escape podczas nagrywania wyrzuca ujęcie i nie dostarcza nic. Jest rejestrowany tylko na czas dyktowania, więc nie przeszkadza Escape'owi w żadnym innym miejscu.

Czy zastępuje wbudowane dyktowanie macOS?

Robi tę samą pracę z dwiema różnicami, które mają znaczenie: temu można wyłożyć twoje słownictwo, a dźwięk zostaje na twojej maszynie. Jeśli żadna z nich cię nie dotyczy, wbudowane już tam jest i też jest darmowe.

Naprawdę darmowe?

Tak. MediaChef jest otwartoźródłowy na licencji GPL-3.0, bez wersji płatnej i bez subskrypcji — dyktowanie także. Wydana wersja to 0.8.5, dyktowanie w niej jest.

Dlaczego panel pokazuje inny tekst niż ten, który zostaje wpisany?

To dwa osobne przebiegi. Gdy mówisz, panel pokazuje szkic tworzony przez lekki model co półtorej sekundy, żeby nadążyć za mową. Wpisywany jest wynik końcowy modelu głównego z całego nagrania, z twoim słownikiem terminów. Oba modele wybiera się na karcie Dyktowanie: ustaw w podglądzie ten sam model co główny i różnica zniknie — kosztem opóźnienia panelu.

Dlaczego po aktualizacji znów prosi o uprawnienia?

macOS wiąże uprawnienie z podpisem aplikacji, nie z jej nazwą. MediaChef nie ma certyfikatu Apple — nie będziemy za niego płacić — więc każda wersja jest podpisana inaczej i system traktuje zaktualizowaną aplikację jak nową. Aplikacja sama usuwa nieaktualny wpis i prosi o uprawnienie ponownie: jeden przełącznik i jedno „Zezwól” na aktualizację.

Przełącznik w Ustawieniach systemowych jest włączony, a dyktowanie nie działa.

To znaczy, że ten wpis należy do poprzedniej kopii aplikacji — tak właśnie bywa po aktualizacji. Wyłączenie i włączenie go z powrotem nic nie zmienia, sprawdziliśmy. MediaChef sam czyści ten wpis i wywołuje pytanie systemu: włącz go na liście i uruchom aplikację ponownie.

Nagranie wyszło puste, choć mikrofon działa.

Najczęściej winny jest zestaw słuchawkowy: AirPodsy w etui pozostają połączone i pozostają wejściem domyślnym, a macOS oddaje z nich równe zera — każdej aplikacji, nie tylko naszej. Powiadomienie podaje urządzenie, z którego przyszła cisza. Założ słuchawki albo wybierz mikrofon wprost na karcie Dyktowanie.

Czy mogę wybrać konkretny mikrofon?

Tak: karta Dyktowanie wypisuje urządzenia wejściowe. „Jak system” to ostatnio podłączony zestaw słuchawkowy, a nie mikrofon laptopa — i właśnie dlatego jawny wybór jest pewniejszy.

Co się stanie, jeśli nacisnę wyzwalacz i nic nie powiem?

Nic nie zostanie wpisane. Puste nagranie nawet nie dociera do rozpoznawania: Whisper nie milczy wobec ciszy, tylko wymyśla — model rosyjski wpisywał napisy końcowe. Takie podpisy autorów napisów są rozpoznawane i traktowane jak cisza, a ty dostajesz „nie słychać mowy”.

Dlaczego pierwsze naciśnięcie po uruchomieniu jest wolniejsze?

Budzi się podsystem audio macOS: do dwóch sekund przy pierwszym otwarciu mikrofonu w danym uruchomieniu. Panel pojawia się od razu, jeszcze przed startem nagrywania, więc trzymaj klawisz, aż napisze, że słucha. Potem otwarcie zajmuje dziesiątki milisekund.

Jak wysłać wiadomość głosem bez naciskania Enter?

Naciśnij wyzwalacz razem z Shiftem: tekst zostanie wpisany, a Enter naciśnie się sam. Puste dyktowanie nigdy nie naciska Entera — inaczej milczenie wysłałoby pustą wiadomość albo wykonało poprzednie polecenie w terminalu.

Co się stanie, jeśli nacisnę inny klawisz, trzymając wyzwalacz?

Nagranie zostanie anulowane i nic nie zostanie wpisane. Prawy ⌥ z literą to czyjś skrót klawiaturowy, a nie dyktowanie, i program tak to rozumie.

Czy to, co dyktuję, zapisuje się na dysku?

Nie. Nagranie żyje w folderze tymczasowym i znika razem z nim, a przechowywanie historii transkrypcji jest domyślnie wyłączone. Aplikacja obiecuje, że twoje treści nie opuszczają komputera; zapisywanie na nim wszystkiego, co dyktujesz, otwartym tekstem źle by z tym współgrało — ludzie dyktują hasła i fragmenty prywatnych rozmów.

Czy działa nad aplikacjami na pełnym ekranie?

Tak. Panel rysuje się nad okrami na pełnym ekranie i na wszystkich pulpitach — edytory i terminale na pełnym ekranie to dokładnie te miejsca, gdzie się dyktuje.

Inna aplikacja już zajmuje wyzwalacz. Co teraz?

Karta Dyktowanie oferuje też prawy ⌘ — drugi samotny modyfikator, któremu macOS nie przypisuje własnego działania — oraz dwie zwykłe kombinacje, ⌃⌥ Spacja i ⌃⌥ D, gdyby oba modyfikatory były już zajęte.

MediaChef dzisiaj

Wersja 0.8.5 — za darmo, otwarty kod, macOS · Windows · Linux. Dyktowanie już w środku.

Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu

MediaChef jest młody: kompilacje nie są jeszcze podpisane przez Apple ani Microsoft, więc pierwsze uruchomienie prosi o potwierdzenie — w każdym pobraniu jest instrukcja w zwykłym tekście.

Coś nie działa albo czegoś brakuje? Napisz do nas: hello@mediachef.app