MediaChef

MediaChef Wideo na SRT

Zrobić napisy SRT z wideo

Przeciągnij film do MediaChef, wybierz „Zrób napisy SRT do wideo”, zostaw model na small i język na automatycznym, i uruchom. Obok filmu pojawi się plik .srt, już z czasami. Wszystko liczy się na twoim komputerze: mowa nie opuszcza dysku, a gdy model jest już pobrany, przepis działa przy wyłączonej sieci. Na laptopie z M5 2 minuty 43 sekundy mowy zajęły 6,2 sekundy na modelu domyślnym — jakieś 26 razy szybciej niż w czasie rzeczywistym — i dały 73 linijki po średnio 39 znaków, czyli na tyle krótkie, że da się je spokojnie przeczytać.

Czego potrzebujesz
MediaChef 0.8.5 plus jednorazowe pobranie modelu
Model domyślny
small — 488 MB, pobierany raz i zostaje
Szybkość
≈26× czasu rzeczywistego na modelu domyślnym (pomiar, M5)
Działa offline
Tak, gdy model leży już na dysku
Formaty
SRT, VTT, zwykły TXT i JSON — do każdego osobny przepis
Co dostajesz
clip.subs.srt obok filmu, sam film nietknięty

Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu

Jak zrobić napisy do filmu

  1. Pobierz MediaChef

    Jeden plik dla macOS, Windowsa albo Linuksa. I FFmpeg, i silnik Whispera jadą razem z pobraniem: nic nie trzeba instalować osobno ani dopisywać do PATH.

  2. Raz pobierz model

    Pierwsza transkrypcja poprosi o model mowy. Domyślny to small, 488 MB, i to na nim zrobione są wszystkie pomiary poniżej; tiny waży 78 MB, base 148 MB, a large-v3-turbo 1,62 GB. Pobiera się raz, zostaje na dysku i od tej pory przepis już nie rusza sieci.

  3. Wrzuć film i wybierz przepis

    „Zrób napisy SRT do wideo” bierze film wprost — nie trzeba wcześniej wyciągać dźwięku. MediaChef sam dekoduje ścieżkę do mono 16 kHz, którego wymaga Whisper, w katalogu tymczasowym, którego nigdy nie zobaczysz.

  4. Uruchom i otwórz .srt

    Plik ląduje obok filmu jako clip.subs.srt, z ponumerowanymi linijkami i czasami. Odtwarzacze, montażówki i platformy czytają go wprost, a że to zwykły tekst, nazwisko albo termin poprawisz w dowolnym edytorze.

MediaChef gotowy do konwersji: blat czeka na plik wideo, po prawej kolejka zadań.
Blat, na który trafia film. Przepisy pojawiają się, gdy MediaChef przeczyta plik.

Który model wybrać

Cztery modele, te same 2 minuty 43 sekundy mowy, ta sama maszyna: laptop z M5 i 16 GB, każdy model najpierw rozgrzany, liczy się lepszy z dwóch przebiegów.

ModelPobranieCzasWobec czasu rzeczywistegoSłów nietrafionych
tiny78 MB2,1 s×785 z 540
base148 MB2,6 s×633 z 540
small — domyślny488 MB6,2 s×260 z 540
large-v3-turbo1,62 GB11,5 s×141 z 540

Ostatnią kolumnę czytaj z poprawką, bo testowe nagranie to głos syntetyczny czytający przygotowany tekst: bez akcentu, bez szumu w tle, bez wchodzenia sobie w słowo. Dlatego nawet najmniejszy model jest tu prawie bezbłędny, a tak nie brzmi nagranie prawdziwej narady — przy trudnym dźwięku różnica między tymi modelami mocno się otwiera. Za to kolumna z czasem przekłada się na twój przypadek wprost. I jeszcze jedno, co gołe porównanie ukrywa: prawie wszystkie rozbieżności to liczby zapisane cyframi zamiast słowami — large-v3-turbo pisał „70”, „10”, „50”, „30” tam, gdzie w tekście były rozpisane. To formatowanie, a nie przesłyszenie.

Jak długie wychodzą linijki napisów

Technicznie poprawny napis i tak jest bezużyteczny, jeśli wyrzuca na ekran dwadzieścia słów naraz. Modele tną tę samą wypowiedź bardzo różnie — pomiar z tego samego przebiegu.

ModelNapisówŚredni czasZnaków średnioNajdłuższy
tiny354,7 s8397 znaków
base354,7 s83100 znaków
small — domyślny732,2 s3958 znaków
large-v3-turbo305,4 s97112 znaków

Przyjęta norma telewizyjna to około 42 znaki w wierszu na dwa wiersze, czyli mniej więcej 84 znaki naraz na ekranie. Według tej miary z czwórki mieści się spokojnie tylko small: 39 znaków średnio i 58 w najdłuższym napisie, podczas gdy large-v3-turbo wychodzi poza limit już przy zwykłym. Model domyślny jest więc nie tylko wyważonym wyborem pod względem trafności — tnie też mowę na najczytelniejsze kawałki.

SRT, VTT, zwykły tekst czy JSON

Ta sama transkrypcja zapisana na cztery sposoby. Rozmiary pochodzą z tych samych 2 minut 43 sekund mowy, więc porównują się wprost.

FormatRozmiarCo jest w środkuKiedy brać
SRT5,5 KBPonumerowane napisy, czasy z przecinkiem: 00:00:00,000Prawie zawsze. Biorą go odtwarzacze, montażówki i platformy
VTT5,3 KBNagłówek WEBVTT, czasy z kropką: 00:00:00.000Napisy do odtwarzacza webowego, ścieżka w przeglądarce
TXT3,0 KBTekst ciągiem, bez żadnych czasówChcesz słowa, a nie napisy
JSON15,2 KBKażdy napis plus model i użyte parametryCzytać to będzie program, a nie człowiek

SRT i VTT różnią się głównie znakiem między sekundami a milisekundami, więc jeśli odtwarzacz odmówił jednego, drugi to zmiana przepisu, a nie ponowna transkrypcja. JSON waży jakieś trzy razy tyle co SRT, bo obok tekstu niesie dane samego przebiegu.

Który przepis do czego

Napisy to nie jeden przepis, tylko kilka, a wybranie właściwego oszczędza krok. Wszystkie leżą w katalogu 17 przepisów.

Co maszCzego chceszPrzepis
FilmNapisy obok niegoZrób napisy SRT do wideo
Plik dźwiękowyNapisyPrzepisz audio na napisy SRT
Mowa w obcym językuAngielskie napisy w jednym przebieguPrzetłumacz mowę na angielskie napisy
Cokolwiek z mowąSam tekstPrzepisz audio na tekst
Cokolwiek z mowąŚcieżka do odtwarzacza webowegoPrzepisz audio na WebVTT

Przepis tłumaczący idzie od obcej mowy prosto do angielskich napisów z czasami, w jednym przebiegu — nie trzeba najpierw przepisywać, a potem tłumaczyć. Ale idzie wyłącznie na angielski: to ograniczenie modelu, nie aplikacji.

Dlaczego robić napisy na własnym komputerze

Mowa nie opuszcza twojego dysku. Nagrania narad, wywiadów i rozmów to najbardziej wrażliwy rodzaj plików, z jakim większość ludzi w ogóle ma do czynienia, a transkrypcja online to z definicji kopia tej rozmowy na cudzym serwerze. Tutaj nie ma wysyłki, nad którą trzeba by się zastanawiać.

Zero opłat za minutę. Usługi transkrypcji liczą po minutach dźwięku, przez co długie archiwum zamienia się w prawdziwy rachunek. Model pobierasz raz, a potem dwugodzinne nagranie kosztuje tyle samo co dwuminutowe: nic.

Działa przy wyłączonej sieci. Gdy plik modelu leży już na dysku, ten przepis nie rusza internetu w ogóle. Działa w samolocie, na zamkniętej maszynie i w sali, w której wi-fi jest najmniej niezawodną obecną rzeczą.

Bez limitu długości. Darmowe transkrybatory w przeglądarce zwykle tną po kilku minutach na plik — dokładnie wtedy, gdy nagranie warto przepisać właśnie dlatego, że jest długie. Tutaj sufitu nie ma.

Cały folder naraz. Wrzuć katalog nagrań, a kolejka przejdzie po nich po kolei i powie, gdzie zapisał się każdy plik napisów.

Kiedy to nie jest właściwe narzędzie

Przepis zapisuje plik napisów. To węższa robota niż „wgranie napisów w film”, i ta różnica ma znaczenie w takich sytuacjach.

  1. Chcesz napisy wypalone w obrazie.

    Tutaj powstaje osobny .srt, który odtwarzacz wczytuje obok filmu. Wpalenie tekstu na stałe w klatki to inna operacja: przekodowuje film, a potem tych słów już się nie wyłączy ani nie poprawi.

  2. Potrzebujesz dokładności emisyjnej.

    Nawet na czystym dźwięku z pomiarów wyżej modele potykały się na kilku słowach, a prawdziwe nagrania są trudniejsze. Wszystko, co publikuje się pod wymogiem dostępności, przed emisją czyta człowiek — niezależnie od tego, co zrobiło brudnopis.

  3. Dźwięk jest naprawdę kiepski.

    Gęste wchodzenie sobie w słowo, sala nagrana telefonem albo muzyka głośniejsza od głosu położą wszystkie cztery modele. Naprawienie najpierw dźwięku — choćby przez wyciągnięcie czystszej ścieżki — daje więcej niż przejście na większy model.

  4. Potrzebujesz tłumaczenia na coś innego niż angielski.

    Whisper tłumaczy na angielski i tylko na niego. Do dowolnego innego języka docelowego najpierw przepisz w oryginale, a powstały tekst przetłumacz narzędziem zrobionym do tego.

Pytania

Czy to jest za darmo?

Tak, w całości. MediaChef jest otwartoźródłowy na licencji GPL-3.0: nie ma wersji płatnej, opłat za minutę ani limitu długości pliku. Modele też pobiera się za darmo. Aktualna wersja to 0.8.5.

Czy mój film gdzieś się wysyła?

Nie. Mowę przetwarza plik modelu leżący na twoim własnym dysku. Przez sieć przechodzi wyłącznie jednorazowe pobranie modelu, a potem przepis działa przy wyłączonym internecie.

Ile to trwa?

Jakieś 26 razy szybciej niż w czasie rzeczywistym na modelu domyślnym: zmierzyliśmy 6,2 sekundy na 2 minuty 43 sekundy mowy, laptop z M5. W tej proporcji godzinne nagranie schodzi w kilka minut. Na tym samym dźwięku tiny dał ×78, a large-v3-turbo ×14.

Który model wybrać?

Zacznij od small, który stoi domyślnie. W naszych pomiarach nie pomylił w testowym dźwięku ani jednego słowa i dał najczytelniejsze linijki — 39 znaków średnio wobec 97 u large-v3-turbo. Wyżej wchodź tylko wtedy, gdy dźwięk jest trudny; schodź do tiny albo base, jeśli chcesz brudnopis w kilka sekund.

Ile waży model?

78 MB tiny, 148 MB base, 488 MB small i 1,62 GB large-v3-turbo. Pobranie jest jednorazowe. Potem plik leży na dysku i każdy kolejny przebieg bierze go bez pytania.

Czy muszę podawać język mowy?

Nie. Język stoi na automatycznym i model sam go rozpoznaje po dźwięku. Można go jednak wskazać wprost i warto to zrobić, gdy nagranie otwiera się kilkoma zdaniami w innym języku.

Czy potrafi przetłumaczyć napisy na angielski?

Tak, przepisem „Przetłumacz mowę na angielskie napisy”: na wejściu obca mowa, na wyjściu angielski SRT z czasami, w jednym przebiegu zamiast „najpierw przepisz, potem przetłumacz”. Angielski to jedyny język docelowy, jaki obsługuje model.

Czym różni się SRT od VTT?

Głównie interpunkcją w czasach: SRT pisze 00:00:00,000 z przecinkiem i numeruje napisy, VTT pisze 00:00:00.000 z kropką i zaczyna się wierszem WEBVTT. SRT to czego oczekują odtwarzacze i montażówki; VTT to czego chce odtwarzacz webowy dla własnej ścieżki napisów. To osobne przepisy, więc zmiana formatu to ponowny przebieg, a nie przepisywanie pliku.

Czy napisy da się potem poprawić?

Da się — .srt to zwykły tekst. Otwórz w dowolnym edytorze i popraw nazwisko, żargon albo czas. Tak się właśnie normalnie pracuje: model robi dziewięćdziesiąt kilka procent, resztę dociągasz ręcznie.

Dlaczego moje linijki są za długie?

Bo to model decyduje, gdzie ciąć, a większe modele tną rzadziej. Zmierzyliśmy 39 znaków na napis przy small wobec 97 przy large-v3-turbo, na tym samym dźwięku. Jeśli linijki ci się rozłażą, powrót na small zwykle to naprawia — a przy czystej mowie nic nie kosztuje w trafności.

Czy rozróżnia mówiących?

Nie. Whisper zapisuje, co zostało powiedziane, a nie kto to powiedział. Jeśli potrzebujesz oznaczeń „Mówca 1 / Mówca 2”, wstawisz je ręcznie albo weźmiesz narzędzie zrobione właśnie do tego.

Co się stanie, jeśli w pliku nie ma mowy?

Przebieg zatrzyma się i powie, że nie usłyszał nic zrozumiałego, zamiast po cichu zapisać pusty plik. Cisza nie daje napisów — i tak ma być.

Czy działa na Windowsie i Linuksie?

Na wszystkich trzech systemach. Mowa liczy się wszędzie na procesorze, a na Apple Silicon dodatkowo na układzie graficznym — stąd te szybkie liczby wyżej. Ten sam przepis na skromnym laptopie z Windowsem będzie wolniejszy, ale wciąż szybszy niż odsłuchanie całego nagrania.

Czy mogę zrobić napisy do kilku plików naraz?

Tak. Wrzuć cały folder, dodaj przepis, a kolejka przejdzie po nich jeden po drugim. Każdy plik napisów zapisuje się obok własnego źródła.

Czy plik wideo się zmienia?

Nie. Obok zapisuje się osobny .srt — clip.subs.srt — a film nie jest zmieniany, przemianowywany ani przekodowywany. Ten przepis w ogóle nie rusza obrazu.

Zrób napisy do tego filmu

MediaChef 0.8.5 — za darmo, otwarty kod, macOS · Windows · Linux.

Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu

MediaChef jest młody: kompilacje nie są jeszcze podpisane przez Apple ani Microsoft, więc pierwsze uruchomienie prosi o potwierdzenie — w każdym pobraniu jest instrukcja w zwykłym tekście.

Coś nie działa albo czegoś brakuje? Napisz do nas: hello@mediachef.app