MediaChef Wideo na SRT
Zrobić napisy SRT z wideo
Przeciągnij film do MediaChef, wybierz „Zrób napisy SRT do wideo”, zostaw model na small i język na automatycznym, i uruchom. Obok filmu pojawi się plik .srt, już z czasami. Wszystko liczy się na twoim komputerze: mowa nie opuszcza dysku, a gdy model jest już pobrany, przepis działa przy wyłączonej sieci. Na laptopie z M5 2 minuty 43 sekundy mowy zajęły 6,2 sekundy na modelu domyślnym — jakieś 26 razy szybciej niż w czasie rzeczywistym — i dały 73 linijki po średnio 39 znaków, czyli na tyle krótkie, że da się je spokojnie przeczytać.
- Czego potrzebujesz
- MediaChef 0.8.5 plus jednorazowe pobranie modelu
- Model domyślny
- small — 488 MB, pobierany raz i zostaje
- Szybkość
- ≈26× czasu rzeczywistego na modelu domyślnym (pomiar, M5)
- Działa offline
- Tak, gdy model leży już na dysku
- Formaty
- SRT, VTT, zwykły TXT i JSON — do każdego osobny przepis
- Co dostajesz
- clip.subs.srt obok filmu, sam film nietknięty
Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu
Jak zrobić napisy do filmu
-
Pobierz MediaChef
Jeden plik dla macOS, Windowsa albo Linuksa. I FFmpeg, i silnik Whispera jadą razem z pobraniem: nic nie trzeba instalować osobno ani dopisywać do PATH.
-
Raz pobierz model
Pierwsza transkrypcja poprosi o model mowy. Domyślny to small, 488 MB, i to na nim zrobione są wszystkie pomiary poniżej; tiny waży 78 MB, base 148 MB, a large-v3-turbo 1,62 GB. Pobiera się raz, zostaje na dysku i od tej pory przepis już nie rusza sieci.
-
Wrzuć film i wybierz przepis
„Zrób napisy SRT do wideo” bierze film wprost — nie trzeba wcześniej wyciągać dźwięku. MediaChef sam dekoduje ścieżkę do mono 16 kHz, którego wymaga Whisper, w katalogu tymczasowym, którego nigdy nie zobaczysz.
-
Uruchom i otwórz .srt
Plik ląduje obok filmu jako clip.subs.srt, z ponumerowanymi linijkami i czasami. Odtwarzacze, montażówki i platformy czytają go wprost, a że to zwykły tekst, nazwisko albo termin poprawisz w dowolnym edytorze.
Który model wybrać
Cztery modele, te same 2 minuty 43 sekundy mowy, ta sama maszyna: laptop z M5 i 16 GB, każdy model najpierw rozgrzany, liczy się lepszy z dwóch przebiegów.
| Model | Pobranie | Czas | Wobec czasu rzeczywistego | Słów nietrafionych |
|---|---|---|---|---|
| tiny | 78 MB | 2,1 s | ×78 | 5 z 540 |
| base | 148 MB | 2,6 s | ×63 | 3 z 540 |
| small — domyślny | 488 MB | 6,2 s | ×26 | 0 z 540 |
| large-v3-turbo | 1,62 GB | 11,5 s | ×14 | 1 z 540 |
Ostatnią kolumnę czytaj z poprawką, bo testowe nagranie to głos syntetyczny czytający przygotowany tekst: bez akcentu, bez szumu w tle, bez wchodzenia sobie w słowo. Dlatego nawet najmniejszy model jest tu prawie bezbłędny, a tak nie brzmi nagranie prawdziwej narady — przy trudnym dźwięku różnica między tymi modelami mocno się otwiera. Za to kolumna z czasem przekłada się na twój przypadek wprost. I jeszcze jedno, co gołe porównanie ukrywa: prawie wszystkie rozbieżności to liczby zapisane cyframi zamiast słowami — large-v3-turbo pisał „70”, „10”, „50”, „30” tam, gdzie w tekście były rozpisane. To formatowanie, a nie przesłyszenie.
Jak długie wychodzą linijki napisów
Technicznie poprawny napis i tak jest bezużyteczny, jeśli wyrzuca na ekran dwadzieścia słów naraz. Modele tną tę samą wypowiedź bardzo różnie — pomiar z tego samego przebiegu.
| Model | Napisów | Średni czas | Znaków średnio | Najdłuższy |
|---|---|---|---|---|
| tiny | 35 | 4,7 s | 83 | 97 znaków |
| base | 35 | 4,7 s | 83 | 100 znaków |
| small — domyślny | 73 | 2,2 s | 39 | 58 znaków |
| large-v3-turbo | 30 | 5,4 s | 97 | 112 znaków |
Przyjęta norma telewizyjna to około 42 znaki w wierszu na dwa wiersze, czyli mniej więcej 84 znaki naraz na ekranie. Według tej miary z czwórki mieści się spokojnie tylko small: 39 znaków średnio i 58 w najdłuższym napisie, podczas gdy large-v3-turbo wychodzi poza limit już przy zwykłym. Model domyślny jest więc nie tylko wyważonym wyborem pod względem trafności — tnie też mowę na najczytelniejsze kawałki.
SRT, VTT, zwykły tekst czy JSON
Ta sama transkrypcja zapisana na cztery sposoby. Rozmiary pochodzą z tych samych 2 minut 43 sekund mowy, więc porównują się wprost.
| Format | Rozmiar | Co jest w środku | Kiedy brać |
|---|---|---|---|
| SRT | 5,5 KB | Ponumerowane napisy, czasy z przecinkiem: 00:00:00,000 | Prawie zawsze. Biorą go odtwarzacze, montażówki i platformy |
| VTT | 5,3 KB | Nagłówek WEBVTT, czasy z kropką: 00:00:00.000 | Napisy do odtwarzacza webowego, ścieżka w przeglądarce |
| TXT | 3,0 KB | Tekst ciągiem, bez żadnych czasów | Chcesz słowa, a nie napisy |
| JSON | 15,2 KB | Każdy napis plus model i użyte parametry | Czytać to będzie program, a nie człowiek |
SRT i VTT różnią się głównie znakiem między sekundami a milisekundami, więc jeśli odtwarzacz odmówił jednego, drugi to zmiana przepisu, a nie ponowna transkrypcja. JSON waży jakieś trzy razy tyle co SRT, bo obok tekstu niesie dane samego przebiegu.
Który przepis do czego
Napisy to nie jeden przepis, tylko kilka, a wybranie właściwego oszczędza krok. Wszystkie leżą w katalogu 17 przepisów.
| Co masz | Czego chcesz | Przepis |
|---|---|---|
| Film | Napisy obok niego | Zrób napisy SRT do wideo |
| Plik dźwiękowy | Napisy | Przepisz audio na napisy SRT |
| Mowa w obcym języku | Angielskie napisy w jednym przebiegu | Przetłumacz mowę na angielskie napisy |
| Cokolwiek z mową | Sam tekst | Przepisz audio na tekst |
| Cokolwiek z mową | Ścieżka do odtwarzacza webowego | Przepisz audio na WebVTT |
Przepis tłumaczący idzie od obcej mowy prosto do angielskich napisów z czasami, w jednym przebiegu — nie trzeba najpierw przepisywać, a potem tłumaczyć. Ale idzie wyłącznie na angielski: to ograniczenie modelu, nie aplikacji.
Dlaczego robić napisy na własnym komputerze
Mowa nie opuszcza twojego dysku. Nagrania narad, wywiadów i rozmów to najbardziej wrażliwy rodzaj plików, z jakim większość ludzi w ogóle ma do czynienia, a transkrypcja online to z definicji kopia tej rozmowy na cudzym serwerze. Tutaj nie ma wysyłki, nad którą trzeba by się zastanawiać.
Zero opłat za minutę. Usługi transkrypcji liczą po minutach dźwięku, przez co długie archiwum zamienia się w prawdziwy rachunek. Model pobierasz raz, a potem dwugodzinne nagranie kosztuje tyle samo co dwuminutowe: nic.
Działa przy wyłączonej sieci. Gdy plik modelu leży już na dysku, ten przepis nie rusza internetu w ogóle. Działa w samolocie, na zamkniętej maszynie i w sali, w której wi-fi jest najmniej niezawodną obecną rzeczą.
Bez limitu długości. Darmowe transkrybatory w przeglądarce zwykle tną po kilku minutach na plik — dokładnie wtedy, gdy nagranie warto przepisać właśnie dlatego, że jest długie. Tutaj sufitu nie ma.
Cały folder naraz. Wrzuć katalog nagrań, a kolejka przejdzie po nich po kolei i powie, gdzie zapisał się każdy plik napisów.
Kiedy to nie jest właściwe narzędzie
Przepis zapisuje plik napisów. To węższa robota niż „wgranie napisów w film”, i ta różnica ma znaczenie w takich sytuacjach.
-
Chcesz napisy wypalone w obrazie.
Tutaj powstaje osobny .srt, który odtwarzacz wczytuje obok filmu. Wpalenie tekstu na stałe w klatki to inna operacja: przekodowuje film, a potem tych słów już się nie wyłączy ani nie poprawi.
-
Potrzebujesz dokładności emisyjnej.
Nawet na czystym dźwięku z pomiarów wyżej modele potykały się na kilku słowach, a prawdziwe nagrania są trudniejsze. Wszystko, co publikuje się pod wymogiem dostępności, przed emisją czyta człowiek — niezależnie od tego, co zrobiło brudnopis.
-
Dźwięk jest naprawdę kiepski.
Gęste wchodzenie sobie w słowo, sala nagrana telefonem albo muzyka głośniejsza od głosu położą wszystkie cztery modele. Naprawienie najpierw dźwięku — choćby przez wyciągnięcie czystszej ścieżki — daje więcej niż przejście na większy model.
-
Potrzebujesz tłumaczenia na coś innego niż angielski.
Whisper tłumaczy na angielski i tylko na niego. Do dowolnego innego języka docelowego najpierw przepisz w oryginale, a powstały tekst przetłumacz narzędziem zrobionym do tego.
Pytania
Czy to jest za darmo?
Tak, w całości. MediaChef jest otwartoźródłowy na licencji GPL-3.0: nie ma wersji płatnej, opłat za minutę ani limitu długości pliku. Modele też pobiera się za darmo. Aktualna wersja to 0.8.5.
Czy mój film gdzieś się wysyła?
Nie. Mowę przetwarza plik modelu leżący na twoim własnym dysku. Przez sieć przechodzi wyłącznie jednorazowe pobranie modelu, a potem przepis działa przy wyłączonym internecie.
Ile to trwa?
Jakieś 26 razy szybciej niż w czasie rzeczywistym na modelu domyślnym: zmierzyliśmy 6,2 sekundy na 2 minuty 43 sekundy mowy, laptop z M5. W tej proporcji godzinne nagranie schodzi w kilka minut. Na tym samym dźwięku tiny dał ×78, a large-v3-turbo ×14.
Który model wybrać?
Zacznij od small, który stoi domyślnie. W naszych pomiarach nie pomylił w testowym dźwięku ani jednego słowa i dał najczytelniejsze linijki — 39 znaków średnio wobec 97 u large-v3-turbo. Wyżej wchodź tylko wtedy, gdy dźwięk jest trudny; schodź do tiny albo base, jeśli chcesz brudnopis w kilka sekund.
Ile waży model?
78 MB tiny, 148 MB base, 488 MB small i 1,62 GB large-v3-turbo. Pobranie jest jednorazowe. Potem plik leży na dysku i każdy kolejny przebieg bierze go bez pytania.
Czy muszę podawać język mowy?
Nie. Język stoi na automatycznym i model sam go rozpoznaje po dźwięku. Można go jednak wskazać wprost i warto to zrobić, gdy nagranie otwiera się kilkoma zdaniami w innym języku.
Czy potrafi przetłumaczyć napisy na angielski?
Tak, przepisem „Przetłumacz mowę na angielskie napisy”: na wejściu obca mowa, na wyjściu angielski SRT z czasami, w jednym przebiegu zamiast „najpierw przepisz, potem przetłumacz”. Angielski to jedyny język docelowy, jaki obsługuje model.
Czym różni się SRT od VTT?
Głównie interpunkcją w czasach: SRT pisze 00:00:00,000 z przecinkiem i numeruje napisy, VTT pisze 00:00:00.000 z kropką i zaczyna się wierszem WEBVTT. SRT to czego oczekują odtwarzacze i montażówki; VTT to czego chce odtwarzacz webowy dla własnej ścieżki napisów. To osobne przepisy, więc zmiana formatu to ponowny przebieg, a nie przepisywanie pliku.
Czy napisy da się potem poprawić?
Da się — .srt to zwykły tekst. Otwórz w dowolnym edytorze i popraw nazwisko, żargon albo czas. Tak się właśnie normalnie pracuje: model robi dziewięćdziesiąt kilka procent, resztę dociągasz ręcznie.
Dlaczego moje linijki są za długie?
Bo to model decyduje, gdzie ciąć, a większe modele tną rzadziej. Zmierzyliśmy 39 znaków na napis przy small wobec 97 przy large-v3-turbo, na tym samym dźwięku. Jeśli linijki ci się rozłażą, powrót na small zwykle to naprawia — a przy czystej mowie nic nie kosztuje w trafności.
Czy rozróżnia mówiących?
Nie. Whisper zapisuje, co zostało powiedziane, a nie kto to powiedział. Jeśli potrzebujesz oznaczeń „Mówca 1 / Mówca 2”, wstawisz je ręcznie albo weźmiesz narzędzie zrobione właśnie do tego.
Co się stanie, jeśli w pliku nie ma mowy?
Przebieg zatrzyma się i powie, że nie usłyszał nic zrozumiałego, zamiast po cichu zapisać pusty plik. Cisza nie daje napisów — i tak ma być.
Czy działa na Windowsie i Linuksie?
Na wszystkich trzech systemach. Mowa liczy się wszędzie na procesorze, a na Apple Silicon dodatkowo na układzie graficznym — stąd te szybkie liczby wyżej. Ten sam przepis na skromnym laptopie z Windowsem będzie wolniejszy, ale wciąż szybszy niż odsłuchanie całego nagrania.
Czy mogę zrobić napisy do kilku plików naraz?
Tak. Wrzuć cały folder, dodaj przepis, a kolejka przejdzie po nich jeden po drugim. Każdy plik napisów zapisuje się obok własnego źródła.
Czy plik wideo się zmienia?
Nie. Obok zapisuje się osobny .srt — clip.subs.srt — a film nie jest zmieniany, przemianowywany ani przekodowywany. Ten przepis w ogóle nie rusza obrazu.
Zrób napisy do tego filmu
MediaChef 0.8.5 — za darmo, otwarty kod, macOS · Windows · Linux.
Za darmo i z otwartym kodem — zobacz kod na GitHubie Wszystkie pliki i informacje o wydaniu
MediaChef jest młody: kompilacje nie są jeszcze podpisane przez Apple ani Microsoft, więc pierwsze uruchomienie prosi o potwierdzenie — w każdym pobraniu jest instrukcja w zwykłym tekście.
Coś nie działa albo czegoś brakuje? Napisz do nas: hello@mediachef.app