MediaChef

MediaChef Аудио в текст

Транскрибация аудио в текст — офлайн, на вашем компьютере

MediaChef запускает Whisper от OpenAI локально, через whisper.cpp. Скачайте модель один раз, положите запись или видео на доску и выберите, что получить на выходе: обычный текст, субтитры SRT и VTT с таймингами или JSON со временем каждого отрезка. Звук никуда не загружается, платы за минуты нет.

Бесплатно и с открытым кодом — код на GitHub

Что получится на выходе

00:00:04 Всем привет, начинаем встречу… 00:00:11 Первый вопрос — планы на квартал. 00:00:19 Есть три сценария, покажу таблицу.

TXT — без таймингов, SRT и VTT — с ними, JSON — со временем начала и конца каждого отрезка.

Как расшифровать запись

  1. Скачайте MediaChef

    Один файл для macOS, Windows или Linux. whisper.cpp v1.7.6 уже внутри поставки — отдельно качается только модель.

  2. Выберите модель Whisper

    Откройте экран «Модели» и скачайте одну — small на 488 МБ — сбалансированный вариант по умолчанию. Загрузка разовая, дальше расшифровка работает с выключенной сетью.

  3. Перетащите запись или видео

    Подходит и то и другое: MediaChef сам достаёт звук из видео, поэтому запись встречи и MP4 идут одним путём.

  4. Выберите нужный формат результата

    «Аудио в текст» — для TXT, «Аудио в субтитры SRT» или «Аудио в субтитры WebVTT» — для субтитров с таймингами, «Аудио в JSON с таймингами» — для скриптов.

  5. Нажмите старт и прочитайте результат

    Текст ляжет рядом с файлом под именем talk.transcript.txt. Очередь покажет прогресс, а если речи в файле нет — MediaChef скажет об этом, а не запишет пустой файл.

MediaChef перед транскрибацией: доска для записи и раздел «Модели» в боковом меню, где скачиваются модели Whisper.
Модели живут в боковом меню: скачали один раз — дальше расшифровка идёт офлайн.

Какую модель Whisper выбрать

В каталоге четыре модели, все качаются внутри приложения. Крупнее — точнее текст и дольше расчёт на той же машине, поэтому выбирать стоит под задачу, а не раз и навсегда.

МодельСкачатьКогда брать
tiny 78 МБ Первый проход по чистой речи или когда нужно только найти, где начинается нужная тема.
base 148 МБ Заметки для себя: текст, который вы всё равно будете просматривать и править.
small 488 МБ Значение по умолчанию во всех рецептах расшифровки и то, на чём большинство и остаётся. Интервью, встречи, лекции.
large-v3-turbo 1,62 ГБ Текст, который уйдёт другим людям: субтитры в публикацию, цитаты в статью. Оптимизирована под Apple Silicon.

Язык определяется автоматически, но его можно задать вручную. Ещё два рецепта переводят речь с любого языка на английский — текстом или субтитрами — за тот же один проход.

Почему офлайн лучше

Конфиденциальная запись остаётся конфиденциальной. Интервью, приёмы, юридические созвоны, всё под NDA: файл читает процесс на вашем компьютере и больше никто.

Никакой оплаты за минуты. Облачная расшифровка считает деньги по минутам. Локально десятый час звука стоит столько же, сколько первый, — нисколько.

Нет лимита длины и размера. Четырёхчасовая запись — это одна задача в очереди, а не платный тариф и не нарезка файла на части.

Работает совсем без сети. Как только модель лежит на диске, расшифровка идёт офлайн: в самолёте, в лаборатории, на машине без интернета.

Субтитры и текст из одного прогона. SRT и VTT несут тайминги для плеера, TXT — чистый текст, JSON — время отрезков для ваших скриптов.

Вопросы и ответы

Насколько точна расшифровка через Whisper?

Точность зависит от модели: tiny — черновик, small — сбалансированный вариант по умолчанию, large-v3-turbo — почти как человек на чистой речи. Лучше всего распознаётся чистая запись одного говорящего; сильный акцент, речь вперебивку и музыка под голосом снижают точность — как и у любого распознавания речи.

Какие языки поддерживаются?

Whisper знает около сотни языков и определяет язык сам; при неверной догадке его можно задать вручную. Два рецепта переводят речь с любого из них на английский за один проход — текстом или субтитрами SRT.

В каких форматах приходит расшифровка?

TXT — обычный текст, SRT и VTT — с таймкодами для плееров и монтажа, JSON — со временем начала и конца каждого отрезка для скриптов и своих инструментов.

Нужен ли интернет?

Один раз — чтобы скачать модель Whisper на экране «Модели»: от 78 МБ до 1,62 ГБ, смотря какую. После этого расшифровка работает полностью офлайн.

Что будет, если в записи нет речи?

MediaChef напишет «Речь не обнаружена» вместо пустого файла с зелёной галочкой. Тишина, музыка без вокала и просто не тот файл заканчиваются одинаково честно.

Превратите эту запись в текст

MediaChef 0.4.0 — Whisper работает локально, бесплатно и с открытым кодом.

MediaChef — молодой проект: сборки пока без подписи Apple и Microsoft, поэтому первый запуск попросит подтверждение — простая инструкция лежит внутри каждого архива.