MediaChef 音频转文字
把音频转成文字 — 离线,在你自己的电脑上
MediaChef 通过 whisper.cpp 在本地运行 OpenAI 的 Whisper。下载一次模型,然后把录音或视频放进投放区,挑你要的输出:纯文本、带时间轴的 SRT 或 VTT 字幕,或者带每段起止时间的 JSON。音频从不上传,也没有按分钟计费。
免费且开源—— 在 GitHub 上查看代码 全部文件与版本说明
你会得到什么
TXT 不带时间,SRT 和 VTT 带时间,JSON 里有每一段的起止时间。
怎么转写一段录音
-
下载 MediaChef
macOS、Windows 或 Linux 各一个文件。whisper.cpp v1.7.6 已经在下载包内;只有模型是单独下载的。
-
选一个 Whisper 模型
打开「模型」下载一个——small(488 MB)是均衡的默认选择。下载一次之后,断网也能转写。
-
放入录音或视频
音频和视频都行:MediaChef 会自己从视频里取出声音,所以会议录音和 MP4 走的是同一条路。
-
选择你要的输出
要 TXT 就用「把音频转成文字」,要带时间轴的字幕就用「把音频转成 SRT 字幕」或「把音频转成 WebVTT」,给工具用就选「把音频转成带时间的 JSON」。
-
按下开始并读结果
文字会以 talk.transcript.txt 的名字落在文件旁边。队列显示进度;如果文件里没有语音,MediaChef 会直说,而不是写出一个空文件。
该选哪个 Whisper 模型
目录里有四个模型,在应用内下载。模型越大,文字越好,同一台机器上耗时也越长,所以按任务来挑,而不是一次定终身。
| 模型 | 下载体积 | 什么时候选它 |
|---|---|---|
tiny | 78 MB | 对清晰语音做第一遍,或者你只需要找到某个话题从哪里开始。 |
base | 148 MB | 给自己看的笔记:反正你都会再扫一遍并修改的可读文字。 |
small | 488 MB | 所有转写配方的默认值,也是多数人最后留下的那个。访谈、会议、讲座。 |
large-v3-turbo | 1.62 GB | 要给别人看的文字:你会发布的字幕、你会引用的原话。针对 Apple Silicon 优化。 |
语言会自动识别,你也可以固定它。另有两个配方能把任意语言在同一遍里翻译成英文——输出文字或带时间轴的字幕。
为什么在自己的电脑上转写
机密音频依然机密。 访谈、诊疗记录、法律通话,以及任何受保密协议约束的内容:读取文件的只是你自己机器上的一个进程,除此之外没有别的。
不按分钟计费。 云端转写按分钟收费。在本地,第十个小时的音频和第一个小时一样:不要钱。
没有时长和体积限制。 四小时的录音就是队列里的一个任务,既不是付费档位,也不用把文件切开将就。
完全不需要网络。 模型落到硬盘上之后,转写就是离线的:在飞机上、在实验室里、在与网络隔离的机器上都行。
字幕和文字一遍出。 SRT 和 VTT 带着给播放器用的时间轴,TXT 是干净的正文,JSON 里有分段时间供你自己的脚本使用。
常见问题
Whisper 转写有多准?
准确度取决于模型:tiny 是草稿,small 是均衡的默认值,large-v3-turbo 在语音清晰时接近人工水平。单人、干净的音频效果最好;口音很重、多人抢话、人声下面压着音乐都会拉低准确度——任何语音识别系统都是如此。
支持哪些语言?
Whisper 覆盖约一百种语言并会自行识别语种;如果识别错了,你也可以手动固定。有两个配方能把其中任意一种语言的语音一遍翻译成英文,输出文字或 SRT 字幕。
转写结果有哪些格式?
纯文本用 TXT,给播放器和剪辑软件用的是带时间轴的 SRT 和 VTT,给脚本和工具用的是带每段起止时间的 JSON。
需要联网吗?
需要一次,在「模型」界面下载一个 Whisper 模型——按你选的不同,从 78 MB 到 1.62 GB。之后转写完全离线运行。
如果录音里没有语音怎么办?
MediaChef 会报告「未检测到语音」,而不是写出一个空文件再给任务打上绿勾。静音、没有人声的音乐、以及选错的文件,结局同样如实。
把那段录音变成文字
MediaChef 0.4.1 — Whisper 本地运行,免费且开源。
免费且开源—— 在 GitHub 上查看代码 全部文件与版本说明
MediaChef 还很年轻:安装包尚未由 Apple 或 Microsoft 签名,因此首次启动会要求确认——每个下载包里都附有纯文本说明。