MediaChef

任何文件,转成任何格式。
语音,转成文字。全部在你的电脑上完成。

MediaChef 是一款免费应用,它把 FFmpeg 和 Whisper 变成一张张配方卡:转换视频和音频、从片段中提取声音、把录音转成文字——离线运行,在你自己的机器上,不向任何地方上传。

免费且开源—— 在 GitHub 上查看代码 全部文件与版本说明

  • 版本 0.4.1
  • 内置 17 个配方
  • 4 个 Whisper 模型
  • macOS · Windows · Linux
  • 开源 · GPL-3.0
把文件拖到这里

它是怎么工作的

  1. 放入文件

    把视频或录音拖进来。MediaChef 会读取文件内容,只显示与之匹配的配方。

  2. 选择配方

    每个操作都是一张简单的卡片:「提取音频为 MP3」「为视频生成 SRT 字幕」「压缩视频」。默认参数已经调好,预览会显示确切的 FFmpeg 命令。

  3. 取走结果

    文件会出现在原文件旁边——或你指定的文件夹里。队列显示进度、剩余时间和结果所在的位置。

MediaChef 主界面:侧边栏包含转换、模型和设置,中间是文件投放区,右侧是任务队列。
真实窗口,配色与你此刻阅读的主题一致。中间是文件投放区,右侧是队列,引擎已经内置其中。

用配方代替命令

FFmpeg 几乎什么都能做——只是用终端的语言。MediaChef 负责翻译:你挑要做什么,参数已经设好。预览会显示真实命令,顺带就学会了。

提取音频为 MP3

把任意视频里的声音轨取出来。

生成 SRT 字幕

Whisper 听完后写出一个 SRT 文件。

压缩视频

把片段压到聊天软件能接受的体积。

视频转 GIF

清晰的循环 GIF,10 到 24 fps。

把音频转成文字

会议录音或语音消息变成纯文本。

把语音翻译成英文

Whisper 一次完成转写和翻译。

把 MP4 转成 MKV

重新封装,不重新编码——瞬间完成。

去掉视频里的声音

删除全部音轨,只保留画面。

装好就能做的事

应用内置十七个配方。每一个都是参数已经填好的真实 FFmpeg 或 Whisper 任务,结果按 {文件名}.{做了什么}.{扩展名} 写在你的文件旁边。

方向应用中的配方你会得到
视频 → 音频 «提取音频为 MP3» clip.audio.mp3,128、192 或 320 kbps
视频 → 字幕 «为视频生成 SRT 字幕» clip.subs.srt,带时间轴
音频 → 文字 «把音频转成文字» talk.transcript.txt,纯文本
任意语言 → 英文 «把语音翻译成英文文字» talk.english.txt,一次完成
MP4 → MKV «把 MP4 转成 MKV» 重新封装而非重新编码——几秒钟,无损
视频 → 更小 «压缩视频(质量预设)» H.264,CRF 23、28 或 33
视频 → GIF «视频转 GIF» 10–24 fps,宽度 320–640
其他一切 «自定义 FFmpeg 命令» 你自己的参数,附命令预览

完整指南:把 MP4 转成 MP3 →

不离开自己的电脑,把音频转成文字

Whisper 在本地运行。 OpenAI 的语音模型通过 whisper.cpp 在你自己的处理器上执行——录音从不离开这台机器。

模型在应用内下载。 从 78 MB 的 tiny 到 1.62 GB 的 large-v3-turbo——在「模型」界面按任务挑选。

文字或字幕。 纯 TXT、带时间轴的 SRT 和 VTT,或带每段起止时间的 JSON,供你的工具使用。

结果如实。 如果文件里没有语音,MediaChef 会直说「未检测到语音」——绝不会交出一个打着绿勾的空文件。

00:00:04 Hi everyone, let's get started… 00:00:11 First topic — plans for the quarter. 00:00:19 There are three scenarios, sharing now. .srt · .txt

Whisper 模型

语音转文字基于 whisper.cpp 与 OpenAI 的 Whisper 模型。你在「模型」界面下载一次模型,之后断网也能用。模型越大,文字越准,耗时也越长。

模型下载体积适合什么
tiny 78 MB 最快,质量粗糙。用极短的时间给清晰语音出一份草稿。
base 148 MB 速度快,质量尚可。足够在录音里找到你需要的那一段。
small 默认 488 MB 推荐的平衡点——所有语音转文字配方的默认值。
large-v3-turbo 1.62 GB 质量最好,针对 Apple Silicon 优化。适合准备发布的文字。

完整指南:把音频转成文字 →

你的文件哪儿也不去

在线转换器要你把文件上传到别人的服务器、排队等待,还要相信对方的保留政策。MediaChef 在你的处理器上干活:一 GB 的录屏和一段私密会议录音,处理方式完全一样——关掉 Wi-Fi 也照样跑。

  • 不上传
  • 无体积上限
  • 不用订阅

开源,引擎随包附带

GPL-3.0 许可,全部开发历史在 GitHub 上公开。从 0.4.0 起,每个下载都自带引擎——不用往 PATH 里装东西,也没有要配置的。

FFmpeg 9.0.1
转换 · GPL v3
whisper.cpp v1.7.6
语音识别 · MIT
macOS · Windows · Linux
dmg 约 66 MB · 安装包约 82 MB · AppImage 约 181 MB · deb 约 118 MB

所有内置组件的确切版本与许可 — NOTICE.md

常见问题

真的免费吗?

是的。MediaChef 采用 GPL-3.0 开源许可——不用注册、没有试用期、没有水印。转换器和语音转文字就是应用的全部,代码在 GitHub 上公开。

支持哪些格式?

FFmpeg 能读的都支持:MP4、MKV、MOV、WebM、AVI、TS、MP3、WAV、FLAC、M4A、OGG 以及其他几十种。MediaChef 用 ffprobe 检查文件本身,而不是相信扩展名,所以你看到的配方都是真正合适的。

我的文件会上传到哪里?

哪里也不会。转换和语音转文字完全在你的电脑上运行。MediaChef 唯一会下载的东西是 Whisper 模型——一次,在「模型」界面。

语音转文字有多准?

它通过 whisper.cpp v1.7.6 使用 OpenAI 的 Whisper 模型。准确度取决于你选的模型:tiny 立刻出结果但比较粗糙,small 是均衡的默认值,large-v3-turbo 在语音清晰时接近人工水平。语言会自动识别。

离线能用吗?

能。FFmpeg 和 Whisper 都在下载包内,所以从第一次启动起转换就能离线运行;只要下载过一次模型,语音转文字同样离线可用。

为什么不直接用在线转换器?

如果只是一个小的公开文件,在线转换器完全够用。但私密录音、几 GB 的视频、批量处理,以及任何受保密协议约束的内容,都更适合在本地做:不用等上传、没有体积上限,也不会有东西留在别人的硬盘上。

让主厨来打理你的媒体文件

免费、开源、支持 3 个平台。版本 0.4.1。

免费且开源—— 在 GitHub 上查看代码 全部文件与版本说明

MediaChef 还很年轻:安装包尚未由 Apple 或 Microsoft 签名,因此首次启动会要求确认——每个下载包里都附有纯文本说明。