MediaChef

MediaChef Audio en texte

Transcrire l'audio en texte — hors ligne, sur votre ordinateur

MediaChef exécute Whisper d'OpenAI en local via whisper.cpp. Téléchargez un modèle une fois, déposez un enregistrement ou une vidéo, puis choisissez ce que vous voulez en sortie : texte brut, sous-titres SRT ou VTT minutés, ou JSON avec le temps de chaque segment. L'audio n'est jamais envoyé, et il n'y a pas de prix à la minute.

Gratuit et open source — voir le code sur GitHub Tous les fichiers et les notes de version

Ce que vous obtenez

00:00:04 Bonjour à tous, on commence… 00:00:11 Premier point : les plans du trimestre. 00:00:19 Il y a trois scénarios, je montre le tableau.

TXT sans minutages, SRT et VTT avec, JSON avec le début et la fin de chaque segment.

Comment transcrire un enregistrement

  1. Téléchargez MediaChef

    Un fichier pour macOS, Windows ou Linux. whisper.cpp v1.7.6 est déjà inclus ; seul le modèle se télécharge à part.

  2. Choisissez un modèle Whisper

    Ouvrez Modèles et téléchargez-en un — small (488 Mo) est l'équilibre par défaut. Un seul téléchargement ; ensuite la transcription fonctionne réseau coupé.

  3. Déposez l'enregistrement ou la vidéo

    Audio et vidéo passent tous les deux : MediaChef extrait lui-même le son d'une vidéo, l'enregistrement d'une réunion et un MP4 suivent donc le même chemin.

  4. Choisissez la sortie voulue

    « Transcrire l'audio en texte » pour du TXT, « Transcrire l'audio en sous-titres SRT » ou « Transcrire l'audio en WebVTT » pour des sous-titres minutés, « Transcrire l'audio en JSON avec minutages » pour l'outillage.

  5. Lancez et lisez le résultat

    Le texte atterrit à côté du fichier sous le nom talk.transcript.txt. La file affiche la progression ; s'il n'y a pas de parole dans le fichier, MediaChef le dit au lieu d'en écrire un vide.

MediaChef avant la transcription : la zone de dépôt d'un enregistrement, avec Modèles dans le menu latéral d'où se téléchargent les modèles Whisper.
Les modèles vivent dans le menu latéral — un téléchargement, puis la transcription se fait hors ligne.

Quel modèle Whisper choisir

Le catalogue propose quatre modèles, téléchargés depuis l'application. Plus gros signifie meilleur texte et calcul plus long sur la même machine : choisissez selon la tâche plutôt qu'une fois pour toutes.

ModèleTéléchargementQuand le choisir
tiny 78 Mo Une première passe sur une parole claire, ou quand il s'agit juste de repérer où commence un sujet.
base 148 Mo Des notes pour vous : un texte lisible que vous relirez et corrigerez de toute façon.
small 488 Mo La valeur par défaut de toutes les recettes de transcription, et celle que la plupart gardent. Entretiens, réunions, cours.
large-v3-turbo 1,62 Go Un texte destiné à quelqu'un d'autre : sous-titres publiés, citations reprises. Optimisé pour Apple Silicon.

La langue est détectée automatiquement, et vous pouvez aussi la fixer. Deux recettes supplémentaires traduisent n'importe quelle langue vers l'anglais — en texte ou en sous-titres minutés — dans la même passe.

Pourquoi transcrire sur votre ordinateur

L'audio confidentiel le reste. Entretiens, notes cliniques, appels juridiques, tout ce qui relève d'un accord de confidentialité : le fichier est lu par un processus de votre machine et par rien d'autre.

Pas de facturation à la minute. La transcription dans le cloud se facture à la minute. En local, la dixième heure d'audio coûte ce qu'a coûté la première : rien.

Aucune limite de durée ni de taille. Un enregistrement de quatre heures est une tâche dans la file, pas une offre payante ni un bricolage de découpage de fichier.

Fonctionne sans aucun réseau. Une fois le modèle sur le disque, la transcription est hors ligne : dans un avion, dans un laboratoire, sur une machine isolée.

Sous-titres et texte d'une même passe. SRT et VTT portent les minutages pour un lecteur, TXT est de la prose propre, JSON contient les temps des segments pour vos propres scripts.

Questions fréquentes

Quelle est la précision de Whisper ?

La précision suit le modèle : tiny est un brouillon, small est l'équilibre par défaut, large-v3-turbo frôle le niveau humain sur une parole claire. Un audio propre à un seul locuteur donne les meilleurs résultats ; les accents marqués, les gens qui parlent en même temps et la musique sous la voix coûtent en précision — comme pour n'importe quel système de reconnaissance vocale.

Quelles langues sont gérées ?

Whisper couvre une centaine de langues et détecte la langue tout seul ; vous pouvez aussi la fixer si la détection se trompe. Deux recettes traduisent la parole depuis n'importe laquelle vers l'anglais en une passe, en texte ou en sous-titres SRT.

Dans quels formats sort la transcription ?

TXT pour du texte brut, SRT et VTT avec minutages pour les lecteurs et les logiciels de montage, et JSON avec le début et la fin de chaque segment pour les scripts et l'outillage.

Faut-il internet ?

Une fois, pour télécharger un modèle Whisper depuis l'écran Modèles — de 78 Mo à 1,62 Go selon celui que vous prenez. Ensuite la transcription tourne entièrement hors ligne.

Et si l'enregistrement ne contient pas de parole ?

MediaChef signale « Aucune parole détectée » au lieu d'écrire un fichier vide et de cocher la tâche en vert. Le silence, la musique sans voix et un fichier choisi par erreur se terminent de la même façon honnête.

Transformez cet enregistrement en texte

MediaChef 0.4.1 — Whisper en local, gratuit et open source.

Gratuit et open source — voir le code sur GitHub Tous les fichiers et les notes de version

MediaChef est jeune : les binaires ne sont pas encore signés par Apple ni Microsoft, le premier lancement demande donc une confirmation — une notice en texte brut accompagne chaque téléchargement.