MediaChef

MediaChef Vidéo en SRT

Générer des sous-titres SRT depuis une vidéo

Déposez la vidéo dans MediaChef, choisissez « Créer des sous-titres SRT pour une vidéo », laissez le modèle sur small et la langue sur automatique, puis lancez. Un fichier .srt apparaît à côté de la vidéo, minutage compris. Tout se calcule sur votre machine : la parole ne quitte pas le disque, et une fois le modèle téléchargé la recette fonctionne réseau coupé. Sur un portable M5, 2 minutes 43 secondes de parole ont pris 6,2 secondes avec le modèle par défaut — environ 26 fois plus vite que le temps réel — et ont donné 73 sous-titres de 39 caractères en moyenne, assez courts pour être lus tranquillement.

Ce qu'il faut
MediaChef 0.8.5 plus un téléchargement unique du modèle
Modèle par défaut
small — 488 Mo, téléchargé une fois et conservé
Vitesse
≈26× le temps réel avec le modèle par défaut (mesuré, M5)
Fonctionne hors ligne
Oui, dès que le modèle est sur le disque
Formats
SRT, VTT, TXT simple et JSON — une recette pour chacun
Ce que vous obtenez
clip.subs.srt à côté de la vidéo, l'original intact

Gratuit et open source — voir le code sur GitHub Tous les fichiers et les notes de version

Comment sous-titrer une vidéo

  1. Téléchargez MediaChef

    Un fichier pour macOS, Windows ou Linux. FFmpeg et le moteur Whisper voyagent tous les deux dans le téléchargement : rien à installer à part, rien à ajouter au PATH.

  2. Téléchargez un modèle, une seule fois

    La première transcription réclame un modèle de parole. Par défaut c'est small, 488 Mo, et c'est avec lui que ces mesures ont été faites ; tiny pèse 78 Mo, base 148 Mo et large-v3-turbo 1,62 Go. Il est récupéré une fois, reste sur le disque, et ensuite la recette ne touche plus au réseau.

  3. Déposez la vidéo et choisissez la recette

    « Créer des sous-titres SRT pour une vidéo » prend la vidéo directement : pas besoin d'en extraire le son au préalable. MediaChef décode la piste dans le mono 16 kHz qu'exige Whisper, dans un dossier temporaire que vous ne verrez jamais.

  4. Lancez, puis ouvrez le .srt

    Le fichier arrive à côté de la vidéo sous le nom clip.subs.srt, sous-titres numérotés et minutage compris. Les lecteurs, les logiciels de montage et les plateformes le lisent tel quel et, comme c'est du texte brut, un nom ou un terme se corrige dans n'importe quel éditeur.

MediaChef prêt à convertir : le plan de travail attend un fichier vidéo, la file des tâches est à droite.
Le plan de travail où la vidéo arrive. Les recettes apparaissent quand MediaChef a lu le fichier.

Quel modèle choisir

Quatre modèles, les mêmes 2 minutes 43 secondes de parole, la même machine : un portable M5 avec 16 Go, chaque modèle préchauffé et le meilleur de deux passages retenu.

ModèleTéléchargementTempsFace au temps réelMots ratés
tiny78 Mo2,1 s×785 sur 540
base148 Mo2,6 s×633 sur 540
small — celui par défaut488 Mo6,2 s×260 sur 540
large-v3-turbo1,62 Go11,5 s×141 sur 540

Lisez la dernière colonne avec précaution, car l'audio de test est une voix de synthèse lisant un texte préparé : sans accent, sans bruit de fond, sans personne qui parle par-dessus. C'est pourquoi même le plus petit modèle est presque parfait ici, et cela ne ressemble pas à l'enregistrement d'une vraie réunion — sur un son difficile l'écart entre ces modèles se creuse nettement. La colonne du temps, elle, se transpose directement à votre cas. Et voici ce que la comparaison brute masquait : presque tous les écarts étaient des nombres écrits en chiffres au lieu de lettres — large-v3-turbo a écrit « 70 », « 10 », « 50 », « 30 » là où le texte les disait en toutes lettres — ce qui relève de la mise en forme, pas d'une erreur d'écoute.

Quelle longueur font les sous-titres

Un sous-titre techniquement juste reste inutilisable s'il jette vingt mots à l'écran d'un coup. Les modèles découpent la même parole de façons très différentes, et c'est mesuré sur le même passage que plus haut.

ModèleSous-titresDurée moyenneCaractères en moyenneLe plus long
tiny354,7 s8397 caractères
base354,7 s83100 caractères
small — celui par défaut732,2 s3958 caractères
large-v3-turbo305,4 s97112 caractères

La règle courante en télévision tourne autour de 42 caractères par ligne sur deux lignes, soit environ 84 caractères à l'écran en même temps. À cette aune, des quatre, seul small tient largement : 39 caractères en moyenne et 58 pour le plus long, tandis que large-v3-turbo dépasse la limite dès un sous-titre ordinaire. Le modèle par défaut n'est donc pas seulement le choix équilibré côté justesse — c'est aussi celui qui découpe la parole en morceaux les plus lisibles.

SRT, VTT, texte brut ou JSON

La même transcription écrite de quatre manières. Les tailles viennent des mêmes 2 minutes 43 secondes de parole, elles se comparent donc directement.

FormatTailleCe qu'il contientQuand le prendre
SRT5,5 KoSous-titres numérotés, minutage avec une virgule : 00:00:00,000Presque toujours. Lecteurs, montage et plateformes l'acceptent
VTT5,3 KoEn-tête WEBVTT, minutage avec un point : 00:00:00.000Sous-titres pour un lecteur web, la piste du navigateur
TXT3,0 KoTexte au fil de l'eau, aucun minutageVous voulez les mots, pas les sous-titres
JSON15,2 KoChaque sous-titre plus le modèle et les paramètres utilisésCe sera lu par un programme, pas par une personne

SRT et VTT diffèrent surtout par le caractère entre les secondes et les millisecondes : si un lecteur refuse l'un, l'autre est un changement de recette et non une nouvelle transcription. Le JSON pèse environ trois fois le SRT parce qu'il transporte les données du passage à côté du texte.

Quelle recette pour quel cas

Les sous-titres, ce n'est pas une recette mais plusieurs, et choisir la bonne épargne une étape. Elles sont toutes dans le catalogue de 17 recettes.

Ce que vous avezCe que vous voulezRecette
Une vidéoDes sous-titres à côtéCréer des sous-titres SRT pour une vidéo
Un fichier audioDes sous-titresTranscrire l'audio en sous-titres SRT
De la parole en langue étrangèreDes sous-titres anglais en un passageTraduire la parole en sous-titres anglais
N'importe quoi avec de la paroleSeulement le texteTranscrire l'audio en texte
N'importe quoi avec de la paroleUne piste pour lecteur webTranscrire l'audio en WebVTT

La recette de traduction va de la parole étrangère directement à des sous-titres anglais minutés, en un seul passage — pas de « transcrire d'abord, traduire ensuite ». Elle ne va toutefois que vers l'anglais : c'est une limite du modèle, pas de l'application.

Pourquoi sous-titrer sur sa propre machine

La parole ne quitte pas votre disque. Les enregistrements de réunions, d'entretiens et d'appels sont le type de fichier le plus sensible que la plupart des gens manipulent, et une transcription en ligne est par définition une copie de cette conversation sur le serveur de quelqu'un d'autre. Ici, il n'y a pas d'envoi sur lequel réfléchir.

Aucun tarif à la minute. Les services de transcription facturent à la minute d'audio, ce qui transforme des archives longues en vraie facture. Le téléchargement du modèle est unique et, ensuite, un enregistrement de deux heures coûte autant qu'un de deux minutes : rien.

Ça tourne réseau coupé. Dès que le fichier du modèle est sur le disque, cette recette ne touche plus à internet. Elle fonctionne en avion, sur une machine verrouillée et dans une salle où le wifi est ce qu'il y a de moins fiable.

Aucune limite de durée. Les transcripteurs web gratuits vous arrêtent souvent à quelques minutes par fichier, précisément quand un enregistrement mérite d'être transcrit parce qu'il est long. Ici, il n'y a pas de plafond.

Un dossier entier d'un coup. Déposez un répertoire d'enregistrements : la file les traite un par un et vous dit où chaque fichier de sous-titres a été écrit.

Quand ce n'est pas le bon outil

La recette écrit un fichier de sous-titres. C'est plus étroit que « mettre des sous-titres sur une vidéo », et la différence compte dans ces cas-là.

  1. Vous voulez les sous-titres incrustés dans l'image.

    Ici on obtient un .srt séparé que le lecteur charge à côté de la vidéo. Graver le texte dans les images est une autre opération : elle réencode la vidéo, et ces mots ne peuvent ensuite plus être coupés ni corrigés.

  2. Il vous faut une précision de diffusion.

    Même sur l'audio propre mesuré plus haut, les modèles ont trébuché sur quelques mots, et les vrais enregistrements sont plus durs. Tout ce qui est publié sous une obligation légale d'accessibilité est relu par un humain avant diffusion, quel que soit l'outil qui a produit le brouillon.

  3. L'audio est vraiment mauvais.

    Des gens qui se coupent la parole, une salle enregistrée au téléphone ou une musique plus forte que la voix mettront les quatre modèles en échec. Réparer le son d'abord — ne serait-ce qu'en extrayant une piste plus propre — rapporte davantage que de monter d'une taille de modèle.

  4. Il vous faut une traduction vers autre chose que l'anglais.

    Whisper traduit vers l'anglais et uniquement vers l'anglais. Pour toute autre langue cible, transcrivez d'abord dans la langue d'origine et traduisez le texte obtenu avec un outil fait pour ça.

Questions

Est-ce gratuit ?

Oui, entièrement. MediaChef est open source sous GPL-3.0 : pas de version payante, pas de facturation à la minute, pas de plafond de durée. Les modèles se téléchargent gratuitement aussi. La version actuelle est la 0.8.5.

Ma vidéo est-elle envoyée quelque part ?

Non. La parole est traitée par un fichier de modèle posé sur votre propre disque. La seule chose qui traverse le réseau est le téléchargement unique du modèle, et ensuite la recette fonctionne internet coupé.

Combien de temps cela prend-il ?

Environ 26 fois plus vite que le temps réel avec le modèle par défaut : nous avons mesuré 6,2 secondes pour 2 minutes 43 secondes de parole sur un portable M5. À ce rythme, un enregistrement d'une heure passe en deux ou trois minutes. Sur le même audio, tiny a donné ×78 et large-v3-turbo ×14.

Quel modèle choisir ?

Commencez par small, celui par défaut. Dans nos mesures il n'a manqué aucun mot de l'audio de test et a produit les sous-titres les plus lisibles — 39 caractères en moyenne contre 97 pour large-v3-turbo. Ne montez que si votre audio est difficile ; descendez à tiny ou base si vous voulez un brouillon en deux secondes.

Quelle est la taille du modèle ?

78 Mo pour tiny, 148 Mo pour base, 488 Mo pour small et 1,62 Go pour large-v3-turbo. Le téléchargement est unique. Ensuite le fichier reste sur le disque et chaque passage suivant l'utilise sans rien demander.

Dois-je indiquer la langue parlée ?

Non. La langue est sur automatique et le modèle la déduit du son. Vous pouvez tout de même la nommer explicitement, ce qui vaut le coup quand un enregistrement s'ouvre sur quelques phrases dans une autre langue.

Peut-il traduire les sous-titres en anglais ?

Oui, avec la recette « Traduire la parole en sous-titres anglais » : parole étrangère en entrée, SRT anglais minuté en sortie, en un seul passage plutôt que transcrire puis traduire. L'anglais est la seule langue cible que le modèle prend en charge.

Quelle différence entre SRT et VTT ?

Surtout la ponctuation du minutage : le SRT écrit 00:00:00,000 avec une virgule et numérote ses sous-titres, le VTT écrit 00:00:00.000 avec un point et commence par une ligne WEBVTT. Le SRT est ce qu'attendent les lecteurs et les logiciels de montage ; le VTT est ce que veut un lecteur web pour sa propre piste de sous-titres. Ce sont deux recettes distinctes, donc changer de format c'est relancer, pas réécrire le fichier.

Puis-je modifier les sous-titres ensuite ?

Oui — un .srt est du texte brut. Ouvrez-le dans n'importe quel éditeur pour corriger un nom propre, un terme technique ou un minutage. C'est la façon normale de travailler : le modèle fait les quatre-vingt-dix et quelques pour cent, vous reprenez le reste à la main.

Pourquoi certains de mes sous-titres sont-ils trop longs ?

Parce que c'est le modèle qui décide où couper, et les gros modèles coupent moins souvent. Nous avons mesuré 39 caractères par sous-titre avec small contre 97 avec large-v3-turbo, sur le même audio. Si vos sous-titres s'allongent, redescendre à small règle généralement la question — et sur une parole propre cela ne coûte rien en justesse.

Distingue-t-il les locuteurs ?

Non. Whisper écrit ce qui a été dit, pas qui l'a dit. S'il vous faut des mentions « Locuteur 1 / Locuteur 2 », vous les ajouterez à la main ou utiliserez un outil fait spécialement pour ça.

Que se passe-t-il s'il n'y a pas de parole dans le fichier ?

Le passage s'arrête et vous dit qu'il n'a rien entendu d'intelligible, au lieu d'écrire discrètement un fichier vide. Le silence ne produit pas de sous-titres, et c'est voulu.

Est-ce que ça marche sur Windows et Linux ?

Sur les trois plateformes. La parole est traitée par le processeur partout, et en plus par le GPU sur Apple Silicon, d'où les chiffres rapides ci-dessus. La même recette sur un portable Windows modeste sera plus lente, tout en restant plus rapide que d'écouter l'enregistrement.

Puis-je sous-titrer plusieurs fichiers à la fois ?

Oui. Déposez un dossier entier, ajoutez la recette, et la file les traite l'un après l'autre. Chaque fichier de sous-titres est écrit à côté de sa propre source.

Le fichier vidéo est-il modifié ?

Non. Un .srt distinct est écrit à côté — clip.subs.srt — et la vidéo n'est ni modifiée, ni renommée, ni réencodée. Cette recette ne touche pas du tout à l'image.

Sous-titrez cette vidéo

MediaChef 0.8.5 — gratuit, open source, macOS · Windows · Linux.

Gratuit et open source — voir le code sur GitHub Tous les fichiers et les notes de version

MediaChef est jeune : les binaires ne sont pas encore signés par Apple ni Microsoft, le premier lancement demande donc une confirmation — une notice en texte brut accompagne chaque téléchargement.

Quelque chose ne marche pas, ou manque ? Écrivez-nous : hello@mediachef.app