Qu’est-ce que la transcription audio en texte ?

La transcription audio en texte est la conversion automatique d’un enregistrement parlé en texte écrit, par un système de reconnaissance vocale. On mesure sa qualité par le taux d’erreur sur les mots (WER), qui descend aujourd’hui sous 10 % en français sur un audio propre.

Comment ça marche concrètement ?

La transcription audio en texte, ou reconnaissance automatique de la parole (automatic speech recognition), est la conversion d’un signal sonore parlé en texte écrit par un programme. Elle constitue le passage obligé pour exploiter un podcast, une vidéo ou une réunion comme on exploite un article : chercher dedans, en extraire des citations, le résumer.

Le domaine est ancien. Le système Audrey, construit chez Bell Labs en 1952, reconnaissait les chiffres de zéro à neuf prononcés par un seul locuteur. Le basculement décisif est bien plus récent : l’abandon des modèles acoustiques par composants au profit de réseaux de neurones entraînés de bout en bout, généralisé au cours des années 2010.

Comment se mesure la qualité d’une transcription ?

L’indicateur standard est le WER, Word Error Rate, calculé comme la somme des substitutions, omissions et insertions rapportée au nombre de mots de référence. Un WER de 8 % signifie huit mots erronés pour cent mots attendus.

WERLisibilitéUsage possible
Moins de 5 %Quasi parfaiteCitation directe, sous-titres
5 à 10 %BonneLecture, résumé automatique, recherche
10 à 20 %DégradéeRecherche par mots-clés seulement
Plus de 20 %MauvaiseRelecture intégrale nécessaire

Le WER a un défaut connu : il traite toutes les erreurs comme équivalentes. Confondre « et » et « est » coûte autant que se tromper sur un nom propre ou sur un chiffre, alors que la seconde erreur ruine la valeur du passage. C’est pourquoi une évaluation sérieuse regarde séparément la précision sur les entités nommées et sur les nombres.

Quels facteurs dégradent le résultat ?

  1. La qualité de captation. Un micro-cravate et un micro de portable dans une salle réverbérante ne produisent pas le même WER, à modèle égal. C’est le facteur dominant, devant le choix du modèle.
  2. Le chevauchement des voix. Deux personnes qui parlent en même temps produisent presque systématiquement une erreur, quel que soit le système.
  3. Le vocabulaire spécialisé. Termes techniques, acronymes, noms propres rares : ce sont les mots les plus porteurs d’information et les plus mal reconnus, faute d’occurrences suffisantes à l’entraînement.
  4. Les accents et le débit. Un accent régional marqué ou un débit très rapide augmentent nettement le taux d’erreur.
  5. L’alternance de langues. Un intervenant qui glisse une phrase en anglais au milieu du français met en difficulté les modèles qui n’ont pas été conçus pour le code-switching.

Que s’est-il passé depuis 2022 ?

La publication de Whisper par OpenAI en septembre 2022 constitue un point de bascule pour les langues autres que l’anglais. Le modèle a été entraîné sur 680 000 heures d’audio multilingue collecté sur le web, un volume sans précédent en accès ouvert, et livré sous licence permissive en plusieurs tailles. L’effet immédiat a été de rendre la transcription de qualité correcte accessible sans contrat avec un fournisseur cloud.

La compétition s’est ensuite déplacée sur trois terrains : la latence pour l’usage en temps réel, la diarisation — savoir qui parle — et l’horodatage précis au mot, indispensable pour rattacher une citation à son instant exact dans l’enregistrement.

Que faire d’une transcription brute ?

Une transcription brute est peu lisible : c’est un mur de texte, oral dans sa syntaxe, plein de répétitions et de faux départs qui passent inaperçus à l’écoute mais sautent aux yeux à l’écrit. Elle n’a de valeur qu’en tant qu’entrée d’un traitement ultérieur.

Trois traitements changent tout : le découpage en paragraphes avec ponctuation restituée, l’attribution des tours de parole, et l’horodatage. Avec ces trois éléments, une heure de podcast devient un document consultable, résumable et citable à la seconde près. Sans eux, elle reste un fichier qu’on n’ouvre pas.

Comment la transcription s’insère-t-elle dans une chaîne de veille ?

La transcription n’est pas une fin : elle est ce qui fait entrer l’audio et la vidéo dans le même régime de traitement que le texte. Une fois transcrit, un podcast peut être résumé, indexé, cité et relié aux articles lus sur le même sujet — ce qui est impossible tant qu’il reste un fichier audio.

C’est la position qu’occupe la transcription dans Synthiz : les vidéos YouTube et les podcasts ajoutés sont transcrits, puis synthétisés et versés dans une « mémoire » thématique au même titre qu’un article ou un PDF, avec des citations rattachées au passage source. Une idée entendue dans un épisode se retrouve ensuite par une recherche, et non par le souvenir approximatif de l’épisode où elle se trouvait.

Questions fréquentes

Qu’est-ce que le WER, et quel score est acceptable ?
Le Word Error Rate est le rapport entre le nombre de mots substitués, omis ou ajoutés et le nombre de mots du texte de référence. En dessous de 10 %, une transcription est confortable à lire ; au-delà de 20 %, elle demande une relecture complète et fait plus perdre de temps qu’elle n’en fait gagner.
La transcription automatique fonctionne-t-elle bien en français ?
Oui, depuis la vague de modèles multilingues entraînés à grande échelle. Whisper, publié par OpenAI en septembre 2022 et entraîné sur 680 000 heures d’audio, a marqué un palier pour les langues autres que l’anglais. Le français reste un peu en retrait de l’anglais, mais l’écart s’est fortement réduit.
Qu’est-ce que la diarisation ?
C’est l’identification de qui parle et quand, dans un enregistrement à plusieurs voix. Elle est traitée séparément de la transcription et détermine la lisibilité d’une interview ou d’une table ronde : sans elle, deux intervenants qui se contredisent se fondent en un seul bloc de texte.

Publié le 05/09/2026