Article
Ralentir l'audio pour la transcription
Les locuteurs rapides, les accents peu familiers et plusieurs voix qui se chevauchent sont les trois principales raisons pour lesquelles une transcription se bloque. Ralentir l'enregistrement donne le temps de distinguer ce qui a été dit. Le problème est qu'un simple ralentissement de la lecture abaisse aussi la hauteur de chaque voix, ce qui rend la parole encore plus difficile à suivre. Cet article explique la différence entre la simple réduction de vitesse et l'extension temporelle qui préserve la hauteur, et couvre les plages pratiques qui aident réellement.
Pourquoi ralentir aide
La parole humaine transmet beaucoup d'information en peu de temps. Un locuteur rapide peut délivrer 200 mots par minute ou plus, et à ce rythme l'oreille dispose de peu de temps pour résoudre chaque phonème avant que la syllabe suivante arrive. Ralentir l'audio donne au cerveau plus de temps de traitement par syllabe. C'est surtout utile dans trois situations : un locuteur avec un accent peu familier dont la correspondance phonémique diffère de ce qu'on attend ; un passage technique dense où chaque mot compte et une erreur d'écoute produit un terme faux ; et des enregistrements avec deux voix ou plus qui se chevauchent. Dans ces trois cas, l'objectif n'est pas d'entendre quelque chose qui n'était pas là, mais de se donner assez de temps pour entendre correctement ce qui a déjà été enregistré. Un taux de lecture de 0.75x suffit souvent pour un accent ou un passage dense. Un taux de 0.5x est utile pour un court passage où les premières écoutes n'ont pas permis de résoudre les mots.

Vitesse et hauteur : pourquoi le ralentissement naif ne fonctionne pas
La façon la plus simple de ralentir l'audio est de lire les échantillons à un débit inférieur à celui de l'enregistrement. C'est ainsi que les anciens magnétophones ralentissaient : faire tourner la bande plus lentement fait baisser à la fois la durée et la hauteur. A 0.75x, les voix baissent d'environ une tierce mineure. A 0.5x, elles baissent d'une octave entière. Le résultat est la distorsion lente et grave bien connue qui rend la parole peu naturelle et, de façon paradoxale, plus difficile à comprendre parce que les fréquences formantiques qui distinguent les voyelles ont toutes été décalées vers le bas. L'approche correcte est le time-stretching : modifier la durée de l'audio sans changer les fréquences. La hauteur de chaque voix reste la même ; seul le rythme d'arrivée des syllabes change. C'est l'approche utilisée par l'outil audio-speed et par la plupart des logiciels de transcription. Le résultat perceptif est qu'un enregistrement ralenti sonne comme le même locuteur parlant à un rythme plus lent, ce qui correspond exactement à ce dont on a besoin pour une transcription précise.
Comment fonctionne le time-stretching : l'approche atempo
L'algorithme le plus couramment utilisé pour le time-stretching dans les outils audio pratiques est fondé sur le vocodeur de phase, et son implémentation courante dans ffmpeg est le filtre atempo. L'audio d'entrée est divisé en trames courtes qui se chevauchent, typiquement de 20 à 40 millisecondes chacune. L'algorithme analyse les relations de phase entre les trames adjacentes, puis synthétise de nouvelles trames à un débit modifié en ajustant les phases pour que les trames successives s'enchainent correctement. Le résultat est un signal de sortie continu dont la durée a changé mais dont le contenu fréquentiel n'a pas changé. Parce que les trames sont courtes par rapport à la période de hauteur typique de la voix humaine, la fréquence fondamentale de la parole est préservée tout au long de l'extension. Un effet secondaire de l'algorithme est que les transitoires rapides, comme le clic d'une consonne, peuvent être légèrement flous lors d'une grande extension, parce que la synthèse par recouvrement de trames introduit un faible degré de lissage. Ce n'est pas un défaut d'implémentation ; c'est une propriété inhérente à la famille des algorithmes overlap-add.

Plages de vitesse pratiques et limites de qualité
Pour la transcription, deux valeurs de vitesse couvrent la plupart des besoins. A 0.75x, la parole est étirée à 133 % de sa durée d'origine. Les groupes de consonnes et les transitions vocaliques rapides deviennent plus faciles à distinguer, et la modification est suffisamment faible pour que l'algorithme introduise très peu d'artefacts perceptibles. La plupart des auditeurs peuvent suivre la parole à ce rythme sans perdre le rythme naturel de la phrase. A 0.5x, l'audio est étiré au double de sa longueur d'origine. C'est utile pour une seule phrase ou un court passage difficile, mais c'est trop lent pour une écoute continue sur plusieurs minutes. En dessous de 0.5x, la qualité se dégrade nettement. La synthèse overlap-add commence à introduire un trémolo ou une instabilité de phase sur les voyelles tenues, et les indices temporels entre consonnes et voyelles qui portent la prosodie deviennent distordus. Le filtre atempo de ffmpeg impose un minimum de 0.5x pour une passe unique, ce qui reflète cette limite de qualité. Les valeurs en dessous de 0.5x nécessitent deux passes en série, et le niveau d'artefacts augmente en conséquence. Pour presque tous les cas de transcription, rester à 0.75x ou au maximum à 0.5x pour des segments courts produit une sortie propre et utilisable.
Le faire localement avec l'outil audio-speed
L'outil audio-speed de ce site fonctionne entièrement dans le navigateur grâce à ffmpeg compilé en WebAssembly. Vous déposez votre fichier audio sur la page, choisissez le multiplicateur de vitesse, et le traitement se fait sur votre appareil. L'enregistrement ne quitte pas votre machine : aucun envoi, aucun serveur, aucun service tiers. C'est important pour les conversations enregistrées, les entretiens, les dictées médicales, les procédures judiciaires et tout autre contexte où le contenu audio est sensible. L'outil accepte les formats audio courants pris en charge par ffmpeg, dont MP3, WAV, M4A, OGG et FLAC. Le résultat est un fichier téléchargeable à la vitesse choisie. Le traitement en local signifie que la durée dépend de la longueur du fichier et de la puissance de votre appareil. Quelques minutes d'audio se traitent généralement en moins d'une minute sur un ordinateur portable moderne. L'outil utilise le même filtre atempo décrit dans cet article, donc les caractéristiques de qualité décrites s'appliquent directement à ce que vous entendrez en sortie.
Outils mentionnés dans cet article
- Vitesse audioAccélérez ou ralentissez un audio (0,25×–4×) en conservant le pitch. Dans votre navigateur, sans envoi.
- Convertisseur audioConvertissez de l'audio en MP3, WAV ou AAC directement dans votre navigateur. Sans upload.
- Extraire l'audio MP4Extrayez la piste audio de vos vidéos MP4 en MP3, sans conversion serveur.
Questions fréquentes
Ralentir l'audio va-t-il aussi changer la hauteur ?
Cela dépend de la méthode. La simple réduction du débit de lecture change bien la hauteur : à 0.5x, les voix baissent d'une octave entière. L'outil audio-speed utilise le time-stretching (filtre atempo) qui change la durée sans changer la hauteur, les voix restent donc à leur fréquence d'origine.
Quelle est la vitesse minimale qui reste propre à l'écoute ?
A 0.75x, la sortie est propre pour la plupart des enregistrements. A 0.5x, elle est acceptable pour des passages courts. En dessous de 0.5x, l'algorithme overlap-add commence à introduire des artefacts audibles sur les voyelles tenues et les transitions consonantiques. Pour la transcription, rester à 0.5x ou au-dessus donne les meilleurs résultats.
Le fichier est-il envoyé quelque part quand j'utilise l'outil audio-speed ?
Non. L'outil audio-speed fonctionne entièrement dans le navigateur. Le fichier est traité localement sur votre appareil via WebAssembly. Rien n'est envoyé à un serveur, le contenu de votre enregistrement reste donc privé.