Aucun upload, 100 % local, sans compte

Article

Nettoyer et préparer l'audio d'un podcast

Un enregistrement vocal brut nécessite généralement trois choses avant d'être prêt à la publication : un niveau de sonie cohérent, un format et un débit adaptés aux plateformes, et une évaluation honnête de ce que la suppression de bruit peut réellement accomplir. Cet article couvre ces étapes avec audio-volume, vocal-remover et audio-converter, qui tournent tous localement dans le navigateur.

Sonie vs crête : pourquoi le LUFS compte plus que le niveau de crête

Le niveau de crête mesure l'échantillon le plus fort d'un fichier audio. La sonie, exprimée en LUFS (Loudness Units relative to Full Scale), mesure l'énergie perçue dans le temps. Un podcast enregistré à -3 dBFS en crête peut sonner bas si la majorité du signal reste bien en dessous. Les plateformes de streaming et les annuaires de podcasts normalisent l'audio à une sonie cible à la lecture, typiquement -14 LUFS pour la musique et -16 LUFS pour la voix parlée. Soumettre à un niveau très différent signifie que la plateforme montera ou baissera le volume de toute façon. Viser -16 LUFS de sonie intégrée donne un fichier qui correspond au réglage par défaut de la plateforme et reste cohérent avec les autres émissions, tout en laissant une marge avant le plafond numérique à 0 dBFS. Le pic réel, qui tient compte des dépassements inter-échantillons, se garde habituellement sous -1 dBTP. Cibler ces deux valeurs ensemble donne un résultat plus propre que de viser un niveau de crête seul.

Une personne portant un casque enregistre un podcast en parlant dans un microphone de bureau devant un ordinateur
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

Gain et normalisation avec audio-volume

audio-volume permet d'ajuster le gain d'un fichier en décibels ou d'appliquer une normalisation de sonie. Si un enregistrement est globalement trop bas, ajouter du gain en dB élève tout le signal d'une valeur fixe. Le risque est la saturation : si une crête est déjà proche de 0 dBFS, un décalage positif la fera dépasser, introduisant une distorsion numérique. Vérifiez la forme d'onde avant d'appliquer le gain, et maintenez le pic réel sous -1 dBFS après l'ajustement. La normalisation de sonie adopte une approche différente. L'outil applique le filtre loudnorm de FFmpeg à sa cible par défaut de -24 LUFS de sonie intégrée, plutôt qu'aux cibles plus fortes recommandées par certaines plateformes de podcast. Le loudnorm en un seul passage est un processus dynamique, pas un simple décalage de gain fixe : il suit la sonie dans le temps et ajuste le signal pour converger vers la cible, ce qui peut se comporter un peu comme une légère compression de dynamique sur un enregistrement irrégulier. Pour un enregistrement vocal avec de grands écarts de niveau entre les phrases, un compresseur ou un limiteur dédié appliqué avant la normalisation donne toujours un résultat plus maîtrisé, mais ces étapes dépassent ce qu'audio-volume prend en charge.

Ce que l'annulation de canal central peut faire et ne peut pas faire

vocal-remover applique une technique d'annulation de canal central. Dans un fichier stéréo, un signal présent de façon identique dans les canaux gauche et droit, au même niveau et en phase, est dit centré. Soustraire le canal droit du canal gauche supprime tout ce qui se trouve en position centrale, laissant principalement le contenu panoramisé sur les côtés. C'est ce qui crée l'effet karaoké sur une piste musicale commerciale où les voix principales sont typiquement centrées. Cet outil ne détecte pas les voix par un modèle de reconnaissance vocale. Il ne supprime pas le bruit de fond, la réverbération de pièce, le bourdonnement de ventilation ou le bruit de la circulation. Il n'isole pas la voix du podcast du son ambiant dans un enregistrement mono, où il n'y a pas de différence de phase à exploiter. Le résultat dégrade aussi la largeur stéréo du contenu conservé. Pour une piste de podcast enregistrée dans une pièce bruyante, l'annulation de canal central n'est pas le bon outil. Le traitement acoustique, un microphone directionnel ou un plugin de porte de bruit dans un éditeur audio dédié sont les options adaptées.

Schéma d'un fichier audio stéréo avec les canaux gauche et droit affichés séparément ; le signal centré, identique dans les deux canaux, est soustrait, laissant le contenu panoramisé sur les côtés.

Exporter pour la distribution : format, débit, mono ou stéréo

La plupart des annuaires de podcasts acceptent le MP3 et l'AAC. Le MP3 est le choix le plus compatible ; chaque lecteur et chaque plateforme le prend en charge. L'AAC au même débit est légèrement plus efficace mais nécessite un conteneur adapté comme .m4a. Pour un podcast à une seule voix, 64 kbps en mono MP3 est généralement suffisant : la voix occupe une plage de fréquences étroite, et le mono supprime toute redondance de canal. Si votre émission comporte de la musique, des effets sonores ou plusieurs présentateurs panoramisés, 128 kbps stéréo donne la marge supplémentaire utile. Dépasser 128 kbps pour la voix n'apporte aucune amélioration audible et augmente la taille du fichier, ce qui affecte le temps de téléchargement pour les auditeurs sur des connexions lentes. Un épisode de 60 minutes à 64 kbps mono pèse environ 28 Mo ; à 128 kbps stéréo, environ 56 Mo. Passer en mono avant l'export divise aussi la taille par deux par rapport à la stéréo au même débit. audio-converter gère la sélection du format et du débit. Réglez la fréquence d'échantillonnage à 44,1 kHz pour la compatibilité ; 48 kHz est une convention vidéo qui n'est pas requise pour une distribution audio seule.

En local : aucun fichier ne quitte votre appareil

audio-volume, vocal-remover et audio-converter fonctionnent tous dans le navigateur via WebAssembly. Le traitement audio s'effectue dans la mémoire du navigateur : le fichier est lu depuis votre disque local, traité entièrement sur votre appareil, et le résultat est proposé en téléchargement local. Rien n'est envoyé à un serveur. C'est important pour la production de podcasts lorsque le contenu est sensible : une interview enregistrée avant publication, une conversation sous embargo, ou simplement un enregistrement que vous ne souhaitez pas confier à un serveur tiers. La même contrainte vaut pour les limites : les outils font ce que leur implémentation prend en charge, rien de plus. audio-volume applique gain et normalisation de sonie. vocal-remover applique l'annulation de canal central. audio-converter convertit le format et le débit. Chaque outil fait une chose définie, et le résultat est ce que votre matériel local peut calculer.

Outils mentionnés dans cet article

Questions fréquentes

Qu'est-ce que -16 LUFS et pourquoi est-ce la cible pour les podcasts ?

-16 LUFS est le niveau de sonie intégrée vers lequel la plupart des applications et annuaires de podcasts normalisent à la lecture. Soumettre à -16 LUFS signifie que votre épisode est lu au niveau que vous avez prévu, sans que la plateforme applique de grandes corrections automatiques. La valeur est tirée de la norme ITU-R BS.1770 pour la sonie de diffusion, adaptée par Apple Podcasts et Spotify pour le contenu en voix parlée.

vocal-remover peut-il supprimer le bruit de fond de mon enregistrement de podcast ?

Non. vocal-remover applique l'annulation de canal central, qui soustrait le signal identique dans les deux canaux stéréo. Le bruit de fond d'un enregistrement de podcast n'est pas centré d'une façon que l'annulation pourrait cibler, et les enregistrements mono n'ont aucune différence de canal à exploiter. Pour réduire le bruit de fond, utilisez un traitement acoustique, un microphone directionnel, ou un outil dédié de réduction de bruit dans un éditeur audio.

Dois-je exporter mon podcast en mono ou en stéréo ?

Pour un enregistrement à une seule voix, le mono à 64 kbps MP3 est le choix habituel. Il divise la taille du fichier par deux par rapport à la stéréo au même débit et n'a aucun inconvénient audible pour la parole. Optez pour la stéréo si votre épisode contient de la musique, plusieurs présentateurs délibérément panoramisés, ou une conception sonore qui dépend de la séparation des canaux.