Nessun upload, 100% locale, nessun account

Articolo

Pulire e preparare l'audio per un podcast

Una registrazione vocale grezza di solito ha bisogno di tre cose prima di essere pronta per la pubblicazione: un livello di volume consistente, un formato e un bitrate che le piattaforme di streaming si aspettano e una valutazione onesta di ciò che la rimozione del rumore può effettivamente fornire. Questo articolo copre questi passaggi usando audio-volume, vocal-remover e audio-converter, tutti eseguiti localmente nel browser.

Loudness vs picco: perché LUFS è più importante del livello di picco

Il livello di picco misura il singolo campione più forte in un file audio. Il loudness, espresso in LUFS (Loudness Units relative to Full Scale), misura l'energia percepita nel tempo. Un podcast registrato a -3 dBFS di picco può comunque suonare silenzioso se la maggior parte del segnale è molto più bassa. Le piattaforme di streaming e le directory di podcast normalizzano l'audio a un loudness target durante la riproduzione, tipicamente -14 LUFS per i servizi musicali e -16 LUFS per il parlato, quindi inviare con un livello molto diverso significa che la piattaforma alzerà o abbasserà comunque il volume. Puntare a -16 LUFS di loudness integrato dà un file finito che corrisponde all'impostazione predefinita della piattaforma, rimane coerente con altri programmi e lascia un po' di headroom prima del soffitto digitale a 0 dBFS. Il true peak, che tiene conto degli inter-sample overs, è solitamente mantenuto sotto -1 dBTP. Puntare a questi due numeri insieme dà un risultato più pulito che inseguire solo un target di picco.

Una persona con le cuffie che registra un podcast, parlando in un microfono da tavolo davanti a un computer
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

Guadagno e normalizzazione con audio-volume

audio-volume consente di regolare il guadagno di un file in decibel o di applicare la normalizzazione del loudness. Se una registrazione è costantemente silenziosa, aggiungere guadagno in dB alza l'intero segnale di una quantità fissa. Il rischio è il clipping: se qualsiasi picco è già vicino a 0 dBFS, un offset di guadagno positivo lo spingerà oltre, introducendo distorsione digitale. Controllare la forma d'onda prima di applicare il guadagno e mantenere il true peak sotto -1 dBFS dopo la regolazione. La normalizzazione del loudness adotta un approccio diverso. Lo strumento esegue il filtro loudnorm di FFmpeg al suo target predefinito di -24 LUFS di loudness integrato, anziché ai target più alti raccomandati da alcune piattaforme di podcast. Il loudnorm a singolo passaggio è un processo dinamico, non un offset di guadagno statico: traccia il loudness nel tempo e regola il segnale per convergere verso il target, il che può comportarsi un po' come una leggera compressione della gamma dinamica su una registrazione incostante. Per una registrazione vocale con grandi variazioni di livello tra le frasi, un compressore o un limiter dedicato applicato prima della normalizzazione dà comunque un risultato più controllato, ma questi passaggi vanno oltre ciò che audio-volume gestisce.

Cosa può e non può fare la cancellazione del canale centrale

vocal-remover applica una tecnica di cancellazione del canale centrale. In un file stereo, un segnale che appare identicamente in entrambi i canali sinistro e destro allo stesso livello e fase è detto centrato. Sottrarre il canale destro dal sinistro rimuove tutto ciò che si trova in quella posizione centrale, lasciando principalmente il contenuto panoramizzato ai lati. Questo è ciò che crea l'effetto karaoke su una traccia musicale commercialmente masterizzata dove le voci principali sono tipicamente centrate. Non rileva né separa le voci usando alcun modello di parlato. Non rimuove il rumore di fondo, il riverbero della stanza, il ronzio dell'HVAC o il traffico. Non isola la voce del podcast dal suono ambientale in una registrazione mono o a singolo canale, dove non c'è differenza di fase da sfruttare. Il risultato degrada anche la larghezza stereo del contenuto trattenuto. Per una traccia podcast registrata in una stanza rumorosa, la cancellazione del canale centrale è lo strumento sbagliato. Il trattamento acustico, un microfono direzionale o un plugin gate in un editor audio dedicato sono le opzioni pratiche per il rumore di fondo.

Diagramma di un file audio stereo con i canali sinistro e destro mostrati separatamente; il segnale centrato è identico in entrambi i canali e viene sottratto, lasciando il contenuto panoramizzato ai lati.

Esportazione per la distribuzione: formato, bitrate e mono vs stereo

La maggior parte delle directory di podcast accetta MP3 e AAC. MP3 è la scelta più compatibile; ogni player e piattaforma lo supporta. AAC allo stesso bitrate è leggermente più efficiente ma richiede un contenitore supportato come .m4a. Per un podcast con una singola voce, 64 kbps mono MP3 è generalmente sufficiente: il parlato occupa un intervallo di frequenze stretto e il mono rimuove qualsiasi ridondanza dei canali. Se il programma ha musica, effetti sonori o più host panoramizzati per effetto, 128 kbps stereo dà l'headroom aggiuntivo. Andare oltre 128 kbps per il parlato non dà alcun miglioramento udibile e aumenta le dimensioni del file, il che influisce sui tempi di download per gli ascoltatori con connessioni lente. Un episodio di 60 minuti a 64 kbps mono è circa 28 MB; a 128 kbps stereo è circa 56 MB. Il mixdown in mono prima dell'esportazione dimezza anche i dati rispetto allo stereo allo stesso bitrate. audio-converter gestisce la selezione del formato e del bitrate. Impostare la frequenza di campionamento a 44,1 kHz per la compatibilità; 48 kHz è una convenzione video e non è richiesta per la distribuzione solo audio.

Farlo localmente: nessun file lascia il dispositivo

audio-volume, vocal-remover e audio-converter funzionano tutti nel browser usando WebAssembly. L'elaborazione audio avviene nella memoria del browser; il file viene letto dal disco locale, elaborato interamente sul dispositivo e l'output viene offerto come download locale. Niente viene inviato a nessun server. Questo è importante per la produzione di podcast quando il contenuto è sensibile: un'intervista registrata prima della pubblicazione, una conversazione sotto embargo o semplicemente una registrazione che non si vuole su un server di terze parti. Lo stesso vincolo si applica alle limitazioni: gli strumenti fanno ciò che la loro implementazione supporta, non di più. audio-volume applica guadagno e normalizzazione del loudness. vocal-remover applica la cancellazione del canale centrale. audio-converter converte formato e bitrate. Ogni strumento fa una cosa definita e l'output è ciò che l'hardware locale può calcolare.

Strumenti citati in questo articolo

Domande frequenti

Cos'è -16 LUFS e perché è il target per i podcast?

-16 LUFS è il livello di loudness integrato a cui la maggior parte delle app di podcast e le directory normalizzano durante la riproduzione. Inviare a -16 LUFS significa che l'episodio viene riprodotto approssimativamente al livello previsto senza che la piattaforma applichi grandi correzioni automatiche. Il valore deriva dallo standard ITU-R BS.1770 per il loudness della trasmissione, adattato da Apple Podcasts e Spotify per i contenuti a parola.

vocal-remover può rimuovere il rumore di fondo dalla mia registrazione podcast?

No. vocal-remover applica la cancellazione del canale centrale, che sottrae il segnale identico in entrambi i canali stereo. Il rumore di fondo in una registrazione podcast non è centrato in modo che la cancellazione possa prenderlo di mira, e le registrazioni mono non hanno differenze di canale da sfruttare. Per la riduzione del rumore di fondo, usare il trattamento acustico, un microfono direzionale o un noise gate dedicato o uno strumento di riparazione spettrale in un editor audio.

Dovrei esportare il mio podcast in mono o stereo?

Per una registrazione a voce singola, il mono a 64 kbps MP3 è la scelta standard. Dimezza le dimensioni del file rispetto allo stereo allo stesso bitrate e non ha svantaggi udibili per il parlato. Usare lo stereo se l'episodio ha musica, più host deliberatamente panoramizzati o sound design che dipende dalla separazione dei canali.