Tanpa unggah, 100% lokal, tanpa akun

Artikel

Membersihkan dan menyiapkan audio untuk podcast

Rekaman suara mentah biasanya memerlukan tiga hal sebelum siap dipublikasikan: tingkat kenyaringan yang konsisten, format dan bitrate yang diharapkan platform streaming, dan penilaian jujur tentang apa yang sebenarnya dapat dilakukan oleh penghilangan noise. Artikel ini membahas langkah-langkah tersebut menggunakan audio-volume, vocal-remover, dan audio-converter, semuanya berjalan secara lokal di browser.

Kenyaringan vs puncak: mengapa LUFS lebih penting dari level puncak

Level puncak mengukur sampel paling keras tunggal dalam file audio. Kenyaringan, yang dinyatakan dalam LUFS (Loudness Units relative to Full Scale), mengukur energi yang dirasakan dari waktu ke waktu. Podcast yang direkam pada puncak -3 dBFS masih bisa terdengar pelan jika sebagian besar sinyal berada jauh lebih rendah. Platform streaming dan direktori podcast menormalkan audio ke target kenyaringan saat pemutaran, biasanya -14 LUFS untuk layanan musik dan -16 LUFS untuk kata-kata yang diucapkan, sehingga mengirimkan pada level yang sangat berbeda berarti platform akan memutar audio Anda lebih keras atau lebih pelan. Menargetkan kenyaringan terintegrasi -16 LUFS memberi Anda file jadi yang cocok dengan default platform, konsisten dengan acara lain, dan meninggalkan sedikit headroom sebelum plafon digital pada 0 dBFS. True peak, yang memperhitungkan inter-sample overs, biasanya dijaga di bawah -1 dBTP. Membidik dua angka ini bersama-sama memberikan hasil yang lebih bersih daripada mengejar target puncak saja.

Seseorang yang mengenakan headphone merekam podcast, berbicara ke mikrofon meja di depan komputer
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

Gain dan normalisasi dengan audio-volume

audio-volume memungkinkan Anda menyesuaikan gain file dalam desibel atau menerapkan normalisasi kenyaringan. Jika rekaman secara konsisten pelan, menambahkan gain dalam dB meningkatkan seluruh sinyal dengan jumlah tetap. Risikonya adalah clipping: jika puncak mana pun sudah duduk dekat 0 dBFS, offset gain positif akan mendorongnya melewati batas, menimbulkan distorsi digital. Periksa bentuk gelombang sebelum menerapkan gain, dan jaga true peak di bawah -1 dBFS setelah penyesuaian. Normalisasi kenyaringan mengambil pendekatan berbeda. Tool menjalankan filter loudnorm FFmpeg pada target bawaannya, -24 LUFS kenyaringan terintegrasi, bukan target yang lebih keras yang direkomendasikan beberapa platform podcast. Loudnorm single-pass adalah proses dinamis, bukan offset gain datar: alat ini melacak kenyaringan seiring waktu dan menyesuaikan sinyal agar mendekati target, yang bisa berperilaku sedikit seperti kompresi rentang dinamis ringan pada rekaman yang tidak konsisten. Untuk rekaman suara dengan ayunan level yang besar antar kalimat, kompresor atau limiter khusus yang diterapkan sebelum normalisasi tetap memberikan hasil yang lebih terkontrol, tetapi langkah-langkah tersebut berada di luar apa yang ditangani audio-volume.

Apa yang dapat dan tidak dapat dilakukan oleh pembatalan saluran tengah

vocal-remover menerapkan teknik pembatalan saluran tengah. Dalam file stereo, sinyal yang muncul identik di saluran kiri dan kanan pada level dan fase yang sama dikatakan center-panned. Mengurangkan saluran kanan dari kiri menghapus semua yang duduk di posisi tengah itu, meninggalkan sebagian besar konten yang dipanning ke sisi. Inilah yang menciptakan efek karaoke pada trek musik yang dikuasai secara komersial di mana vokal utama biasanya center-panned. Ini tidak mendeteksi atau memisahkan suara menggunakan model ucapan apa pun. Ini tidak menghilangkan noise latar belakang, reverb ruangan, dengungan HVAC, atau lalu lintas. Ini tidak mengisolasi suara podcast Anda dari suara ambien dalam rekaman mono atau satu saluran, di mana tidak ada perbedaan fase yang dapat dieksploitasi. Hasilnya juga menurunkan lebar stereo pada konten yang dipertahankan. Untuk trek podcast yang direkam di ruangan yang berisik, pembatalan saluran tengah adalah alat yang salah. Perlakuan akustik, mikrofon terarah, atau plugin gate dalam editor audio khusus adalah opsi praktis untuk noise latar belakang.

Diagram file audio stereo dengan saluran kiri dan kanan ditampilkan secara terpisah; sinyal center-panned identik di kedua saluran dan dikurangkan, meninggalkan konten side-panned.

Mengekspor untuk distribusi: format, bitrate, dan mono vs stereo

Sebagian besar direktori podcast menerima MP3 dan AAC. MP3 adalah pilihan yang paling kompatibel; setiap pemutar dan platform mendukungnya. AAC pada bitrate yang sama sedikit lebih efisien tetapi memerlukan kontainer yang didukung seperti .m4a. Untuk podcast suara tunggal, 64 kbps mono MP3 umumnya sudah cukup: ucapan menempati rentang frekuensi yang sempit, dan mono menghilangkan redundansi saluran. Jika acara Anda memiliki musik, efek suara, atau beberapa pembawa yang dipanning untuk efek, 128 kbps stereo memberikan headroom tambahan. Melebihi 128 kbps untuk ucapan tidak memberikan peningkatan yang terdengar dan meningkatkan ukuran file, yang memengaruhi waktu unduhan bagi pendengar dengan koneksi lambat. Episode 60 menit pada 64 kbps mono sekitar 28 MB; pada 128 kbps stereo sekitar 56 MB. Mencampurkan ke mono sebelum ekspor juga mengurangi data menjadi setengah dibandingkan stereo pada bitrate yang sama. audio-converter menangani pemilihan format dan bitrate. Atur sample rate ke 44,1 kHz untuk kompatibilitas; 48 kHz adalah konvensi video dan tidak diperlukan untuk distribusi khusus audio.

Melakukannya secara lokal: tidak ada file yang meninggalkan perangkat Anda

audio-volume, vocal-remover, dan audio-converter semuanya berjalan di browser menggunakan WebAssembly. Pemrosesan audio terjadi di dalam memori browser; file dibaca dari disk lokal Anda, diproses sepenuhnya di perangkat Anda, dan output ditawarkan sebagai unduhan lokal. Tidak ada yang dikirim ke server mana pun. Ini penting untuk produksi podcast ketika kontennya sensitif, wawancara yang direkam sebelum publikasi, percakapan di bawah embargo, atau sekadar rekaman yang tidak ingin Anda simpan di server pihak ketiga. Kendala yang sama berlaku untuk keterbatasan: tool melakukan apa yang didukung implementasinya, tidak lebih. audio-volume menerapkan gain dan normalisasi kenyaringan. vocal-remover menerapkan pembatalan saluran tengah. audio-converter mengonversi format dan bitrate. Setiap tool melakukan satu hal yang ditentukan, dan output adalah apa pun yang dapat dihitung oleh perangkat keras lokal Anda.

Alat dalam artikel ini

Pertanyaan yang sering diajukan

Apa itu -16 LUFS dan mengapa itu menjadi target podcast?

-16 LUFS adalah level kenyaringan terintegrasi yang dinormalkan oleh sebagian besar aplikasi dan direktori podcast saat pemutaran. Mengirimkan pada -16 LUFS berarti episode Anda diputar pada level yang kurang lebih seperti yang Anda inginkan tanpa platform menerapkan koreksi otomatis yang besar. Nilai ini berasal dari standar ITU-R BS.1770 untuk kenyaringan siaran, yang diadaptasi oleh Apple Podcasts dan Spotify untuk konten kata-kata yang diucapkan.

Bisakah vocal-remover menghilangkan noise latar belakang dari rekaman podcast saya?

Tidak. vocal-remover menerapkan pembatalan saluran tengah, yang mengurangkan sinyal yang identik di kedua saluran stereo. Noise latar belakang dalam rekaman podcast tidak center-panned dengan cara yang dapat ditargetkan oleh pembatalan, dan rekaman mono tidak memiliki perbedaan saluran untuk dieksploitasi sama sekali. Untuk pengurangan noise latar belakang, gunakan perlakuan akustik, mikrofon terarah, atau noise gate atau tool perbaikan spektral khusus dalam editor audio.

Haruskah saya mengekspor podcast dalam mono atau stereo?

Untuk rekaman suara tunggal, mono pada 64 kbps MP3 adalah pilihan standar. Ukuran file berkurang setengah dibandingkan stereo pada bitrate yang sama dan tidak ada kekurangan yang terdengar untuk ucapan. Gunakan stereo jika episode Anda memiliki musik, beberapa pembawa yang sengaja dipanning, atau desain suara yang bergantung pada pemisahan saluran.