Без завантаження, 100% локально, без облікового запису

Стаття

Очищення та підготовка аудіо для подкасту

Необроблений голосовий запис зазвичай потребує трьох речей перед публікацією: постійний рівень гучності, формат та бітрейт, що очікуються стрімінговими платформами, та чесну оцінку того, що насправді може дати видалення шуму. Ця стаття охоплює ці кроки за допомогою audio-volume, vocal-remover та audio-converter, що працюють локально у браузері.

Гучність проти піку: чому LUFS важливіший за пікове значення

Пікове значення вимірює один найгучніший сэмпл в аудіофайлі. Гучність, виражена в LUFS (одиниці гучності відносно повної шкали), вимірює сприйняту енергію з часом. Подкаст, записаний з піком -3 dBFS, може все одно звучати тихо, якщо більша частина сигналу знаходиться значно нижче. Стрімінгові платформи та каталоги подкастів нормалізують аудіо до цільового рівня гучності при відтворенні, зазвичай -14 LUFS для музичних сервісів та -16 LUFS для розмовного контенту, тому подання при сильно відрізняється рівні означає, що платформа все одно підніме або опустить ваше аудіо. Орієнтація на -16 LUFS інтегрованої гучності дає готовий файл, що відповідає стандарту платформи, залишається узгодженим з іншими шоу та залишає невелике місце для маневру до цифрової стелі при 0 dBFS. Справжній пік, що враховує міжсэмплові перевищення, зазвичай тримається нижче -1 dBTP. Орієнтація на ці два числа разом дає чистіший результат, ніж гонитва лише за піковим значенням.

Людина в навушниках записує подкаст, говорячи в настільний мікрофон перед комп'ютером
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

Посилення та нормалізація за допомогою audio-volume

audio-volume дозволяє регулювати посилення файлу в децибелах або застосовувати нормалізацію гучності. Якщо запис стабільно тихий, додавання посилення в dB підвищує весь сигнал на фіксовану величину. Ризик полягає в кліпінгу: якщо будь-який пік вже знаходиться близько до 0 dBFS, позитивне зміщення посилення перевищить його, вводячи цифрове спотворення. Перевіряйте форму хвилі перед застосуванням посилення і тримайте справжній пік нижче -1 dBFS після налаштування. Нормалізація гучності застосовує інший підхід. Інструмент запускає фільтр loudnorm FFmpeg із типовою ціллю -24 LUFS інтегрованої гучності, а не гучнішими цілями, які рекомендують деякі подкаст-платформи. Одно-прохідний loudnorm - це динамічний процес, а не пласке зміщення посилення: він відстежує гучність у часі і підлаштовує сигнал так, щоб він сходився до цілі, що на нестабільному записі може дещо нагадувати легке стиснення динамічного діапазону. Для голосового запису з великими коливаннями рівня між реченнями окремий компресор або лімітер, застосований перед нормалізацією, усе ж дає більш контрольований результат, але ці кроки виходять за межі того, що обробляє audio-volume.

Що скасування центрального каналу може і не може зробити

vocal-remover застосовує техніку скасування центрального каналу. У стереофайлі сигнал, що з'являється однаково в обох лівому та правому каналах при однаковому рівні та фазі, вважається центрально-панорамованим. Віднімання правого каналу від лівого видаляє все, що знаходиться в цій центральній позиції, залишаючи переважно вміст, панорамований до боків. Це створює ефект «мінус-1», або ефект для пісень без вокалу, на комерційно зведеній музичній доріжці, де провідний вокал зазвичай центрально панорамований. Цей інструмент не виявляє і не відокремлює голоси за допомогою будь-якої моделі мовлення. Він не видаляє фоновий шум, реверберацію приміщення, гул систем вентиляції або трафік. Він не виділяє голос вашого подкасту з навколишнього звуку в одноканальному або монофонічному записі, де немає різниці фаз для використання. Результат також погіршує стереоширину утриманого вмісту. Для доріжки подкасту, записаної в галасливій кімнаті, скасування центрального каналу є неправильним інструментом. Акустична обробка, спрямований мікрофон або гейт-плагін у спеціалізованому аудіоредакторі є практичними варіантами для фонового шуму.

Діаграма стереоаудіофайлу з лівим та правим каналами, показаними окремо; центрально-панорамований сигнал є однаковим в обох каналах і віднімається, залишаючи вміст, панорамований до боків.

Експорт для розповсюдження: формат, бітрейт та моно проти стерео

Більшість каталогів подкастів приймають MP3 та AAC. MP3 є найбільш сумісним вибором; кожен плеєр та платформа підтримує його. AAC при тому самому бітрейті є трохи ефективнішим, але вимагає підтримуваного контейнера, такого як .m4a. Для подкасту з одним голосом 64 kbps моно MP3 зазвичай достатньо: мовлення займає вузький частотний діапазон, і моно усуває будь-яку надлишковість каналів. Якщо у вашому шоу є музика, звукові ефекти або кілька ведучих, панорамованих для ефекту, 128 kbps стерео дає додатковий запас. Підйом вище 128 kbps для мовлення не дає помітного поліпшення і збільшує розмір файлу, що впливає на час завантаження для слухачів із повільними підключеннями. Епізод тривалістю 60 хвилин при 64 kbps моно становить близько 28 МБ; при 128 kbps стерео, приблизно 56 МБ. Зведення до моно перед експортом також вдвічі зменшує дані порівняно зі стерео при тому самому бітрейті. audio-converter обробляє вибір формату та бітрейту. Встановіть частоту дискретизації 44,1 кГц для сумісності; 48 кГц є відеоконвенцією і не потрібна для розповсюдження лише аудіо.

Локальна обробка: жоден файл не покидає ваш пристрій

audio-volume, vocal-remover та audio-converter працюють у браузері за допомогою WebAssembly. Обробка аудіо відбувається всередині пам'яті браузера; файл зчитується з вашого локального диска, обробляється повністю на вашому пристрої, і вивід пропонується як локальне завантаження. Нічого не надсилається на жоден сервер. Це важливо для виробництва подкастів, коли вміст є конфіденційним: інтерв'ю, записане до публікації, розмова під ембарго або просто запис, який ви не хочете бачити на сторонньому сервері. Те саме обмеження стосується і можливостей: інструменти роблять те, що підтримує їхня реалізація, і нічого більше. audio-volume застосовує посилення та нормалізацію гучності. vocal-remover застосовує скасування центрального каналу. audio-converter конвертує формат та бітрейт. Кожен інструмент робить одну визначену річ, і вивід є тим, що може обчислити ваше локальне обладнання.

Інструменти з цієї статті

Поширені запитання

Що таке -16 LUFS і чому це є ціллю для подкастів?

-16 LUFS є рівнем інтегрованої гучності, до якого більшість застосунків та каталогів подкастів нормалізує при відтворенні. Подання при -16 LUFS означає, що ваш епізод відтворюється приблизно на рівні, якого ви очікували, без того, щоб платформа застосовувала великі автоматичні корективи. Значення походить від стандарту ITU-R BS.1770 для гучності мовлення, адаптованого Apple Podcasts та Spotify для розмовного контенту.

Чи може vocal-remover видалити фоновий шум із мого запису подкасту?

Ні. vocal-remover застосовує скасування центрального каналу, яке відніймає сигнал, що є однаковим в обох стереоканалах. Фоновий шум у записі подкасту не є центрально-панорамованим таким чином, що скасування могло б цілитися на нього, а монофонічні записи взагалі не мають різниці каналів для використання. Для зниження фонового шуму використовуйте акустичну обробку, спрямований мікрофон або спеціалізований гейт шуму або інструмент спектрального відновлення в аудіоредакторі.

Чи варто експортувати подкаст у монофонічному чи стереофонічному форматі?

Для одноголосного запису моно при 64 kbps MP3 є стандартним вибором. Він вдвічі зменшує розмір файлу порівняно зі стерео при тому самому бітрейті і не має жодних помітних недоліків для мовлення. Використовуйте стерео, якщо у вашому епізоді є музика, кілька ведучих, навмисно панорамованих, або звуковий дизайн, що залежить від розподілу каналів.