Статья
Очистка и подготовка аудио для подкаста
Необработанная голосовая запись обычно нуждается в трёх вещах перед публикацией: постоянном уровне громкости, формате и битрейте, ожидаемых стриминговыми платформами, и честной оценке того, что реально может дать шумоподавление. Эта статья охватывает эти шаги с использованием audio-volume, vocal-remover и audio-converter, работающих локально в браузере.
Громкость и пиковый уровень: почему LUFS важнее пикового уровня
Пиковый уровень измеряет единственный наиболее громкий образец в аудиофайле. Громкость, выраженная в LUFS (единицы громкости относительно полной шкалы), измеряет воспринимаемую энергию за время. Подкаст, записанный при пиковом уровне -3 dBFS, всё равно может звучать тихо, если большая часть сигнала значительно ниже. Стриминговые платформы и директории подкастов нормализуют аудио до целевой громкости при воспроизведении, обычно -14 LUFS для музыкальных сервисов и -16 LUFS для разговорного контента, поэтому отправка с очень отличающимся уровнем означает, что платформа всё равно увеличит или уменьшит ваше аудио. Целевой интегральный уровень громкости -16 LUFS даёт готовый файл, соответствующий стандарту платформы, согласующийся с другими передачами и оставляющий небольшой запас до цифрового потолка 0 dBFS. Истинный пик, учитывающий межвыборочные превышения, обычно держат ниже -1 dBTP. Совместное достижение этих двух чисел даёт более чистый результат, чем погоня только за пиковым значением.

Усиление и нормализация с audio-volume
audio-volume позволяет регулировать усиление файла в децибелах или применять нормализацию громкости. Если запись постоянно тихая, добавление усиления в дБ поднимает весь сигнал на фиксированную величину. Риск: клиппинг, если какой-либо пик уже близок к 0 dBFS, положительное смещение усиления выведет его за предел, вводя цифровое искажение. Проверьте форму волны перед применением усиления и держите истинный пик ниже -1 dBFS после регулировки. Нормализация громкости использует другой подход. Инструмент запускает фильтр loudnorm из FFmpeg с целевым значением по умолчанию -24 LUFS интегральной громкости, а не с более громкими целями, которые рекомендуют некоторые подкаст-платформы. Однопроходный loudnorm это динамический процесс, а не плоское смещение усиления: он отслеживает громкость во времени и подстраивает сигнал так, чтобы сойтись к цели, что на неровной записи может немного напоминать лёгкую компрессию динамического диапазона. Для голосовой записи с большими перепадами уровня между фразами отдельный компрессор или лимитер, применённый перед нормализацией, всё равно даст более управляемый результат, но эти шаги выходят за рамки возможностей audio-volume.
Что центрально-канальное подавление может и не может делать
vocal-remover применяет технику центрально-канального подавления. В стереофайле сигнал, одинаково появляющийся в обоих левом и правом каналах на одном уровне и в одной фазе, считается центрально-панорамированным. Вычитание правого канала из левого удаляет всё, находящееся в этой центральной позиции, оставляя преимущественно контент, панорамированный по сторонам. Это создаёт эффект «минусовки» на профессионально сведённой музыкальной дорожке, где ведущий вокал обычно панорамирован по центру. Инструмент не обнаруживает и не разделяет голоса с помощью какой-либо модели речи. Он не удаляет фоновый шум, реверберацию помещения, гул вентиляции или уличный шум. Он не изолирует голос подкаста от фонового звука в однополосной или моно-записи, где нет разности фаз для использования. Результат также ухудшает стереоширину сохранённого контента. Для дорожки подкаста, записанной в шумном помещении, центрально-канальное подавление, неподходящий инструмент. Акустическая обработка, направленный микрофон или плагин шумопоглощения в специализированном аудиоредакторе, практические варианты для работы с фоновым шумом.

Экспорт для дистрибуции: формат, битрейт и моно против стерео
Большинство директорий подкастов принимают MP3 и AAC. MP3, наиболее совместимый выбор: каждый плеер и платформа его поддерживают. AAC при том же битрейте немного эффективнее, но требует поддерживаемого контейнера, такого как .m4a. Для подкаста с одним голосом 64 kbps моно MP3 обычно достаточно: речь занимает узкий частотный диапазон, а моно устраняет избыточность каналов. Если в вашей передаче есть музыка, звуковые эффекты или несколько ведущих, панорамированных для эффекта, 128 kbps стерео даёт дополнительный запас. Использование более 128 kbps для речи не даёт слышимого улучшения и увеличивает размер файла, что влияет на время загрузки для слушателей на медленных соединениях. 60-минутный выпуск при 64 kbps моно занимает около 28 МБ, при 128 kbps стерео, примерно 56 МБ. Сведение в моно перед экспортом также вдвое уменьшает данные по сравнению со стерео при том же битрейте. audio-converter обрабатывает выбор формата и битрейта. Установите частоту дискретизации 44,1 кГц для совместимости; 48 кГц, это видеоконвенция, не требуемая для аудиораспространения.
Работа локально: ни один файл не покидает ваше устройство
audio-volume, vocal-remover и audio-converter работают в браузере с использованием WebAssembly. Обработка аудио происходит внутри памяти браузера: файл считывается с вашего локального диска, полностью обрабатывается на вашем устройстве, и результат предлагается для локального скачивания. Ничего не отправляется ни на какой сервер. Это важно для производства подкастов, когда контент является конфиденциальным: интервью, записанное до публикации, разговор под эмбарго или просто запись, которую вы не хотите видеть на стороннем сервере. То же ограничение касается возможностей: инструменты делают то, что поддерживает их реализация, не больше. audio-volume применяет усиление и нормализацию громкости. vocal-remover применяет центрально-канальное подавление. audio-converter конвертирует формат и битрейт. Каждый инструмент делает одно определённое действие, и результат, то, что ваше локальное оборудование может вычислить.
Инструменты из этой статьи
- Громкость аудиоУвеличьте, уменьшите или нормализуйте громкость аудио в браузере. Без загрузки на сервер.
- Удаление вокала (караоке)Уберите центральный вокал, чтобы сделать караоке-дорожку, в браузере. Без загрузки.
- Конвертер аудиоКонвертируйте аудио в MP3, WAV или AAC прямо в браузере. Без загрузки.
- Объединить аудиофайлыСоедините несколько аудиофайлов (MP3, WAV, M4A, OGG…) в один. Перетаскивайте для изменения порядка. Без загрузки.
Частые вопросы
Что такое -16 LUFS и почему это целевой уровень для подкастов?
-16 LUFS, это уровень интегральной громкости, до которого большинство приложений и директорий подкастов нормализуют при воспроизведении. Отправка на уровне -16 LUFS означает, что ваш выпуск воспроизводится примерно на том уровне, который вы задумали, без крупных автоматических корректировок со стороны платформы. Значение происходит от стандарта ITU-R BS.1770 для громкости вещания, адаптированного Apple Podcasts и Spotify для разговорного контента.
Может ли vocal-remover убрать фоновый шум из записи подкаста?
Нет. vocal-remover применяет центрально-канальное подавление, которое вычитает сигнал, идентичный в обоих стереоканалах. Фоновый шум в записи подкаста не панорамирован по центру так, чтобы подавление могло его нацелить, а в монозаписях вообще нет разности каналов для использования. Для подавления фонового шума используйте акустическую обработку, направленный микрофон или специализированный шумопоглощающий или инструмент спектрального восстановления в аудиоредакторе.
Экспортировать подкаст в моно или стерео?
Для записи с одним голосом моно при 64 kbps MP3, стандартный выбор. Он вдвое уменьшает размер файла по сравнению со стерео при том же битрейте и не имеет слышимых недостатков для речи. Используйте стерео, если в вашем выпуске есть музыка, несколько ведущих, намеренно панорамированных, или звуковой дизайн, зависящий от разделения каналов.