无需上传, 100% 本地处理, 无需账户

文章

为播客清理和准备音频

原始人声录音在发布前通常需要三件事:一致的响度水平、流媒体平台期望的格式和码率,以及对噪音消除实际效果的客观评估。本文使用 audio-volume、vocal-remover 和 audio-converter 介绍这些步骤,所有工具均在浏览器中本地运行。

响度与峰值:为什么 LUFS 比峰值水平更重要

峰值水平测量音频文件中最响的单个采样。响度以 LUFS(相对于满量程的响度单位)表示,测量的是随时间感知的能量。峰值为 -3 dBFS 的播客录音仍然可能听起来很安静,如果大部分信号处于远低于此的水平。流媒体平台和播客目录会在播放时将音频归一化到目标响度,通常音乐服务为 -14 LUFS,语音内容为 -16 LUFS,因此以差异很大的水平提交意味着平台无论如何都会调高或降低您的音频音量。以 -16 LUFS 的整合响度为目标,可以产生与平台默认值匹配、与其他节目保持一致、并在 0 dBFS 的数字上限前留有少量余量的成品文件。真实峰值(考虑采样间过冲)通常保持在 -1 dBTP 以下。同时追求这两个数值,比单独追求峰值目标能获得更干净的结果。

一个戴着耳机的人坐在电脑前,对着桌面麦克风录制播客
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

使用 audio-volume 进行增益和归一化

audio-volume 允许您以分贝为单位调整文件增益,或进行响度归一化。如果录音整体偏安静,增加分贝增益会将整个信号提高固定量。风险是削波:如果任何峰值已接近 0 dBFS,正增益偏移会将其推过上限,引入数字失真。应用增益前检查波形,并在调整后将真实峰值保持在 -1 dBFS 以下。响度归一化采用不同的方法。工具运行 FFmpeg 的 loudnorm 滤镜,默认目标为 -24 LUFS 整合响度,而不是一些播客平台推荐的更响目标。单次通过的 loudnorm 是一个动态过程,而不是一次性的固定增益偏移:它会随时间跟踪响度,并调整信号使其收敛到目标值,这在电平不一致的录音上,效果有点类似轻度的动态范围压缩。对于句子之间电平波动较大的人声录音,归一化前先使用专门的压缩器或限制器仍能获得更可控的结果,但这些步骤超出了 audio-volume 的处理范围。

中央通道抵消能做什么和不能做什么

vocal-remover 应用的是中央通道抵消技术。在立体声文件中,以相同电平和相位出现在左声道和右声道的信号被称为居中声像。从左声道减去右声道,可以去除居中位置的任何内容,留下主要偏向两侧的内容。这就是在商业母带音乐曲目上产生卡拉OK效果的原理,通常主唱人声居中声像。它不使用任何语音模型来检测或分离声音。它不能去除背景噪音、房间混响、空调嗡嗡声或交通噪音。在没有相位差可以利用的单声道或单通道录音中,它也无法将您的播客声音从环境声中分离出来。抵消操作还会降低保留内容的立体声宽度。对于在嘈杂房间中录制的播客轨道,中央通道抵消是错误的工具。声学处理、指向性麦克风或专用音频编辑器中的噪声门插件才是处理背景噪音的实用选择。

立体声音频文件示意图,分别显示左右声道;居中声像的信号在两个通道中相同,被减去后,留下偏向两侧的内容。

为分发导出:格式、码率以及单声道与立体声

大多数播客目录接受 MP3 和 AAC。MP3 是兼容性最广的选择;每种播放器和平台都支持它。相同码率下 AAC 效率略高,但需要 .m4a 等支持的容器。对于单人语音播客,64 kbps 单声道 MP3 通常足够:语音占据的频率范围较窄,单声道消除了通道冗余。如果节目有音乐、音效或为效果而声像分离的多位主播,128 kbps 立体声可提供额外余量。超过 128 kbps 的语音内容在听感上没有改善,但会增加文件大小,影响慢速连接用户的下载时间。60 分钟节目以 64 kbps 单声道约 28 MB;以 128 kbps 立体声约 56 MB。导出前混音为单声道,与相同码率的立体声相比数据量减半。audio-converter 处理格式和码率选择。为兼容性将采样率设置为 44.1 kHz;48 kHz 是视频惯例,纯音频分发不需要。

在本地完成:文件不离开您的设备

audio-volume、vocal-remover 和 audio-converter 都使用 WebAssembly 在浏览器中运行。音频处理在浏览器内存中进行;文件从本地磁盘读取,完全在您的设备上处理,输出作为本地下载提供。不向任何服务器发送任何内容。当内容敏感时,这对播客制作非常重要,例如发布前录制的采访、受禁止令约束的对话,或您不希望存放在第三方服务器上的录音。同样的限制也适用于功能边界:工具只做其实现所支持的事情,不多不少。audio-volume 应用增益和响度归一化。vocal-remover 应用中央通道抵消。audio-converter 转换格式和码率。每个工具做一件明确的事,输出取决于您本地硬件的计算能力。

本文涉及的工具

常见问题

什么是 -16 LUFS,为什么它是播客目标值?

-16 LUFS 是大多数播客应用和目录在播放时归一化到的整合响度水平。以 -16 LUFS 提交意味着您的节目以您预期的大致音量播放,而平台不需要进行大幅自动校正。该值来自 ITU-R BS.1770 广播响度标准,由 Apple Podcasts 和 Spotify 针对语音内容加以采用。

vocal-remover 能消除我播客录音中的背景噪音吗?

不能。vocal-remover 应用中央通道抵消,减去两个立体声通道中相同的信号。播客录音中的背景噪音不是以抵消可以针对的方式居中声像的,单声道录音完全没有可以利用的通道差异。要减少背景噪音,请使用声学处理、指向性麦克风,或音频编辑器中的专用噪声门或频谱修复工具。

我的播客应该导出单声道还是立体声?

对于单人语音录音,64 kbps MP3 单声道是标准选择。与相同码率的立体声相比,文件大小减半,语音内容没有可听见的缺陷。如果节目有音乐、特意声像分离的多位主播或依赖通道分离的音效设计,则使用立体声。