無需上傳, 100% 本機處理, 無需帳戶

文章

清理和準備播客音頻

原始語音錄音在準備發布前通常需要三件事:一致的響度等級、串流平台期望的格式和位元率,以及對噪音去除實際能做到什麼的誠實評估。本文使用在瀏覽器本地執行的 audio-volume、vocal-remover 和 audio-converter 介紹這些步驟。

響度與峰值:為什麼 LUFS 比峰值等級更重要

峰值等級衡量音頻檔案中最響的單個採樣。以 LUFS(相對於滿量程的響度單位)表示的響度衡量隨時間的感知能量。一個峰值為 -3 dBFS 的播客,如果大部分信號遠低於此,聽起來仍然很安靜。串流平台和播客目錄在播放時將音頻標準化到目標響度,音樂服務通常為 -14 LUFS,有聲書籍為 -16 LUFS,因此以非常不同的等級提交意味著平台無論如何都會調高或調低您的音頻。將整合響度目標設定為 -16 LUFS,可以讓您完成的檔案與平台預設相符,與其他節目保持一致,並在 0 dBFS 的數位上限前留有一點空間。真峰值(考慮採樣間過量)通常保持在 -1 dBTP 以下。同時瞄準這兩個數字,比單獨追求峰值目標能產生更乾淨的結果。

一個戴著耳機的人坐在電腦前,對著桌面麥克風錄製播客
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

使用 audio-volume 進行增益和標準化

audio-volume 讓您以分貝為單位調整檔案的增益,或應用響度標準化。如果錄音持續偏安靜,以 dB 為單位增加增益可以將整個信號提升固定量。風險是削峰:如果任何峰值已經接近 0 dBFS,正向增益偏移會將其推過去,引入數位失真。在應用增益之前檢查波形,並在調整後將真峰值保持在 -1 dBFS 以下。響度標準化採取不同的方法。工具會以 FFmpeg 的 loudnorm 濾鏡預設目標 -24 LUFS 整合響度執行,而非某些播客平台建議的更響亮目標。單次處理的 loudnorm 是一個動態過程,而非固定的增益偏移:它會隨時間追蹤響度,並調整訊號以逐漸收斂到目標值,在不一致的錄音上,這可能表現得有點像輕度的動態範圍壓縮。對於句子之間有較大等級波動的語音錄音,在標準化之前套用專用的壓縮器或限制器仍能得到更可控的結果,但這些步驟超出了 audio-volume 的處理範圍。

中央聲道消除能做和不能做什麼

vocal-remover 應用中央聲道消除技術。在立體聲檔案中,以相同等級和相位出現在左右聲道中的信號被稱為中央聲像。從左聲道中減去右聲道會去除位於中央位置的任何內容,主要留下聲像偏向兩側的內容。這就是在商業母版音樂音軌上創造卡拉 OK 效果的原因,因為主唱通常是中央聲像的。它不使用任何語音模型來偵測或分離聲音。它不去除背景噪音、房間混響、暖通空調嗡嗡聲或交通聲。它不能從單聲道或單聲道錄音中分離您的播客聲音,因為沒有可利用的相位差。這種方法也會降低保留內容的立體聲寬度。對於在嘈雜房間錄製的播客音軌,中央聲道消除是錯誤的工具。聲學處理、定向麥克風或專用音頻編輯器中的閘門插件是處理背景噪音的實用選項。

立體聲音頻檔案的圖表,分別顯示左右聲道;中央聲像信號在兩個聲道中相同,被減去後留下側面聲像的內容。

匯出以供發佈:格式、位元率和單聲道與立體聲

大多數播客目錄接受 MP3 和 AAC。MP3 是相容性最廣的選擇;每個播放器和平台都支援它。相同位元率的 AAC 效率略高,但需要 .m4a 等受支援的容器。對於單一聲音的播客,64 kbps 單聲道 MP3 通常足夠:語音佔據窄頻率範圍,而單聲道消除了任何聲道冗餘。如果您的節目有音樂、音效或為了效果而在聲像上分離的多位主持人,128 kbps 立體聲提供額外的空間。對於語音,超過 128 kbps 不會帶來可聽的改善,卻會增加檔案大小,影響網路速度較慢的聽眾的下載時間。一個 60 分鐘的節目在 64 kbps 單聲道時約為 28 MB;在 128 kbps 立體聲時約為 56 MB。在匯出前混縮到單聲道,與相同位元率的立體聲相比可以將資料量減半。audio-converter 處理格式和位元率選擇。將採樣率設置為 44.1 kHz 以確保相容性;48 kHz 是視頻的慣例,純音頻發佈不需要。

在本地完成:沒有任何檔案離開您的裝置

audio-volume、vocal-remover 和 audio-converter 都使用 WebAssembly 在瀏覽器中執行。音頻處理在瀏覽器記憶體中進行;檔案從您的本地磁碟讀取,完全在您的裝置上處理,輸出作為本地下載提供。沒有任何內容傳送到任何伺服器。這對播客製作很重要,當內容敏感時,比如在發布前錄製的訪談、有保密協議的對話,或者您不想放到第三方伺服器上的錄音。同樣的限制適用於工具功能:工具只做其實作所支援的事情,而不更多。audio-volume 應用增益和響度標準化。vocal-remover 應用中央聲道消除。audio-converter 轉換格式和位元率。每個工具做一件定義好的事情,輸出是您的本地硬體能夠計算的任何結果。

本文涉及的工具

常見問題

-16 LUFS 是什麼,為什麼它是播客的目標值?

-16 LUFS 是大多數播客應用程式和目錄在播放時標準化到的整合響度等級。以 -16 LUFS 提交意味著您的節目大致以您預期的等級播放,而無需平台進行大幅自動調整。這個值來自 ITU-R BS.1770 廣播響度標準,由 Apple Podcasts 和 Spotify 為口語內容所採用。

vocal-remover 能去除我播客錄音中的背景噪音嗎?

不能。vocal-remover 應用中央聲道消除,它減去在兩個立體聲聲道中相同的信號。播客錄音中的背景噪音並非以消除技術能夠針對的中央聲像方式存在,而單聲道錄音根本沒有可利用的聲道差異。要降低背景噪音,請使用聲學處理、定向麥克風或音頻編輯器中的專用噪音閘門或頻譜修復工具。

我的播客應該以單聲道還是立體聲匯出?

對於單一聲音的錄音,64 kbps MP3 單聲道是標準選擇。與相同位元率的立體聲相比,它將檔案大小減半,且對語音沒有可聽的缺點。如果您的節目有音樂、多位刻意分聲像的主持人,或依賴聲道分離的聲音設計,請使用立體聲。