無需上傳, 100% 本機處理, 無需帳戶

文章

為轉錄放慢音頻速度

語速過快、不熟悉的口音和多個重疊的聲音是轉錄停滯的三個主要原因。放慢錄音速度可以爭取更多時間捕捉所說的內容。問題是,簡單的播放速度降低也會降低每個聲音的音高,這反而使語音更難聽懂。本文解釋簡單速度降低與保留音高的時間拉伸之間的區別,並介紹實際上有效的實用速度範圍。

為什麼放慢有幫助

人類語音在短暫的時間窗口內攜帶大量信息。語速快的人每分鐘可以說出 200 個或更多的詞,在這個速度下,耳朵幾乎沒有時間在下一個音節到來之前辨別個別音素。放慢音頻讓大腦每個音節有更多的處理時間,這在三種情況下最為重要:說話者的口音不熟悉,其音素映射與您預期的不同;密集的技術段落,每個詞都攜帶意義,一次聽錯就會產生錯誤的術語;以及錄音中有兩個或更多重疊聲音,耳朵必須同時追蹤多個流。在所有三種情況下,目標不是聽到原本沒有的內容,而是讓自己有足夠的時間準確地聽到已經錄製的內容。0.75x 的播放速度對口音或密集段落通常已經足夠。0.5x 的速度對於前幾次聽過仍無法辨清的短段落很有用。

波形顯示,展示一段語音,時間軸水平拉伸以表示較慢的播放速度,音節邊界以波峰和波谷形式可見

速度與音高:為什麼簡單的放慢不奏效

放慢音頻最簡單的方法是以低於錄製速率的速率回放採樣。舊式磁帶錄音機就是這樣放慢的:更慢地轉動磁帶,時長和音高一起下降。在 0.75x 時,聲音下降約小三度。在 0.5x 時,下降整整一個八度。結果是我們熟悉的緩慢、低沉的失真,使語音聽起來不自然,反而更難理解,因為區分母音的共振峰頻率都下移了。正確的方法是時間拉伸:在不改變頻率的情況下改變音頻的時長。每個聲音的音高保持不變;只有音節到達的速率發生變化。這是 audio-speed 工具和大多數專用轉錄軟體使用的方法。感知上的結果是,放慢的錄音聽起來像是同一個說話者以較慢的速度說話,這正是以準確轉錄為目標時所需要的。

時間拉伸的工作原理:atempo 方法

在實用音頻工具中,最廣泛使用的時間拉伸演算法基於相位聲碼器,其在 ffmpeg 中的常見實作是 atempo 濾波器。輸入音頻被分割成短小的重疊幀,通常每幀 20 到 40 毫秒。演算法分析相鄰幀之間的相位關係,然後以修改後的速率合成新幀,同時調整相位使連續幀正確對齊。結果是一個連續的輸出信號,其時長已改變但頻率內容沒有改變。由於幀相對於人聲的典型音高週期較短,語音的基礎頻率在拉伸過程中得以保留。這個演算法的一個副作用是,當拉伸幅度較大時,快速瞬態(如輔音的點擊聲)可能略微模糊,因為幀重疊合成引入了少量平均。這不是實作上的缺陷;這是重疊相加演算法族的固有特性。

重疊相加時間拉伸過程的圖表:左側為輸入音頻幀,中間為重疊合成幀,右側為拉伸後的輸出波形

實用速度範圍與品質限制

對於轉錄工作,兩個速度值可以涵蓋大多數實際需求。在 0.75x 時,語音被拉伸到其原始時長的 133%。輔音群和快速母音過渡變得更容易分離,且變化小到演算法幾乎不引入可感知的偽影。大多數聽眾可以在這個速度下跟上語音,而不失去句子的自然節奏。在 0.5x 時,音頻被拉伸到其原始長度的兩倍。這對單個句子或短暫困難的段落很有用,但對於連續幾分鐘的聆聽來說太慢了;注意力在詞語被辨清之前就會下降。低於 0.5x,輸出品質明顯下降。重疊相加合成開始在持續母音上引入顫音或相位感,而在輔音和母音之間攜帶韻律的時序提示也會失真。ffmpeg 中的 atempo 濾波器對單次通道設置了 0.5x 的最小值,這反映了這個品質限制。低於 0.5x 的值需要串聯兩次通道,偽影水平也會相應上升。對於幾乎所有的轉錄使用情況,在 0.75x 或對短段落最多 0.5x 下操作可以產生乾淨、可用的輸出。

使用 audio-speed 工具在本地完成

本網站的 audio-speed 工具使用編譯為 WebAssembly 的 ffmpeg,完全在瀏覽器中執行。您將音頻檔案拖放到頁面上,設定速度倍數,處理就在您的裝置上進行。錄音在任何時刻都不離開您的機器:沒有上傳、沒有伺服器、沒有第三方服務。這對於錄製的對話、訪談、醫療口述、法律程序,以及任何其他音頻內容敏感的情況都很重要。該工具接受 ffmpeg 處理的常見音頻格式,包括 MP3、WAV、M4A、OGG 和 FLAC。輸出是一個以您選擇的速度可供下載的檔案。由於處理在本地執行,所需時間取決於檔案的長度和您裝置的速度。在現代筆記型電腦上,幾分鐘的音頻通常在不到一分鐘內處理完畢。工具使用本文所述的相同 atempo 濾波器,因此上述品質特性直接適用於您在輸出中聽到的內容。

本文涉及的工具

常見問題

放慢音頻也會改變音高嗎?

這取決於方法。簡單的播放速率降低確實會改變音高:在 0.5x 時,聲音下降整整一個八度。audio-speed 工具使用時間拉伸(atempo 濾波器),可以在不改變音高的情況下改變時長,因此聲音保持其原始頻率。

仍然聽起來乾淨的最慢速度是多少?

在 0.75x 時,大多數錄音的輸出是乾淨的。在 0.5x 時,對短段落是可接受的。低於 0.5x,重疊相加演算法開始在持續母音和輔音過渡上引入可聽的偽影。對於轉錄工作,保持在 0.5x 或以上可以獲得最佳結果。

使用 audio-speed 工具時,檔案會被上傳嗎?

不會。audio-speed 工具完全在瀏覽器中執行。檔案使用 WebAssembly 在您的裝置上本地處理。沒有任何內容傳送到任何伺服器,因此您的錄音內容保持私密。