語音轉文字工具 的運作方式
語音轉文字工具使用 Whisper 這套語音辨識模型,把錄音轉成文字,整個過程透過 Transformers.js,完全在你的瀏覽器分頁中執行。第一次執行時,瀏覽器會從本站下載模型和它需要的 WebAssembly 引擎(總共約 68 MB),然後快取起來;之後每一次轉錄,都在你的裝置上完成,不需要任何伺服器,音訊也絕不會離開你的機器。這和本站的 OCR 與其他音訊工具是同樣的取捨:真正的一次性下載,換來真正的離線處理,而不只是行銷說詞。
這裡用的模型是 whisper-tiny.en:Whisper 家族裡最小、經過量化、僅支援英語的版本。它的速度足以在瀏覽器分頁中執行,也能產出堪用的初稿,但它不是專業的轉錄服務。請預期在專有名詞、專業詞彙、濃重口音、背景噪音和多人交疊發言時會出現錯誤。長度超過大約 30 秒的錄音,會被切成互有重疊的區塊分別處理,確保整份檔案都被轉錄,但一小時的訪談仍然需要真實的運算時間,因為一切都在你自己的裝置上執行,而不是在資料中心的伺服器上。