無需上傳, 100% 本機處理, 無需帳戶

語音轉文字,於瀏覽器中完成

拖入錄音,取得文字稿。模型從本站下載一次後即在您的裝置上執行,音訊絕不會被上傳。

語音轉文字工具 的運作方式

語音轉文字工具使用 Whisper 這套語音辨識模型,把錄音轉成文字,整個過程透過 Transformers.js,完全在你的瀏覽器分頁中執行。第一次執行時,瀏覽器會從本站下載模型和它需要的 WebAssembly 引擎(總共約 68 MB),然後快取起來;之後每一次轉錄,都在你的裝置上完成,不需要任何伺服器,音訊也絕不會離開你的機器。這和本站的 OCR 與其他音訊工具是同樣的取捨:真正的一次性下載,換來真正的離線處理,而不只是行銷說詞。

這裡用的模型是 whisper-tiny.en:Whisper 家族裡最小、經過量化、僅支援英語的版本。它的速度足以在瀏覽器分頁中執行,也能產出堪用的初稿,但它不是專業的轉錄服務。請預期在專有名詞、專業詞彙、濃重口音、背景噪音和多人交疊發言時會出現錯誤。長度超過大約 30 秒的錄音,會被切成互有重疊的區塊分別處理,確保整份檔案都被轉錄,但一小時的訪談仍然需要真實的運算時間,因為一切都在你自己的裝置上執行,而不是在資料中心的伺服器上。

語音轉文字工具 的分步使用說明

  1. 拖入一個音訊檔案(MP3、WAV、M4A、OGG,或本站語音錄音工具產生的 WebM 錄音)。
  2. 如果這是你在這台裝置上第一次轉錄,請等待引擎與模型完成一次性下載(約 68 MB)。
  3. 選擇輸出格式:純文字(.txt)或含時間戳記的字幕(.srt)。
  4. 按下轉錄,讓 Whisper 完全在你的瀏覽器分頁中處理整段錄音。
  5. 處理完成後,直接複製文字,或下載 .txt/.srt 檔案。

常見使用情境

  • 先取得手機語音備忘錄的粗略文字稿,之後再手動修飾。
  • 把一段簡短的錄音訪談變成可搜尋的文字,而不必上傳到雲端轉錄服務。
  • 為一段短片產生初版的 .srt 字幕檔,之後再進行校正。
  • 用本站的語音錄音工具快速錄一段語音備忘,再於同一個瀏覽器分頁中轉錄。
  • 在不要求完全精確的情況下,快速取得一場演講或會議錄音的初步文字稿。

常見問題

轉錄的準確度如何?

這很大程度取決於音訊品質。清晰、單一講者、靠近麥克風錄製、背景噪音少的英語錄音,轉錄效果相當不錯。口音、多人交談、背景音樂或噪音,以及專業詞彙(人名、術語、縮寫)都會增加錯誤。這是為了能在瀏覽器分頁中執行而選用的小型量化模型,不是 Whisper 系列中最大的模型,所以請把輸出當成值得檢查、修正的實用草稿,而不是最終文字稿。

支援英語以外的語言嗎?

不支援。這個工具使用的是 whisper-tiny.en,也就是僅支援英語的 Whisper 版本,之所以選它,是因為它體積更小,而且在英語上的準確度比多語言版的 tiny 模型更好。其他語言的音訊會產生品質很差、甚至沒有意義的結果。目前還不支援其他語言。

為什麼使用前需要先下載東西?

語音辨識模型和執行它所需的 WebAssembly 引擎(合計約 68 MB),並沒有內建在頁面裡;它們會從本站下載一次,並由瀏覽器快取起來,做法和 OCR 工具下載語言模型類似。第一次下載完成之後,轉錄就會完全離線執行。不會從任何第三方 CDN 抓取任何內容。

我的音訊會被上傳到任何地方嗎?

不會。錄音的解碼與處理,完全在你的瀏覽器分頁中,透過 Web Audio API 和本機的 Whisper 模型完成。音訊檔案和轉錄出的文字,都絕不會被送到伺服器。模型下載完成後,即使中斷網路連線,轉錄依然能正常運作。

轉錄需要多久時間?

這取決於你裝置的 CPU 效能和錄音長度,因為一切都在本機執行,而不是在伺服器硬體上。短片段(一分鐘以內)通常幾秒鐘到不到一分鐘就能完成。較長的錄音,例如一小時的訪談,處理時間會相應拉長,並讓瀏覽器分頁在這段時間內持續忙碌;請保持分頁開啟,處理期間不要切換到其他頁面。

.txt 和 .srt 輸出有什麼差別?

.txt 檔是不含時間戳記的純轉錄文字,適合閱讀或貼到其他地方使用。.srt 檔是標準字幕格式,每一段語音都附有對應的時間戳記範圍,適合為影片加上字幕。兩者都是從同一次轉錄結果產生的,依你接下來要做的事選擇合適的格式即可。