Jak działa Transkrypcja audio · mowa na tekst
Transkrypcja audio zamienia nagranie na tekst za pomocą Whisper, modelu rozpoznawania mowy, który działa całkowicie w karcie przeglądarki dzięki Transformers.js. Za pierwszym razem przeglądarka pobiera z tej strony model i potrzebny silnik WebAssembly (łącznie około 68 MB) i zapisuje je w pamięci podręcznej; później każda transkrypcja odbywa się na twoim urządzeniu, bez serwera i bez wysyłania dźwięku poza twój komputer.
Użyty tu model to whisper-tiny.en: najmniejszy, skwantyzowany wariant Whisper ograniczony do języka angielskiego. Jest wystarczająco szybki, by działać w karcie przeglądarki, i daje użyteczny pierwszy szkic, ale nie jest profesjonalną usługą transkrypcji. Spodziewaj się błędów w nazwach własnych, słownictwie technicznym, silnych akcentach, szumie tła i nakładających się głosach.