Så fungerar Ljudtranskribering · tal till text
Ljudtranskribering omvandlar en inspelning till text med hjälp av Whisper, en taligenkänningsmodell som körs helt i din webbläsarflik via Transformers.js. Första gången du använder den laddar din webbläsare ner modellen och den WebAssembly-motor den behöver från den här webbplatsen (totalt cirka 68 MB) och cachar dem; därefter sker varje transkribering på din enhet, utan någon server, och ljudet lämnar aldrig din dator.
Modellen som används här är whisper-tiny.en: den minsta, kvantiserade Whisper-varianten som bara gäller engelska. Den är snabb nog att köra i en webbläsarflik och ger ett användbart första utkast, men är ingen professionell transkriberingstjänst. Förvänta dig fel i egennamn, tekniskt ordförråd, starka accenter, bakgrundsljud och överlappande talare.