Jak Přepis zvuku · řeč na text funguje
Přepis zvuku převádí nahrávku na text pomocí Whisper, modelu pro rozpoznávání řeči, který běží celý na kartě tvého prohlížeče díky Transformers.js. Při prvním spuštění si prohlížeč z tohoto webu stáhne model a potřebný WebAssembly engine (celkem asi 68 MB) a uloží je do mezipaměti; poté každý přepis probíhá na tvém zařízení, bez serveru a bez toho, aby zvuk kdy opustil tvůj počítač.
Použitý model je whisper-tiny.en: nejmenší, kvantizovaná varianta Whisper omezená na angličtinu. Je dost rychlá na to, aby běžela v kartě prohlížeče, a vytváří užitečný první koncept, ale není to profesionální přepisovací služba. Očekávej chyby ve vlastních jménech, odborné slovní zásobě, výrazném přízvuku, hluku na pozadí a překrývajících se hlasech.