Cum funcționează Transcriere audio · vorbire în text
Transcriere Audio transformă o înregistrare în text folosind Whisper, un model de recunoaștere vocală care rulează în întregime în fila browserului tău prin Transformers.js. Prima dată când îl folosești, browserul descarcă de pe acest site modelul și motorul WebAssembly necesar (în total aproximativ 68 MB) și le stochează în cache; după aceea, fiecare transcriere are loc pe dispozitivul tău, fără niciun server implicat și fără ca audio să părăsească vreodată calculatorul tău.
Modelul folosit aici este whisper-tiny.en: cea mai mică variantă Whisper, cuantizată și limitată la limba engleză. Este suficient de rapid pentru a rula într-o filă de browser și produce o primă schiță utilă, dar nu este un serviciu profesionist de transcriere. Așteaptă-te la greșeli la nume proprii, vocabular tehnic, accente puternice, zgomot de fundal și voci suprapuse.