Žádné nahrávání, 100% lokálně, bez účtu

Přepis zvuku, řeč na text v prohlížeči

Vložte nahrávku a získejte textový přepis. Běží ve vašem zařízení s malým modelem Whisper staženým jednou z tohoto webu; váš zvuk se nikdy nenahrává.

Jak Přepis zvuku · řeč na text funguje

Přepis zvuku převádí nahrávku na text pomocí Whisper, modelu pro rozpoznávání řeči, který běží celý na kartě vašeho prohlížeče díky Transformers.js. Při prvním spuštění si prohlížeč z tohoto webu stáhne model a potřebný WebAssembly engine (celkem asi 68 MB) a uloží je do mezipaměti; poté každý přepis probíhá na vašem zařízení, bez serveru a bez toho, aby zvuk kdy opustil váš počítač.

Použitý model je whisper-tiny.en: nejmenší, kvantizovaná varianta Whisper omezená na angličtinu. Je dost rychlá na to, aby běžela v kartě prohlížeče, a vytváří užitečný první koncept, ale není to profesionální přepisovací služba. Očekávejte chyby ve vlastních jménech, odborné slovní zásobě, výrazném přízvuku, hluku na pozadí a překrývajících se hlasech.

Přepis zvuku · řeč na text: návod krok za krokem

  1. Přetáhněte zvukový soubor (MP3, WAV, M4A, OGG nebo nahrávky WebM z hlasového záznamníku na tomto webu).
  2. Počkejte na jednorázové stažení enginu a modelu (asi 68 MB), pokud jde o váš první přepis na tomto zařízení.
  3. Vyberte prostý text (.txt) nebo titulky s časovými značkami (.srt) jako výstupní formát.
  4. Stiskni přepsat a nech Whisper zpracovat nahrávku celou v tvém prohlížeči.
  5. Zkopírujte text přímo na stránce, nebo si jakmile je hotový, stáhněte soubor .txt/.srt.

Časté případy použití

  • Získání hrubého textového konceptu hlasové poznámky nahrané na telefonu před ruční úpravou.
  • Převod krátkého nahraného rozhovoru na prohledávatelný text bez nahrání do cloudové přepisovací služby.
  • Vytvoření počátečního souboru titulků .srt pro krátký klip, který se pak opraví.
  • Nahrání rychlé hlasové poznámky pomocí Hlasového záznamníku tohoto webu a její přepsání ve stejné záložce prohlížeče.
  • Získání prvního přepisu záznamu přednášky nebo schůzky, když není potřeba dokonalá přesnost.

Často kladené otázky

Jak přesný je přepis?

Hodně záleží na kvalitě zvuku. Jasná angličtina jednoho mluvčího, nahraná blízko mikrofonu a s malým hlukem na pozadí, se přepisuje docela dobře. Výrazný přízvuk, překrývající se hlasy, hudba nebo hluk na pozadí a odborná slovní zásoba zvyšují počet chyb. Jde o malý, kvantizovaný model zvolený tak, aby běžel v kartě prohlížeče, takže výsledek ber jako užitečný koncept k přečtení, ne jako konečný přepis.

Funguje i s jinými jazyky než angličtinou?

Ne. Tento nástroj používá whisper-tiny.en, variantu Whisper omezenou na angličtinu, zvolenou proto, že je menší a přesnější v angličtině než vícejazyčný model tiny. Zvuk v jiných jazycích poskytne slabé nebo nesmyslné výsledky.

Proč je před spuštěním potřeba něco stáhnout?

Model pro rozpoznávání řeči a engine WebAssembly, který ho spouští (dohromady asi 68 MB), nejsou zabudované přímo do stránky; stahují se jednou z tohoto webu a ukládají do mezipaměti vašeho prohlížeče, podobně jako nástroj OCR stahuje jazykový model. Po tomto prvním stažení běží přepis zcela offline. Nic se nestahuje z žádné externí CDN třetí strany.

Odesílá se můj zvuk někam?

Ne. Nahrávka se dekóduje a zpracovává celá v kartě vašeho prohlížeče pomocí Web Audio API a lokálního modelu Whisper. Žádný zvukový soubor ani žádný přepsaný text se nikdy neposílá na server.

Jak dlouho přepis trvá?

Záleží na procesoru vašeho zařízení a délce nahrávky, protože vše běží lokálně místo na serveru. Krátké klipy (kratší než minuta) obvykle skončí za pár sekund; dlouhé nahrávky, jako hodinový rozhovor, trvají úměrně déle.

Jaký je rozdíl mezi výstupem .txt a .srt?

Soubor .txt je obyčejný přepsaný text bez časových razítek, vhodný ke čtení nebo vložení jinam. Soubor .srt je standardní formát titulků s časovým rozsahem pro každý mluvený úsek, vhodný pro přidání titulků k videu. Oba vznikají ze stejného přepisu; vyberte ten, který se hodí k tomu, co potřebujete udělat dál.