Fără încărcare, 100% local, fără cont

Transcriere audio, vorbire în text în browser

Adăugați o înregistrare și obțineți o transcriere text. Rulează pe dispozitivul dumneavoastră cu un model Whisper mic, descărcat o dată de pe acest site; audio-ul dumneavoastră nu este niciodată încărcat.

Cum funcționează Transcriere audio · vorbire în text

Transcriere Audio transformă o înregistrare în text folosind Whisper, un model de recunoaștere vocală care rulează în întregime în fila browserului dumneavoastră prin Transformers.js. Prima dată când îl folosiți, browserul descarcă de pe acest site modelul și motorul WebAssembly necesar (în total aproximativ 68 MB) și le stochează în cache; după aceea, fiecare transcriere are loc pe dispozitivul dumneavoastră, fără niciun server implicat și fără ca audio să părăsească vreodată calculatorul dumneavoastră.

Modelul folosit aici este whisper-tiny.en: cea mai mică variantă Whisper, cuantizată și limitată la limba engleză. Este suficient de rapid pentru a rula într-o filă de browser și produce o primă schiță utilă, dar nu este un serviciu profesionist de transcriere. Așteptați-vă la greșeli la nume proprii, vocabular tehnic, accente puternice, zgomot de fundal și voci suprapuse.

Cum se folosește Transcriere audio · vorbire în text, pas cu pas

  1. Trageți un fișier audio (MP3, WAV, M4A, OGG sau înregistrările WebM produse de reportofonul acestui site).
  2. Așteptați descărcarea unică a motorului și modelului (aproximativ 68 MB) dacă este prima dumneavoastră transcriere pe acest dispozitiv.
  3. Alegeți text simplu (.txt) sau subtitrări cu marcaje de timp (.srt) ca format de ieșire.
  4. Apăsați butonul de transcriere și lăsați Whisper să proceseze înregistrarea în întregime în browserul dumneavoastră.
  5. Copiați textul direct sau descărcați fișierul .txt/.srt odată ce este gata.

Cazuri de utilizare frecvente

  • Obținerea unei schițe scrise rapide a unui mesaj vocal înregistrat pe telefon, înainte de a-l corecta manual.
  • Transformarea unui scurt interviu înregistrat în text căutabil fără a-l încărca pe un serviciu de transcriere în cloud.
  • Generarea unui fișier de subtitrare .srt inițial pentru un clip scurt, de corectat ulterior.
  • Înregistrarea unei notițe vocale rapide cu Înregistratorul Vocal al acestui site, apoi transcrierea ei în aceeași filă de browser.
  • Obținerea unei prime transcrieri a unei prelegeri sau a unei înregistrări de întâlnire atunci când nu este necesară o precizie perfectă.

Întrebări frecvente

Cât de precisă este transcrierea?

Depinde foarte mult de calitatea audio. O engleză clară, cu un singur vorbitor, înregistrată aproape de microfon și cu puțin zgomot de fundal se transcrie destul de bine. Accentele puternice, vocile suprapuse, muzica sau zgomotul de fundal și vocabularul specializat cresc numărul de greșeli. Este un model mic, cuantizat, ales pentru a putea rula într-o filă de browser, așa că tratați rezultatul ca pe o schiță utilă de verificat, nu ca pe o transcriere finală.

Funcționează cu alte limbi în afară de engleză?

Nu. Acest instrument folosește whisper-tiny.en, varianta Whisper limitată la engleză, aleasă pentru că este mai mică și mai precisă pe engleză decât modelul tiny multilingv. Audio în alte limbi va produce rezultate slabe sau fără sens.

De ce trebuie să descarce ceva înainte de a funcționa?

Modelul de recunoaștere vocală și motorul WebAssembly care îl rulează (aproximativ 68 MB în total) nu sunt incluse în pagină; sunt descărcate o singură dată de pe acest site și stocate în cache de browserul dumneavoastră, similar modului în care instrumentul OCR descarcă un model lingvistic. După acea primă descărcare, transcrierea rulează complet offline. Nimic nu este preluat de pe vreun CDN terț.

Este audio-ul meu încărcat undeva?

Nu. Înregistrarea este decodată și procesată în întregime în fila browserului dumneavoastră, folosind Web Audio API și un model Whisper local. Niciun fișier audio, și niciun text transcris, nu este trimis vreodată către un server.

Cât durează transcrierea?

Depinde de procesorul dispozitivului dumneavoastră și de durata înregistrării, deoarece totul rulează local, nu pe un server. Clipurile scurte (sub un minut) se termină de obicei în câteva secunde; înregistrările lungi, precum un interviu de o oră, durează proporțional mai mult.

Care este diferența dintre rezultatul .txt și .srt?

Fișierul .txt este textul transcris simplu, fără marcaje de timp, util pentru citit sau lipit în altă parte. Fișierul .srt este un format standard de subtitrare cu un interval de marcaj de timp pentru fiecare segment vorbit, util pentru adăugarea de subtitrări la un video. Ambele sunt generate din aceeași transcriere; alegeți-l pe cel potrivit pentru ce trebuie să faceți în continuare.