Nessun upload, 100% locale, nessun account

Trascrizione audio, da voce a testo nel tuo browser

Trascina una registrazione e ottieni una trascrizione testuale. Gira sul tuo dispositivo con un piccolo modello Whisper scaricato una volta da questo sito; il tuo audio non viene mai caricato.

Come funziona Trascrizione audio · da voce a testo

Trascrizione Audio trasforma una registrazione in testo usando Whisper, un modello di riconoscimento vocale che funziona interamente nella scheda del tuo browser tramite Transformers.js. La prima volta che lo usi, il browser scarica da questo sito il modello e il motore WebAssembly necessario (circa 68 MB in totale) e li mette in cache; da quel momento ogni trascrizione avviene sul tuo dispositivo, senza alcun server e senza che l'audio lasci mai la tua macchina.

Il modello usato qui è whisper-tiny.en: la variante più piccola di Whisper, quantizzata e limitata all'inglese. È abbastanza veloce da funzionare in una scheda del browser e produce una prima bozza utile, ma non è un servizio di trascrizione professionale. Aspettati errori su nomi propri, vocabolario tecnico, accenti marcati, rumore di fondo e voci sovrapposte.

Come usare Trascrizione audio · da voce a testo, passo dopo passo

  1. Trascina un file audio (MP3, WAV, M4A, OGG o le registrazioni WebM prodotte dal registratore vocale di questo sito).
  2. Attendi il download una tantum del motore e del modello (circa 68 MB) se è la tua prima trascrizione su questo dispositivo.
  3. Scegli testo semplice (.txt) o sottotitoli con marcatura temporale (.srt) come formato di output.
  4. Premi trascrivi e lascia che Whisper elabori la registrazione interamente nel tuo browser.

Casi d'uso comuni

  • Ottenere una bozza scritta veloce di un promemoria vocale registrato sul telefono prima di correggerla a mano.
  • Trasformare una breve intervista registrata in testo ricercabile senza caricarla su un servizio di trascrizione cloud.
  • Generare un file di sottotitoli .srt di partenza per una clip breve, da correggere in seguito.

Domande frequenti

Quanto è accurata la trascrizione?

Dipende molto dalla qualità dell'audio. Un inglese chiaro, con un solo parlante, registrato vicino al microfono e con poco rumore di fondo viene trascritto ragionevolmente bene. Accenti marcati, voci sovrapposte, musica o rumore di fondo e vocabolario specialistico aumentano gli errori. È un modello piccolo e quantizzato, scelto perché possa funzionare in una scheda del browser, quindi considera il risultato una bozza utile da rivedere, non una trascrizione definitiva.

Funziona con lingue diverse dall'inglese?

No. Questo strumento usa whisper-tiny.en, la variante di Whisper limitata all'inglese, scelta perché è più piccola e più precisa sull'inglese rispetto al modello tiny multilingue. Audio in altre lingue produrrà risultati scarsi o incoerenti.

Il mio audio viene inviato da qualche parte?

No. La registrazione viene decodificata ed elaborata interamente nella scheda del tuo browser usando la Web Audio API e un modello Whisper locale. Nessun file audio, né alcun testo trascritto, viene mai inviato a un server.

Quanto tempo richiede la trascrizione?

Dipende dalla CPU del tuo dispositivo e dalla durata della registrazione, poiché tutto viene eseguito localmente invece che su un server. Le clip brevi (meno di un minuto) terminano di solito in pochi secondi; le registrazioni lunghe, come un'intervista di un'ora, richiedono proporzionalmente più tempo.