Ingen upload, 100% lokalt, ingen konto

Lydtranskribering, tale til tekst i din browser

Slip en optagelse, og få en tekst-transskription. Kører på din enhed med en lille Whisper-model, der downloades én gang fra dette site; din lyd uploades aldrig.

Sådan virker Lydtranskribering · tale til tekst

Lydtranskription omdanner en optagelse til tekst ved hjælp af Whisper, en talegenkendelsesmodel, der kører helt inde i din browserfane via Transformers.js. Første gang du bruger den, henter din browser modellen og den nødvendige WebAssembly-motor fra dette site (i alt omkring 68 MB) og gemmer dem i cache; derefter foregår hver transskription på din enhed uden nogen server, og lyden forlader aldrig din maskine.

Modellen, der bruges her, er whisper-tiny.en: den mindste, kvantiserede Whisper-variant kun til engelsk. Den er hurtig nok til at køre i en browserfane og giver et nyttigt første udkast, men er ikke en professionel transskriptionstjeneste. Forvent fejl i egennavne, teknisk ordforråd, kraftige accenter, baggrundsstøj og overlappende talere.

Sådan bruger du Lydtranskribering · tale til tekst, trin for trin

  1. Slip en lydfil (MP3, WAV, M4A, OGG eller de WebM-optagelser, som sitets stemmeoptager laver).
  2. Vent på den engangs-download af motor og model (omkring 68 MB), hvis det er din første transskription på denne enhed.
  3. Vælg almindelig tekst (.txt) eller undertekster med tidsstempler (.srt) som outputformat.
  4. Tryk på transskriber, og lad Whisper behandle optagelsen helt i din browser.
  5. Kopier teksten direkte eller download .txt/.srt-filen, når den er klar.

Almindelige anvendelser

  • Få et groft skriftligt udkast af en talebesked optaget på telefonen, før den rettes til i hånden.
  • Omdanne et kort optaget interview til søgbar tekst uden at uploade det til en cloud-transskriptionstjeneste.
  • Generere en indledende .srt-undertekstfil til et kort klip, som rettes bagefter.
  • At optage en hurtig talebesked med dette sites lydoptager og derefter transskribere den i den samme browserfane.
  • At få en første udgave af en transskription af en forelæsning eller mødeoptagelse, når perfekt nøjagtighed ikke er nødvendig.

Ofte stillede spørgsmål

Hvor præcis er transskriptionen?

Det afhænger meget af lydkvaliteten. Klar engelsk fra én taler, optaget tæt på mikrofonen og med lidt baggrundsstøj, transskriberes nogenlunde godt. Kraftige accenter, overlappende stemmer, musik eller baggrundsstøj og specialiseret ordforråd øger fejlene. Det er en lille, kvantiseret model valgt til at kunne køre i en browserfane, så betragt resultatet som et nyttigt udkast, der skal gennemgås, ikke en endelig transskription.

Virker det med andre sprog end engelsk?

Nej. Dette værktøj bruger whisper-tiny.en, Whisper-varianten kun til engelsk, valgt fordi den er mindre og mere præcis på engelsk end den flersprogede tiny-model. Lyd på andre sprog giver dårlige eller meningsløse resultater.

Hvorfor skal der downloades noget, før det virker?

Talegenkendelsesmodellen og den WebAssembly-motor, der kører den (i alt cirka 68 MB), er ikke indbygget i siden; de hentes én gang fra dette site og caches af din browser, ligesom OCR-værktøjet downloader en sprogmodel. Efter den første download kører transskriptionen helt offline. Intet hentes fra noget tredjeparts-CDN.

Bliver min lyd uploadet nogen steder?

Nej. Optagelsen afkodes og behandles helt inde i din browserfane med Web Audio API'et og en lokal Whisper-model. Ingen lydfil, og ingen transskriberet tekst, sendes nogensinde til en server.

Hvor lang tid tager transskriptionen?

Det afhænger af din enheds CPU og optagelsens længde, da alt kører lokalt i stedet for på en server. Korte klip (under et minut) er typisk færdige på få sekunder; lange optagelser, som et enetimers interview, tager forholdsmæssigt længere tid.

Hvad er forskellen mellem .txt- og .srt-outputtet?

.txt-filen er den rene transskriberede tekst uden tidsstempler, praktisk til at læse eller indsætte andre steder. .srt-filen er et standard undertekstformat med et tidsstempelinterval for hvert talt segment, praktisk til at tilføje undertekster til en video. Begge genereres fra den samme transskription; vælg den, der passer til, hvad du skal bruge den til næste gang.