Ingen opplasting, 100% lokalt, ingen konto

Lydtranskribering, tale til tekst i nettleseren din

Slipp et opptak og få en tekstranskripsjon. Kjører på enheten din med en liten Whisper-modell lastet ned én gang fra dette nettstedet; lyden din blir aldri lastet opp.

Slik fungerer Lydtranskribering · tale til tekst

Lydtranskribering gjør en opptak om til tekst ved hjelp av Whisper, en talegjenkjenningsmodell som kjører helt inne i nettleserfanen din via Transformers.js. Første gang du bruker den, laster nettleseren din ned modellen og WebAssembly-motoren den trenger fra dette nettstedet (til sammen rundt 68 MB), og lagrer dem i buffer; etter det skjer hver transkribering på enheten din uten noen server, og lyden forlater aldri maskinen din.

Modellen som brukes her, er whisper-tiny.en: den minste, kvantiserte Whisper-varianten som bare gjelder engelsk. Den er rask nok til å kjøre i en nettleserfane og gir et nyttig førsteutkast, men er ingen profesjonell transkriberingstjeneste. Forvent feil i egennavn, teknisk vokabular, sterke aksenter, bakgrunnsstøy og overlappende talere.

Slik bruker du Lydtranskribering · tale til tekst, steg for steg

  1. Slipp en lydfil (MP3, WAV, M4A, OGG eller WebM-opptakene som stemmeopptakeren på dette nettstedet lager).
  2. Vent på engangsnedlastingen av motoren og modellen (rundt 68 MB) hvis dette er din første transkribering på denne enheten.
  3. Velg vanlig tekst (.txt) eller tidsstemplede undertekster (.srt) som utdataformat.
  4. Trykk på transkriber, og la Whisper behandle opptaket helt i nettleseren din.

Vanlige bruksområder

  • Få et grovt skriftlig utkast av en talemelding tatt opp på telefonen, før den rettes opp for hånd.
  • Gjøre om et kort innspilt intervju til søkbar tekst uten å laste det opp til en skybasert transkriberingstjeneste.
  • Generere en innledende .srt-undertekstfil for en kort klipp, som rettes opp etterpå.

Ofte stilte spørsmål

Hvor nøyaktig er transkriberingen?

Det avhenger sterkt av lydkvaliteten. Klar engelsk fra én taler, tatt opp nær mikrofonen og med lite bakgrunnsstøy, transkriberes ganske godt. Sterke aksenter, overlappende stemmer, musikk eller bakgrunnsstøy og spesialisert vokabular øker antall feil. Dette er en liten, kvantisert modell valgt slik at den kan kjøre i en nettleserfane, så behandle resultatet som et nyttig utkast som må gjennomgås, ikke en endelig transkripsjon.

Fungerer det med andre språk enn engelsk?

Nei. Dette verktøyet bruker whisper-tiny.en, Whisper-varianten som bare gjelder engelsk, valgt fordi den er mindre og mer presis på engelsk enn den flerspråklige tiny-modellen. Lyd på andre språk vil gi dårlige eller meningsløse resultater.

Blir lyden min lastet opp noe sted?

Nei. Opptaket blir dekodet og behandlet helt inne i nettleserfanen din med Web Audio API og en lokal Whisper-modell. Ingen lydfil, og ingen transkribert tekst, sendes noensinne til en server.

Hvor lang tid tar transkriberingen?

Det avhenger av CPU-en til enheten din og lengden på opptaket, siden alt kjører lokalt i stedet for på en server. Korte klipp (under ett minutt) er vanligvis ferdige på noen sekunder; lange opptak, som et intervju på en time, tar forholdsmessig lengre tid.