Ingen upload, 100% lokalt, ingen konto

Lydtranskribering, tale til tekst i din browser

Slip en optagelse, og få en tekst-transskription. Kører på din enhed med en lille Whisper-model, der downloades én gang fra dette site; din lyd uploades aldrig.

Sådan virker Lydtranskribering · tale til tekst

Lydtranskription omdanner en optagelse til tekst ved hjælp af Whisper, en talegenkendelsesmodel, der kører helt inde i din browserfane via Transformers.js. Første gang du bruger den, henter din browser modellen og den nødvendige WebAssembly-motor fra dette site (i alt omkring 68 MB) og gemmer dem i cache; derefter foregår hver transskription på din enhed uden nogen server, og lyden forlader aldrig din maskine.

Modellen, der bruges her, er whisper-tiny.en: den mindste, kvantiserede Whisper-variant kun til engelsk. Den er hurtig nok til at køre i en browserfane og giver et nyttigt første udkast, men er ikke en professionel transskriptionstjeneste. Forvent fejl i egennavne, teknisk ordforråd, kraftige accenter, baggrundsstøj og overlappende talere.

Sådan bruger du Lydtranskribering · tale til tekst, trin for trin

  1. Slip en lydfil (MP3, WAV, M4A, OGG eller de WebM-optagelser, som sitets stemmeoptager laver).
  2. Vent på den engangs-download af motor og model (omkring 68 MB), hvis det er din første transskription på denne enhed.
  3. Vælg almindelig tekst (.txt) eller undertekster med tidsstempler (.srt) som outputformat.
  4. Tryk på transskriber, og lad Whisper behandle optagelsen helt i din browser.

Almindelige anvendelser

  • Få et groft skriftligt udkast af en talebesked optaget på telefonen, før den rettes til i hånden.
  • Omdanne et kort optaget interview til søgbar tekst uden at uploade det til en cloud-transskriptionstjeneste.
  • Generere en indledende .srt-undertekstfil til et kort klip, som rettes bagefter.

Ofte stillede spørgsmål

Hvor præcis er transskriptionen?

Det afhænger meget af lydkvaliteten. Klar engelsk fra én taler, optaget tæt på mikrofonen og med lidt baggrundsstøj, transskriberes nogenlunde godt. Kraftige accenter, overlappende stemmer, musik eller baggrundsstøj og specialiseret ordforråd øger fejlene. Det er en lille, kvantiseret model valgt til at kunne køre i en browserfane, så betragt resultatet som et nyttigt udkast, der skal gennemgås, ikke en endelig transskription.

Virker det med andre sprog end engelsk?

Nej. Dette værktøj bruger whisper-tiny.en, Whisper-varianten kun til engelsk, valgt fordi den er mindre og mere præcis på engelsk end den flersprogede tiny-model. Lyd på andre sprog giver dårlige eller meningsløse resultater.

Bliver min lyd uploadet nogen steder?

Nej. Optagelsen afkodes og behandles helt inde i din browserfane med Web Audio API'et og en lokal Whisper-model. Ingen lydfil, og ingen transskriberet tekst, sendes nogensinde til en server.

Hvor lang tid tager transskriptionen?

Det afhænger af din enheds CPU og optagelsens længde, da alt kører lokalt i stedet for på en server. Korte klip (under et minut) er typisk færdige på få sekunder; lange optagelser, som et enetimers interview, tager forholdsmæssigt længere tid.