Ingen uppladdning, 100% lokalt, inget konto

Ljudtranskribering, tal till text i din webbläsare

Släpp in en inspelning och få en textutskrift. Körs på din enhet med en liten Whisper-modell nedladdad en gång från den här sajten; ditt ljud laddas aldrig upp.

Så fungerar Ljudtranskribering · tal till text

Ljudtranskribering omvandlar en inspelning till text med hjälp av Whisper, en taligenkänningsmodell som körs helt i din webbläsarflik via Transformers.js. Första gången du använder den laddar din webbläsare ner modellen och den WebAssembly-motor den behöver från den här webbplatsen (totalt cirka 68 MB) och cachar dem; därefter sker varje transkribering på din enhet, utan någon server, och ljudet lämnar aldrig din dator.

Modellen som används här är whisper-tiny.en: den minsta, kvantiserade Whisper-varianten som bara gäller engelska. Den är snabb nog att köra i en webbläsarflik och ger ett användbart första utkast, men är ingen professionell transkriberingstjänst. Förvänta dig fel i egennamn, tekniskt ordförråd, starka accenter, bakgrundsljud och överlappande talare.

Så här använder du Ljudtranskribering · tal till text, steg för steg

  1. Släpp en ljudfil (MP3, WAV, M4A, OGG eller de WebM-inspelningar som webbplatsens röstinspelare skapar).
  2. Vänta på engångsnedladdningen av motorn och modellen (cirka 68 MB) om det är din första transkribering på den här enheten.
  3. Välj vanlig text (.txt) eller tidsstämplade undertexter (.srt) som utdataformat.
  4. Tryck på transkribera och låt Whisper bearbeta inspelningen helt i din webbläsare.

Vanliga användningsområden

  • Få ett grovt skriftligt utkast av ett röstmeddelande inspelat på telefonen innan det rättas för hand.
  • Omvandla en kort inspelad intervju till sökbar text utan att ladda upp den till en molnbaserad transkriberingstjänst.
  • Generera en inledande .srt-undertextfil för ett kort klipp, som rättas till efteråt.

Vanliga frågor

Hur exakt är transkriberingen?

Det beror mycket på ljudkvaliteten. Tydlig engelska från en enda talare, inspelad nära mikrofonen och med lite bakgrundsljud, transkriberas ganska bra. Starka accenter, överlappande röster, musik eller bakgrundsljud och specialiserat ordförråd ökar antalet fel. Det är en liten, kvantiserad modell som valts för att kunna köras i en webbläsarflik, så behandla resultatet som ett användbart utkast att granska, inte en slutgiltig transkription.

Fungerar det med andra språk än engelska?

Nej. Det här verktyget använder whisper-tiny.en, Whisper-varianten som bara gäller engelska, vald eftersom den är mindre och mer exakt på engelska än den flerspråkiga tiny-modellen. Ljud på andra språk ger dåliga eller obegripliga resultat.

Laddas mitt ljud upp någonstans?

Nej. Inspelningen avkodas och bearbetas helt i din webbläsarflik med Web Audio API och en lokal Whisper-modell. Ingen ljudfil, och ingen transkriberad text, skickas någonsin till en server.

Hur lång tid tar transkriberingen?

Det beror på enhetens processor och inspelningens längd, eftersom allt körs lokalt i stället för på en server. Korta klipp (under en minut) blir vanligtvis klara på några sekunder; långa inspelningar, som en timmes intervju, tar proportionellt längre tid.