Hoe Audio transcriberen · spraak naar tekst werkt
Audiotranscriptie zet een opname om in tekst met Whisper, een spraakherkenningsmodel dat volledig in je browsertab draait via Transformers.js. De eerste keer dat je de tool gebruikt, downloadt je browser het model en de benodigde WebAssembly-engine (in totaal ongeveer 68 MB) van deze site en slaat ze op in de cache; elke transcriptie daarna gebeurt op je eigen toestel, zonder server en zonder dat er ooit audio je apparaat verlaat. Dat is dezelfde afweging als bij de OCR- en audiotools op deze site: een echte eenmalige download voor echte offline verwerking, geen marketingclaim.
Het hier gebruikte model is whisper-tiny.en: de kleinste, gekwantiseerde, alleen-Engelse Whisper-variant. Het is snel genoeg om in een browsertab te draaien en levert een bruikbare eerste versie op, maar het is geen professionele transcriptiedienst. Verwacht fouten bij eigennamen, vaktermen, sterke accenten, achtergrondgeluid en sprekers die door elkaar heen praten. Opnames van meer dan ongeveer 30 seconden worden in overlappende stukken verwerkt zodat het hele bestand wordt getranscribeerd, maar een gesprek van een uur kost nog altijd echte rekentijd, omdat alles op je eigen toestel draait in plaats van in een datacenter.