So funktioniert Audio-Transkription · Sprache zu Text
Audiotranskription wandelt eine Aufnahme in Text um, mithilfe von Whisper, einem Spracherkennungsmodell, das vollständig im Tab deines Browsers über Transformers.js läuft. Beim ersten Ausführen lädt dein Browser von dieser Website das Modell und die benötigte WebAssembly-Engine herunter (insgesamt etwa 68 MB) und speichert sie zwischen; danach läuft jede Transkription auf deinem Gerät, ohne Server und ohne dass das Audio jemals deinen Rechner verlässt.
Das hier verwendete Modell ist whisper-tiny.en: die kleinste, quantisierte, nur für Englisch geeignete Whisper-Variante. Es ist schnell genug, um in einem Browser-Tab zu laufen, und liefert einen nützlichen ersten Entwurf, ist aber kein professioneller Transkriptionsdienst. Erwarte Fehler bei Eigennamen, Fachvokabular, starken Akzenten, Hintergrundgeräuschen und sich überlappenden Sprechern.