So funktioniert Audio-Transkription · Sprache zu Text
Audiotranskription wandelt eine Aufnahme in Text um, mithilfe von Whisper, einem Spracherkennungsmodell, das vollständig im Tab Ihres Browsers über Transformers.js läuft. Beim ersten Ausführen lädt Ihr Browser von dieser Website das Modell und die benötigte WebAssembly-Engine herunter (insgesamt etwa 68 MB) und speichert sie zwischen; danach läuft jede Transkription auf Ihrem Gerät, ohne Server und ohne dass das Audio jemals Ihren Rechner verlässt.
Das hier verwendete Modell ist whisper-tiny.en: die kleinste, quantisierte, nur für Englisch geeignete Whisper-Variante. Es ist schnell genug, um in einem Browser-Tab zu laufen, und liefert einen nützlichen ersten Entwurf, ist aber kein professioneller Transkriptionsdienst. Erwarten Sie Fehler bei Eigennamen, Fachvokabular, starken Akzenten, Hintergrundgeräuschen und sich überlappenden Sprechern.