Kein Upload, 100% lokal, kein Konto

Audio-Transkription, Sprache zu Text in Ihrem Browser

Legen Sie eine Aufnahme hinein und erhalten Sie ein Text-Transkript. Läuft auf Ihrem Gerät mit einem kleinen Whisper-Modell, das einmalig von dieser Website geladen wird; Ihr Audio wird nie hochgeladen.

So funktioniert Audio-Transkription · Sprache zu Text

Audiotranskription wandelt eine Aufnahme in Text um, mithilfe von Whisper, einem Spracherkennungsmodell, das vollständig im Tab deines Browsers über Transformers.js läuft. Beim ersten Ausführen lädt dein Browser von dieser Website das Modell und die benötigte WebAssembly-Engine herunter (insgesamt etwa 68 MB) und speichert sie zwischen; danach läuft jede Transkription auf deinem Gerät, ohne Server und ohne dass das Audio jemals deinen Rechner verlässt.

Das hier verwendete Modell ist whisper-tiny.en: die kleinste, quantisierte, nur für Englisch geeignete Whisper-Variante. Es ist schnell genug, um in einem Browser-Tab zu laufen, und liefert einen nützlichen ersten Entwurf, ist aber kein professioneller Transkriptionsdienst. Erwarte Fehler bei Eigennamen, Fachvokabular, starken Akzenten, Hintergrundgeräuschen und sich überlappenden Sprechern.

So wird Audio-Transkription · Sprache zu Text verwendet, Schritt für Schritt

  1. Ziehe eine Audiodatei (MP3, WAV, M4A, OGG oder die WebM-Aufnahmen des Sprachrekorders dieser Website) auf den Upload-Bereich.
  2. Warte auf den einmaligen Download von Engine und Modell (etwa 68 MB), falls dies deine erste Transkription auf diesem Gerät ist.
  3. Wähle Klartext (.txt) oder zeitgestempelte Untertitel (.srt) als Ausgabeformat.
  4. Klicke auf Transkribieren und lass Whisper die Aufnahme vollständig in deinem Browser verarbeiten.

Häufige Anwendungsfälle

  • Einen groben schriftlichen Entwurf einer auf dem Handy aufgenommenen Sprachnotiz erhalten, bevor er von Hand überarbeitet wird.
  • Ein kurzes aufgenommenes Interview in durchsuchbaren Text umwandeln, ohne es an einen Cloud-Transkriptionsdienst zu senden.
  • Eine erste .srt-Untertiteldatei für einen kurzen Clip erzeugen, die anschließend korrigiert wird.

Häufig gestellte Fragen

Wie genau ist die Transkription?

Das hängt stark von der Audioqualität ab. Klares Englisch von einem einzelnen Sprecher, nah am Mikrofon und mit wenig Hintergrundgeräusch aufgenommen, wird recht gut transkribiert. Starke Akzente, überlappende Stimmen, Musik oder Hintergrundgeräusche und Fachvokabular erhöhen die Fehlerquote. Es ist ein kleines, quantisiertes Modell, das gewählt wurde, damit es in einem Browser-Tab laufen kann, also behandle das Ergebnis als nützlichen Entwurf zum Überprüfen, nicht als endgültige Transkription.

Funktioniert es mit anderen Sprachen als Englisch?

Nein. Dieses Werkzeug verwendet whisper-tiny.en, die nur für Englisch geeignete Whisper-Variante, die gewählt wurde, weil sie kleiner und bei Englisch genauer ist als das mehrsprachige Tiny-Modell. Audio in anderen Sprachen liefert schlechte oder unsinnige Ergebnisse.

Wird mein Audio irgendwohin hochgeladen?

Nein. Die Aufnahme wird vollständig im Tab deines Browsers mit der Web Audio API und einem lokalen Whisper-Modell dekodiert und verarbeitet. Keine Audiodatei und kein transkribierter Text werden jemals an einen Server gesendet.

Wie lange dauert die Transkription?

Das hängt von der CPU deines Geräts und der Länge der Aufnahme ab, da alles lokal statt auf einem Server läuft. Kurze Clips (unter einer Minute) sind meist in wenigen Sekunden fertig; lange Aufnahmen, etwa ein einstündiges Interview, dauern entsprechend länger.