Kein Upload, 100% lokal, kein Konto

Audio-Transkription, Sprache zu Text in Ihrem Browser

Legen Sie eine Aufnahme hinein und erhalten Sie ein Text-Transkript. Läuft auf Ihrem Gerät mit einem kleinen Whisper-Modell, das einmalig von dieser Website geladen wird; Ihr Audio wird nie hochgeladen.

So funktioniert Audio-Transkription · Sprache zu Text

Audiotranskription wandelt eine Aufnahme in Text um, mithilfe von Whisper, einem Spracherkennungsmodell, das vollständig im Tab Ihres Browsers über Transformers.js läuft. Beim ersten Ausführen lädt Ihr Browser von dieser Website das Modell und die benötigte WebAssembly-Engine herunter (insgesamt etwa 68 MB) und speichert sie zwischen; danach läuft jede Transkription auf Ihrem Gerät, ohne Server und ohne dass das Audio jemals Ihren Rechner verlässt.

Das hier verwendete Modell ist whisper-tiny.en: die kleinste, quantisierte, nur für Englisch geeignete Whisper-Variante. Es ist schnell genug, um in einem Browser-Tab zu laufen, und liefert einen nützlichen ersten Entwurf, ist aber kein professioneller Transkriptionsdienst. Erwarten Sie Fehler bei Eigennamen, Fachvokabular, starken Akzenten, Hintergrundgeräuschen und sich überlappenden Sprechern.

So wird Audio-Transkription · Sprache zu Text verwendet, Schritt für Schritt

  1. Ziehen Sie eine Audiodatei (MP3, WAV, M4A, OGG oder die WebM-Aufnahmen des Sprachrekorders dieser Website) auf den Upload-Bereich.
  2. Warten Sie auf den einmaligen Download von Engine und Modell (etwa 68 MB), falls dies Ihre erste Transkription auf diesem Gerät ist.
  3. Wählen Sie Klartext (.txt) oder zeitgestempelte Untertitel (.srt) als Ausgabeformat.
  4. Klicken Sie auf Transkribieren und lassen Sie Whisper die Aufnahme vollständig in Ihrem Browser verarbeiten.
  5. Kopieren Sie den Text direkt oder laden Sie die .txt-/.srt-Datei herunter, sobald sie fertig ist.

Häufige Anwendungsfälle

  • Einen groben schriftlichen Entwurf einer auf dem Handy aufgenommenen Sprachnotiz erhalten, bevor er von Hand überarbeitet wird.
  • Ein kurzes aufgenommenes Interview in durchsuchbaren Text umwandeln, ohne es an einen Cloud-Transkriptionsdienst zu senden.
  • Eine erste .srt-Untertiteldatei für einen kurzen Clip erzeugen, die anschließend korrigiert wird.
  • Eine schnelle Sprachnotiz mit dem Sprachrekorder dieser Seite aufnehmen und sie anschließend im selben Browser-Tab transkribieren.
  • Ein erstes Transkript einer Vorlesungs- oder Besprechungsaufnahme erstellen, wenn perfekte Genauigkeit nicht erforderlich ist.

Häufig gestellte Fragen

Wie genau ist die Transkription?

Das hängt stark von der Audioqualität ab. Klares Englisch von einem einzelnen Sprecher, nah am Mikrofon und mit wenig Hintergrundgeräusch aufgenommen, wird recht gut transkribiert. Starke Akzente, überlappende Stimmen, Musik oder Hintergrundgeräusche und Fachvokabular erhöhen die Fehlerquote. Es ist ein kleines, quantisiertes Modell, das gewählt wurde, damit es in einem Browser-Tab laufen kann, also behandle das Ergebnis als nützlichen Entwurf zum Überprüfen, nicht als endgültige Transkription.

Funktioniert es mit anderen Sprachen als Englisch?

Nein. Dieses Werkzeug verwendet whisper-tiny.en, die nur für Englisch geeignete Whisper-Variante, die gewählt wurde, weil sie kleiner und bei Englisch genauer ist als das mehrsprachige Tiny-Modell. Audio in anderen Sprachen liefert schlechte oder unsinnige Ergebnisse.

Warum muss vor der Nutzung erst etwas heruntergeladen werden?

Das Spracherkennungsmodell und die WebAssembly-Engine, die es ausführt (zusammen etwa 68 MB), sind nicht in die Seite eingebaut; sie werden einmalig von dieser Website abgerufen und von Ihrem Browser zwischengespeichert, ähnlich wie das OCR-Werkzeug ein Sprachmodell herunterlädt. Nach diesem ersten Download läuft die Transkription vollständig offline. Es wird nichts von einem CDN eines Drittanbieters abgerufen.

Wird mein Audio irgendwohin hochgeladen?

Nein. Die Aufnahme wird vollständig im Tab Ihres Browsers mit der Web Audio API und einem lokalen Whisper-Modell dekodiert und verarbeitet. Keine Audiodatei und kein transkribierter Text werden jemals an einen Server gesendet.

Wie lange dauert die Transkription?

Das hängt von der CPU Ihres Geräts und der Länge der Aufnahme ab, da alles lokal statt auf einem Server läuft. Kurze Clips (unter einer Minute) sind meist in wenigen Sekunden fertig; lange Aufnahmen, etwa ein einstündiges Interview, dauern entsprechend länger.

Was ist der Unterschied zwischen der .txt- und der .srt-Ausgabe?

Die .txt-Datei ist der reine transkribierte Text ohne Zeitstempel, nützlich zum Lesen oder Einfügen anderswo. Die .srt-Datei ist ein Standard-Untertitelformat mit einem Zeitstempelbereich für jedes gesprochene Segment, nützlich, um einem Video Untertitel hinzuzufügen. Beide werden aus derselben Transkription erzeugt; wählen Sie, was zu Ihrem nächsten Schritt passt.