Bez przesyłania, 100% lokalnie, bez konta

Transkrypcja audio, mowa na tekst w przeglądarce

Upuść nagranie i otrzymaj transkrypcję tekstową. Działa na Twoim urządzeniu z małym modelem Whisper pobranym raz z tej strony; Twoje audio nigdy nie jest przesyłane.

Jak działa Transkrypcja audio · mowa na tekst

Transkrypcja audio zamienia nagranie na tekst za pomocą Whisper, modelu rozpoznawania mowy, który działa całkowicie w karcie przeglądarki dzięki Transformers.js. Za pierwszym razem przeglądarka pobiera z tej strony model i potrzebny silnik WebAssembly (łącznie około 68 MB) i zapisuje je w pamięci podręcznej; później każda transkrypcja odbywa się na twoim urządzeniu, bez serwera i bez wysyłania dźwięku poza twój komputer.

Użyty tu model to whisper-tiny.en: najmniejszy, skwantyzowany wariant Whisper ograniczony do języka angielskiego. Jest wystarczająco szybki, by działać w karcie przeglądarki, i daje użyteczny pierwszy szkic, ale nie jest profesjonalną usługą transkrypcji. Spodziewaj się błędów w nazwach własnych, słownictwie technicznym, silnych akcentach, szumie tła i nakładających się głosach.

Transkrypcja audio · mowa na tekst: instrukcja krok po kroku

  1. Upuść plik audio (MP3, WAV, M4A, OGG lub nagrania WebM z dyktafonu na tej stronie).
  2. Poczekaj na jednorazowe pobranie silnika i modelu (około 68 MB), jeśli to twoja pierwsza transkrypcja na tym urządzeniu.
  3. Wybierz zwykły tekst (.txt) lub napisy z czasem (.srt) jako format wyjściowy.
  4. Naciśnij transkrybuj i pozwól Whisperowi przetworzyć nagranie całkowicie w przeglądarce.

Typowe zastosowania

  • Uzyskanie szybkiego szkicu tekstowego notatki głosowej nagranej na telefonie przed ręczną korektą.
  • Zamiana krótkiego nagranego wywiadu na przeszukiwalny tekst bez wysyłania go do usługi transkrypcji w chmurze.
  • Wygenerowanie wstępnego pliku napisów .srt dla krótkiego klipu, do poprawienia później.

Często zadawane pytania

Jak dokładna jest transkrypcja?

Bardzo zależy to od jakości dźwięku. Wyraźny angielski, jeden mówiący, nagrany blisko mikrofonu i z niewielkim szumem tła transkrybuje się dość dobrze. Silne akcenty, nakładające się głosy, muzyka lub szum tła oraz słownictwo specjalistyczne zwiększają liczbę błędów. To mały, skwantyzowany model, wybrany tak, by mógł działać w karcie przeglądarki, więc traktuj wynik jako użyteczny szkic do sprawdzenia, a nie ostateczną transkrypcję.

Czy działa z innymi językami niż angielski?

Nie. To narzędzie używa whisper-tiny.en, wariantu Whisper ograniczonego do angielskiego, wybranego dlatego, że jest mniejszy i dokładniejszy w angielskim niż wielojęzyczny model tiny. Dźwięk w innych językach da słabe lub bezsensowne wyniki.

Czy mój dźwięk jest gdzieś wysyłany?

Nie. Nagranie jest dekodowane i przetwarzane całkowicie w karcie przeglądarki za pomocą Web Audio API i lokalnego modelu Whisper. Żaden plik audio ani żaden transkrybowany tekst nigdy nie trafia na serwer.

Ile trwa transkrypcja?

Zależy to od procesora twojego urządzenia i długości nagrania, ponieważ wszystko działa lokalnie, a nie na serwerze. Krótkie klipy (poniżej minuty) zwykle kończą się w kilka sekund; długie nagrania, jak godzinny wywiad, trwają proporcjonalnie dłużej.