アップロードなし, 100%ローカル, アカウントなし

音声文字起こし、ブラウザ内で音声をテキストに

録音をドロップしてテキストの書き起こしを取得します。このサイトから一度だけダウンロードする小型のWhisperモデルで端末上で実行され、音声がアップロードされることはありません。

音声文字起こし・音声→テキストの仕組み

音声文字起こしは、Transformers.jsを通じてブラウザのタブ内で完全に動作する音声認識モデルWhisperを使い、録音をテキストに変換します。初めて実行するときは、ブラウザが当サイトからモデルと必要なWebAssemblyエンジン(合計約68MB)をダウンロードし、キャッシュします。それ以降の文字起こしは、サーバーを介さず、音声が端末の外に出ることもなく、すべてお使いの端末上で行われます。これは当サイトのOCRツールや音声系ツールと同じトレードオフです。誇大な宣伝文句ではなく、実際のオフライン処理のための、実際に一度だけ発生するダウンロードです。

ここで使用しているモデルはwhisper-tiny.enで、最小サイズかつ量子化された、英語専用のWhisperバリアントです。ブラウザのタブ内で動作するのに十分な速度で、有用な最初の下書きを作成できますが、プロの文字起こしサービスではありません。固有名詞、専門用語、強い訛り、背景ノイズ、複数話者の重なりなどでは誤りが生じることを想定してください。約30秒を超える録音は、ファイル全体を文字起こしできるよう重なり合ったチャンクに分割して処理されますが、1時間のインタビューであれば、データセンターではなく自分の端末上ですべて処理する以上、それ相応の計算時間がかかります。

音声文字起こし・音声→テキストの使い方をステップごとに解説

  1. 音声ファイル(MP3、WAV、M4A、OGG、または当サイトのボイスレコーダーが生成するWebM録音)をドロップします。
  2. この端末で初めて文字起こしを行う場合は、エンジンとモデルの一度きりのダウンロード(約68MB)が終わるまで待ちます。
  3. 出力形式として、プレーンテキスト(.txt)かタイムスタンプ付き字幕(.srt)のどちらかを選びます。
  4. 文字起こしを押すと、Whisperがブラウザのタブ内だけで録音を処理します。
  5. 完成したら、テキストをその場でコピーするか、.txt/.srtファイルとしてダウンロードします。

よくある使用例

  • スマートフォンで録音したボイスメモの大まかな文字起こしを作成し、その後手作業で仕上げる。
  • クラウドの文字起こしサービスにアップロードすることなく、短い録音インタビューを検索可能なテキストに変換する。
  • 短いクリップ用の.srt字幕ファイルのたたき台を作成し、後で修正する。
  • 当サイトのボイスレコーダーで手早く音声メモを録音し、同じブラウザタブでそのまま文字起こしする。
  • 完璧な精度が求められない講義や会議の録音について、まず一通りの文字起こしを得る。

よくある質問

文字起こしの精度はどのくらいですか?

音声の品質に大きく左右されます。マイクの近くで録音され、背景ノイズが少ない、単独話者による明瞭な英語であれば、かなり良好に文字起こしできます。訛り、複数人の同時発話、背景音楽やノイズ、専門用語(固有名詞、業界用語、略語)は、いずれも誤りを増やす要因になります。これはブラウザのタブ内で動作させるために選ばれた小型かつ量子化されたモデルであり、最大級のWhisperモデルではありません。そのため、出力結果は最終的な文字起こしとしてではなく、確認・修正すべき有用な下書きとして扱ってください。

英語以外の言語にも対応していますか?

いいえ。このツールは英語専用のWhisperバリアントであるwhisper-tiny.enを使用しています。多言語対応のtinyモデルより小型で、かつ英語に対しては精度が高いため選ばれました。それ以外の言語の音声では、精度が低い、あるいは意味の通らない結果になります。現時点で他言語への対応はありません。

使う前に何かをダウンロードする必要があるのはなぜですか?

音声認識モデルと、それを動かすWebAssemblyエンジン(合計約68MB)は、ページにあらかじめ組み込まれているわけではありません。OCRツールが言語モデルをダウンロードするのと同様に、当サイトから一度だけ取得され、ブラウザにキャッシュされます。この最初のダウンロードの後は、文字起こしは完全にオフラインで動作します。第三者のCDNから何かを取得することはありません。

自分の音声がどこかにアップロードされることはありますか?

いいえ。録音データは、Web Audio APIとローカルのWhisperモデルを使い、すべてブラウザのタブ内でデコード・処理されます。音声ファイルも、文字起こし結果のテキストも、サーバーに送信されることはありません。モデルのダウンロードが終わった後であれば、ネットワークを切断しても文字起こしは動作します。

文字起こしにはどのくらい時間がかかりますか?

すべてサーバーではなく端末上のCPUで処理されるため、所要時間は端末の性能と録音の長さによって変わります。1分未満の短いクリップであれば、通常は数秒から1分弱で完了します。1時間のインタビューのような長い録音は、それに比例して時間がかかり、その間ブラウザのタブが使用中になります。処理中はタブを開いたまま、他のページに移動しないでください。

.txt出力と.srt出力の違いは何ですか?

.txtファイルはタイムスタンプのないプレーンな文字起こしテキストで、読んだり他の場所に貼り付けたりするのに向いています。.srtファイルは各発話区間にタイムスタンプの範囲を付けた標準的な字幕形式で、動画に字幕を追加するのに向いています。どちらも同じ文字起こし結果から生成されるので、次にやりたいことに合わせて選んでください。