音声文字起こし・音声→テキストの仕組み
音声文字起こしは、Transformers.jsを通じてブラウザのタブ内で完全に動作する音声認識モデルWhisperを使い、録音をテキストに変換します。初めて実行するときは、ブラウザが当サイトからモデルと必要なWebAssemblyエンジン(合計約68MB)をダウンロードし、キャッシュします。それ以降の文字起こしは、サーバーを介さず、音声が端末の外に出ることもなく、すべてお使いの端末上で行われます。これは当サイトのOCRツールや音声系ツールと同じトレードオフです。誇大な宣伝文句ではなく、実際のオフライン処理のための、実際に一度だけ発生するダウンロードです。
ここで使用しているモデルはwhisper-tiny.enで、最小サイズかつ量子化された、英語専用のWhisperバリアントです。ブラウザのタブ内で動作するのに十分な速度で、有用な最初の下書きを作成できますが、プロの文字起こしサービスではありません。固有名詞、専門用語、強い訛り、背景ノイズ、複数話者の重なりなどでは誤りが生じることを想定してください。約30秒を超える録音は、ファイル全体を文字起こしできるよう重なり合ったチャンクに分割して処理されますが、1時間のインタビューであれば、データセンターではなく自分の端末上ですべて処理する以上、それ相応の計算時間がかかります。