アップロードなし, 100%ローカル, アカウントなし

記事

文字起こし用に音声を遅くする

速いスピーカー、馴染みのないアクセント、複数の重なった声が文字起こしを止める3つの主な理由です。録音を遅くすることで、言われたことを聞き取る時間を稼げます。落とし穴は、単純な再生速度の低下がすべての声のピッチも下げることで、それは音声を追いやすくするのではなく、むしろ追いにくくします。この記事では、単純な速度低下とピッチ保持タイムストレッチの違いを説明し、実際に役立つ実用的な範囲を解説します。

遅くすることが役立つ理由

人間の音声は短い時間に多くの情報を運びます。速いスピーカーは1分あたり200語以上を発することができ、そのペースでは耳が次の音節が届く前に個々の音素を解決する時間がほとんどありません。音声を遅くすることで、脳が音節ごとにより多くの処理時間を得られます。これは3つの状況で最も重要です:音素のマッピングが期待と異なる馴染みのないアクセントのスピーカー;すべての単語が意味を持ち、1つの聞き間違いが誤った用語を生成する密な技術的段落;耳が同時に別々のストリームを追跡しなければならない2人以上の重なった声の録音。これら3つのケースすべてで、目標はそこにないものを聞くことではなく、すでに録音されたものを正確に聞くための十分な時間を自分に与えることです。0.75xの再生速度はアクセントや密な段落には十分なことが多いです。0.5xの速度は、最初の数回のパスで言葉が解決されなかった短いセクションに役立ちます。

音声のセグメントを示す波形表示で、時間軸が水平に伸ばされてゆっくりした再生を表し、ピークと谷として見える音節の境界がある

速度とピッチ:単純な速度低下がうまく機能しない理由

音声を遅くする最も単純な方法は、録音よりも低いレートでサンプルを再生することです。これが古いテープレコーダーが遅くなる方法です:テープをゆっくり回すと、時間とピッチの両方が一緒に下がります。0.75xでは、声は短三度ほど下がります。0.5xでは、1オクターブ完全に下がります。結果は、音声を不自然に聞こえさせ、逆説的に理解しにくくする、あの馴染みのある遅くて深い歪みです。母音を区別するホルマント周波数がすべて下にシフトしてしまうからです。正しいアプローチはタイムストレッチです:周波数を変えずに音声の時間を変えます。すべての声のピッチは同じままで、音節が届く速度だけが変わります。これがaudio-speedツールとほとんどの専用文字起こしソフトウェアで使われているアプローチです。知覚的な結果は、遅くなった録音が同じスピーカーがゆっくりしたペースで話しているように聞こえることで、正確な文字起こしが目標の場合にまさに必要なものです。

タイムストレッチの仕組み:atempoアプローチ

実用的な音声ツールでタイムストレッチに最も広く使われているアルゴリズムはフェーズボコーダーに基づいており、ffmpegでの一般的な実装はatempoフィルターです。入力音声は、通常20〜40ミリ秒の短い重なったフレームに分割されます。アルゴリズムは隣接フレーム間の位相関係を分析し、連続するフレームが正しく整列するように位相を調整しながら修正されたレートで新しいフレームを合成します。結果は、時間が変わったが周波数内容は変わっていない連続した出力信号です。フレームが人間の声の典型的なピッチ周期に対して短いため、音声の基本周波数はストレッチ全体で保持されます。このアルゴリズムの副作用として、子音のクリックなどの急速な過渡現象は、ストレッチが大きいときにわずかにぼやける可能性があります。フレームオーバーラップ合成が小さな平均化を導入するためです。これは実装の欠陥ではなく、オーバーラップ加算アルゴリズムファミリーの固有の特性です。

オーバーラップ加算タイムストレッチプロセスのダイアグラム:左に入力音声フレーム、中央に重なった合成フレーム、右に伸ばされた出力波形

実用的な速度範囲と品質の限界

文字起こし作業では、2つの速度値がほとんどの実用的なニーズをカバーします。0.75xでは、音声は元の長さの133%に伸ばされます。子音クラスターと速い母音遷移が分離しやすくなり、変化が小さいためアルゴリズムが知覚できるアーティファクトをほとんど導入しません。ほとんどの聴衆は、文の自然なリズムを失うことなくこのレートで音声を追えます。0.5xでは、音声は元の長さの2倍に伸ばされます。これは1文や短い難しい段落に役立ちますが、数分間連続して聞くには遅すぎます;言葉が解決される前に集中力が落ちます。0.5x以下では、出力の品質が顕著に劣化します。オーバーラップ加算合成が持続した母音にフラッタリングや位相感を導入し始め、韻律を運ぶ子音と母音の間のタイミングキューが歪みます。ffmpegのatempoフィルターは1回のパスで最小0.5xを課しており、これがこの品質限界を反映しています。0.5x以下の値は2回のパスを連鎖させる必要があり、アーティファクトレベルがそれに従って上がります。ほぼすべての文字起こしユースケースで、0.75xまたは短いセグメントには最大0.5xにとどまることでクリーンで使える出力が得られます。

audio-speedツールでローカル処理する

このサイトのaudio-speedツールは、WebAssemblyにコンパイルされたffmpegを使ってブラウザ内で完全に実行されます。音声ファイルをページにドロップし、速度倍率を設定すると、処理がデバイス上で行われます。録音はいかなる時点でもマシンを離れません:アップロードなし、サーバーなし、サードパーティサービスなし。これは録音された会話、インタビュー、医療口述、法的手続き、およびその他の音声コンテンツが機密性の高い状況で重要です。このツールはffmpegが処理する一般的な音声フォーマットに対応しており、MP3、WAV、M4A、OGG、FLACも含まれます。出力は選択した速度でのダウンロード可能なファイルです。処理がローカルで実行されるため、かかる時間はファイルの長さとデバイスの速度に依存します。数分の音声は、モダンなラップトップでは通常1分もかからずに処理されます。ツールはこの記事で説明したものと同じatempoフィルターを使うため、上記で説明した品質特性が出力に直接適用されます。

この記事で紹介するツール

よくある質問

音声を遅くするとピッチも変わりますか?

方法によります。単純な再生レートの低下はピッチを変えます:0.5xでは、声が1オクターブ下がります。audio-speedツールはタイムストレッチ(atempoフィルター)を使い、ピッチを変えずに長さを変えるので、声は元の周波数のままです。

クリーンに聞こえる最も遅い速度はどのくらいですか?

0.75xでは、ほとんどの録音でクリーンな出力が得られます。0.5xでは、短い段落には許容できます。0.5x以下では、オーバーラップ加算アルゴリズムが持続した母音と子音の遷移に聞こえるアーティファクトを導入し始めます。文字起こし作業では、0.5x以上にとどまることで最良の結果が得られます。

audio-speedツールを使うときにファイルはアップロードされますか?

いいえ。audio-speedツールはすべてブラウザ内で実行されます。ファイルはWebAssemblyを使ってデバイス上でローカルに処理されます。サーバーには何も送信されないため、録音の内容はプライベートなままです。