アップロードなし, 100%ローカル, アカウントなし

記事

ポッドキャスト用に音声をクリーニングして準備する

生の音声録音は通常、公開準備が整う前に3つのことが必要です:一貫したラウドネスレベル、ストリーミングプラットフォームが期待するフォーマットとビットレート、そしてノイズ除去が実際に何を提供できるかについての正直な評価。この記事では、audio-volume、vocal-remover、audio-converterを使ったそれらのステップを解説します。すべてブラウザ内でローカルに実行されます。

ラウドネス対ピーク:LUFSがピークレベルより重要な理由

ピークレベルは音声ファイル内の単一の最も大きなサンプルを測定します。ラウドネスはLUFS(フルスケールに対するラウドネスユニット)で表され、時間をかけて知覚されるエネルギーを測定します。-3 dBFSピークで録音されたポッドキャストは、信号のほとんどがずっと低い場合にはまだ静かに聞こえます。ストリーミングプラットフォームとポッドキャストディレクトリは再生時にターゲットラウドネスに音声を正規化します。通常、音楽サービスで-14 LUFS、スポークンワードで-16 LUFSです。そのため、大きく異なるレベルで提出すると、プラットフォームがいずれにせよ音声を上げ下げします。-16 LUFSの統合ラウドネスをターゲットにすることで、プラットフォームのデフォルトに合い、他の番組と一貫しており、0 dBFSのデジタル上限の前に少しヘッドルームを残す完成したファイルが得られます。インターサンプルオーバーを考慮したトゥルーピークは、通常-1 dBTP以下に保たれます。この2つの数値を合わせて狙うことで、ピークターゲットだけを追うよりきれいな結果が得られます。

ヘッドフォンを付けた人物がコンピューターの前でデスクトップマイクに向かってポッドキャストを録音している
Photo: Guillaume Bonzoms, CC0, via Wikimedia Commons

audio-volumeによるゲインと正規化

audio-volumeはファイルのゲインをデシベルで調整するか、ラウドネス正規化を適用します。録音が一貫して静かな場合、dBでゲインを追加すると信号全体が固定量だけ上がります。リスクはクリッピングです:ピークが0 dBFSに近い場合、正のゲインオフセットがそれを超えてデジタル歪みを引き起こします。ゲインを適用する前に波形を確認し、調整後のトゥルーピークを-1 dBFS以下に保ってください。ラウドネス正規化は別のアプローチを取ります。ツールはFFmpegのloudnormフィルターを、一部のポッドキャストプラットフォームが推奨するより大きな値ではなく、既定のターゲットである統合ラウドネス-24 LUFSで実行します。シングルパスのloudnormは固定のゲインオフセットではなく動的な処理です。時間経過に伴うラウドネスを追跡してターゲットに収束するよう信号を調整するため、レベルが不安定な録音では軽いダイナミックレンジ圧縮のような挙動になることがあります。文の間でレベルが大きく変動する音声録音では、正規化前に専用のコンプレッサーやリミッターを適用する方が依然としてより制御された結果をもたらしますが、それらのステップはaudio-volumeが処理する範囲外です。

センターチャンネルキャンセレーションにできること・できないこと

vocal-removerはセンターチャンネルキャンセレーション技術を適用します。ステレオファイルでは、同じレベルと位相で左右の両チャンネルに同一に現れる信号はセンターパンされていると言われます。右チャンネルから左を引くと、そのセンター位置に座っているものが除去され、主にサイドにパンされたコンテンツが残ります。これが、商業的にマスタリングされた音楽トラックのカラオケ効果を作り出します。そこではリードボーカルは通常センターパンされています。音声モデルを使って声を検出したり分離したりしません。バックグラウンドノイズ、部屋の残響、HVACのハム、または交通音は除去しません。位相差を利用する空間がないモノラル録音では、一チャンネルの録音から環境音からポッドキャストの声を分離しません。結果は保持されたコンテンツのステレオ幅も劣化させます。騒がしい部屋で録音されたポッドキャストトラックには、センターチャンネルキャンセレーションは間違ったツールです。アコースティックトリートメント、指向性マイク、または専用のオーディオエディターのゲートプラグインが、バックグラウンドノイズの実用的なオプションです。

左右のチャンネルが別々に表示されたステレオ音声ファイルのダイアグラム;センターパンされた信号は両チャンネルで同一で、引き算されてサイドパンされたコンテンツが残る。

配信用エクスポート:フォーマット、ビットレート、モノ対ステレオ

ほとんどのポッドキャストディレクトリはMP3とAACを受け付けます。MP3は最も互換性のある選択で、すべてのプレイヤーとプラットフォームがサポートしています。同じビットレートのAACはわずかに効率的ですが、.m4aなどのサポートされたコンテナが必要です。シングルボイスのポッドキャストでは、64 kbpsモノMP3が一般的に十分です:音声は狭い周波数範囲を占め、モノはチャンネルの冗長性を除去します。番組に音楽、効果音、または効果のためにパンされた複数のホストがある場合は、128 kbpsステレオで余分なヘッドルームが得られます。音声に対して128 kbpsを超えると聴覚的な改善はなく、遅い接続のリスナーにとってダウンロード時間に影響するファイルサイズが増加します。64 kbpsモノでの60分のエピソードは約28 MB;128 kbpsステレオでは約56 MBです。エクスポート前にモノにミックスダウンすると、同じビットレートのステレオと比べてデータが半分になります。audio-converterがフォーマットとビットレートの選択を処理します。互換性のためにサンプルレートを44.1 kHzに設定してください;48 kHzはビデオ規則であり、音声のみの配信には必要ありません。

ローカルで実行:ファイルはデバイスを離れない

audio-volume、vocal-remover、audio-converterはすべてWebAssemblyを使ってブラウザ内で実行されます。音声処理はブラウザのメモリ内で行われ;ファイルはローカルディスクから読み込まれ、デバイス上で完全に処理され、出力がローカルダウンロードとして提供されます。サーバーには何も送信されません。これは、コンテンツが機密性の高いポッドキャスト制作で重要です:公開前に録音されたインタビュー、エンバーゴ下の会話、またはサードパーティサーバーに置きたくない録音。同じ制約が制限にも適用されます:ツールは実装がサポートするものを行い、それ以上ではありません。audio-volumeはゲインとラウドネス正規化を適用します。vocal-removerはセンターチャンネルキャンセレーションを適用します。audio-converterはフォーマットとビットレートを変換します。各ツールは1つの定義された処理を行い、出力はローカルハードウェアが計算できるものです。

この記事で紹介するツール

よくある質問

-16 LUFSとは何で、なぜポッドキャストのターゲットなのですか?

-16 LUFSは、ほとんどのポッドキャストアプリとディレクトリが再生時に正規化する統合ラウドネスレベルです。-16 LUFSで提出することで、エピソードがプラットフォームが大きな自動補正を適用することなく、あなたが意図したおよそのレベルで再生されます。この値は放送ラウドネスのITU-R BS.1770標準から来ており、Apple PodcastsとSpotifyがスポークンワードコンテンツ向けに採用しています。

vocal-removerはポッドキャスト録音からバックグラウンドノイズを除去できますか?

いいえ。vocal-removerはセンターチャンネルキャンセレーションを適用し、両方のステレオチャンネルで同一の信号を引きます。ポッドキャスト録音のバックグラウンドノイズはキャンセレーションがターゲットにできる形でセンターパンされておらず、モノ録音ではそもそも利用できるチャンネル差がありません。バックグラウンドノイズ低減には、アコースティックトリートメント、指向性マイク、またはオーディオエディターの専用ノイズゲートやスペクトル修復ツールを使用してください。

ポッドキャストをモノとステレオのどちらでエクスポートすべきですか?

シングルボイスの録音では、64 kbps MP3モノが標準的な選択です。同じビットレートのステレオと比べてファイルサイズが半分になり、音声に対して聴覚的なデメリットはありません。エピソードに音楽、意図的にパンされた複数のホスト、またはチャンネル分離に依存するサウンドデザインがある場合はステレオを使用してください。