PDFをテキストに変換の仕組み
PDF to Textは、PDFから既存のテキストレイヤーを抽出してプレーンな.txtファイルとして保存します。抽出はブラウザ内の pdf.js が行い、PDFのページストリームに埋め込まれたテキストコンテンツオブジェクトを読み取ります。ドキュメントはデバイスから離れることなく、結果はローカルで組み立てられて直接ダウンロードとして提供されます。
このツールはファイル内にすでに存在するテキストレイヤーを読み取ります。ワードプロセッサやエクスポートツールで作成されたPDFであれば、ほぼ確実にテキストレイヤーが存在し、抽出はうまく機能します。PDFが紙のドキュメントのスキャンである場合、ページには画像データしか含まれておらず、抽出できるテキストレイヤーがないため、このツールは空または不完全な出力を返します。スキャンされたPDFはテキストを生成するために光学文字認識(OCR)が必要で、それはこのツールが行う別のプロセスです。このツールを使用する前に、ビューアでPDFのテキストが選択可能かどうか確認してください。