PDFから画像を抽出の仕組み
PDFから画像を抽出するツールは、PDFに埋め込まれた元のラスター画像を直接取り出し、それぞれを別々のPNGファイルとして保存します。これにより、ページがどのように見えるかのスクリーンショットをレンダリングするのではなく、ドキュメントに配置された実際の写真、ロゴ、またはスキャンを、保存された解像度で回復します。抽出はブラウザ内でpdf-libによって行われ、元のPDFはネットワークを通じて転送されません。
これはPDFページを画像に変換するのとは異なります。ページ変換は、テキスト、枠線、背景を含む完全なページレイアウトを選択したDPIで単一のラスター画像にレンダリングします。画像抽出は、PDFの内部オブジェクトグラフを走査して各画像リソースをそのままの形で取り出し、元のピクセル寸法とカラースペースを保持します。ページが単一の全面写真で構成されている場合、その写真が保存サイズで返されます(ページサイズのレンダリングではありません)。PDFに埋め込まれたラスター画像がなく(ベクターグラフィックスまたはテキストのみの場合)、ツールは抽出するものが見つかりません。