アップロードなし, 100%ローカル, アカウントなし

ハウツー

PDFに埋め込まれた画像を抽出する方法

PDFから画像を抽出するという言葉には2つの異なる意味があり、それぞれ別のツールが必要です。このガイドでは、文書の中に配置された元の画像ファイル、つまりデザイナーがパンフレットに入れた写真、レポートのロゴ、契約書の中のスキャン画像を取り出す方法を扱います。これは各ページを画像に変換することとは違います。テキストやレイアウトを含めたページ全体の見た目のスナップショットが欲しい場合は、代わりにPDFからJPGへのツールをお使いください。ここで紹介する抽出ツールはPDFに保存されたラスター画像オブジェクトを読み取り、元の解像度のまま元画像そのものを、すべてブラウザ内で返します。

手順

  1. PDF画像抽出ツールを開き、ファイルをドロップします。ツールは文書をローカルで読み取り、見つかった埋め込み画像の数を一覧表示します。何もどこにも送信されません。解析はお使いの端末上のブラウザタブ内で行われます。
    文書を読み込み、見つかった埋め込み画像の数を表示しているPDF画像抽出ツール
  2. 埋め込み画像オブジェクトのスキャンを実行させます。すべてのページを走査し、見つかった各ラスター画像を収集し、重複するソフトマスクのコピーを取り除くので、同じ画像が2つできてしまうことはありません。ページや形式の設定を選ぶ項目はありません。目的は、再エンコードせず保存されていたとおりに元画像をそのまま返すことだからです。
  3. 結果をダウンロードします。画像が1つの場合は1ファイルとして返り、複数の場合はそれぞれ個別のダウンロードとして提供され、名前が付けられ順序も保たれます。各ファイルはPDF内で持っていた形式を保ち、写真はJPEG、透過のある図版はPNGになるのが一般的です。
    1画像につき1ファイルとしてダウンロード準備が整った抽出済み画像

埋め込み画像と画像化されたページの違い

これがどちらのツールを使うべきかを決める違いです。埋め込み画像とは、作成者がPDFの中に配置した写真や図版で、この抽出ツールはそのファイルを、保存されていたとおりに、実際のピクセルサイズで、周囲に何も描き加えずに返します。ページの画像化はその逆です。PDFからJPGへの変換は、ページ上のすべて(テキスト、ベクター図形、背景、そして埋め込み画像を一緒に)を、選んだ解像度で1枚の平坦なラスター画像に描き出します。製品写真を再利用するなど、元の素材を取り戻したいときは抽出ツールを使います。読者が見るとおりのページを忠実にスナップショットしたいときはPDFからJPGへのツールを使います。

これをローカルで行うことが重要な理由

PDFに埋め込まれた画像は、その中で最も機微な部分であることがよくあります。スキャンした身分証の写真、署名済みのページ、社内のスクリーンショット、非公開のアートワークなどです。文書をオンラインの抽出サービスに送ると、テキスト層やあらゆるメタデータとともに、それらすべてを自分の管理下にないサーバーに渡すことになります。ここで紹介する抽出ツールはブラウザ内のPDF.jsでPDFを開き、お使いの端末上で画像オブジェクトを取り出すので、ファイルとその中身はすべて端末に留まります。

PDF画像抽出の仕組み

PDFから画像を抽出することは、ページをラスタースクリーンショットに変換することとは異なります。PDFファイル内部では、画像は寸法とカラースペースのメタデータとともに、生のバイナリデータ(多くはDCTDecode/JPEG、Flate、JPX、CCITTエンコード)を含む独立した/XObjectストリームディクショナリとして格納されています。適切な抽出ツールはこれらのストリームを直接解析し、再エンコードすることなく各画像を取り出します。生のバイトを再レンダリングせずに読み取るため、抽出されたファイルは画像が最初に埋め込まれた時の正確な解像度、カラープロファイル、品質を保持します。再圧縮ステップがないため、PDFが何回再保存されていても追加の品質損失は生じません。

このガイドで使うツール

よくある質問

元の画像が手に入りますか、それともページのスクリーンショットですか?

元の画像です。このツールは、PDFに保存されていたとおりの埋め込み画像ファイルを、ネイティブ解像度のまま元の形式で返します。代わりに各ページ全体(テキストやレイアウトを含む)の画像が欲しい場合は別の作業になります。選んだ解像度でページ全体をラスター化するPDFからJPGへのツールをお使いください。

予想より見つかった画像が少なかったのはなぜですか?

PDFには、作成者が実際にラスターファイルを配置した箇所にしか埋め込み画像は含まれません。ベクター図形、PDFの描画命令で描かれたグラフ、テキストは画像ではないので抽出されません。また、このツールは一部の書き出しで生成される重複したソフトマスクのコピーを取り除くため、数が減ることがあります。ページ自体がスキャン画像の場合は、通常1枚のページ全体の画像を保持しており、それが返ってくるものになります。