アップロードなし, 100%ローカル, アカウントなし

スキャンしたPDFを検索可能にする

スキャンしたPDFをドロップすると、同じページに目に見えない検索可能なテキスト層が追加されて戻ってきます。認識処理はすべてブラウザ内で行われ(端末上、初回読み込み後はオフラインでも可)、何もアップロードされません。

PDF OCR・検索可能化の仕組み

PDF OCRは、実際のテキストを持たないページ画像だけで構成されたスキャンPDFを、検索可能なPDFに変換します。ページ画像そのものはそのまま残し、認識した各単語の上に見えないテキストレイヤーを重ねます。結果をどのPDFリーダーで開いても、Ctrl+Fで単語を検索したり、段落を選択・コピーしたり、検索エンジンに文書をインデックスさせたりできるようになります。これらはすべて、単なるスキャンではできないことです。認識処理自体はtesseract.js(OCRツールで使われているのと同じセルフホスト型OCRエンジン)で行い、ページのレンダリングはpdf.jsで行います。どちらもすべてブラウザのタブ内で実行され、ファイルがアップロードされることはありません。

このツールは、できることとできないことを正直に説明します。レイアウトや表、フォントを再構築するものではなく、編集可能な文書への変換ツールでもありません。表示されるページは元のスキャンと同一の画像のままで、その見た目の下に見えないテキストレイヤーが追加されるだけです。認識精度はスキャンの質に左右されます。これはどのOCRエンジンにも共通する話で、200DPI以上、高コントラスト、傾きのないページが望ましいという指針が当てはまります。検索可能なPDFではなく、抽出したプレーンなテキストだけが必要な場合は、OCRツールを使えば.txtファイルが得られ、その用途にはより高速です。

PDF OCR・検索可能化の使い方をステップごとに解説

  1. スキャンしたPDF(各ページが画像で、既存のテキストレイヤーを持たないもの)をアップロードエリアにドロップします。
  2. 言語ドロップダウンから文書の主な言語を選択します。
  3. このツールを初めて使う場合は、tesseract.jsエンジンのダウンロードが完了するまで待ちます(これは一度きりです)。
  4. 実行をクリックし、各ページが順にレンダリング・認識されるのを待ちます。
  5. 検索可能なPDFをダウンロードします。見た目は同じままで、下にテキストレイヤーが追加されています。

よくある使用例

  • スキャンした契約書を検索可能にし、全ページを読まなくてもCtrl+Fで特定の条項を見つけられるようにする。
  • 実際のPDFテキストしか読み取らない検索インデックスを持つ文書アーカイブに、大量のスキャン済み請求書を登録する。
  • 撮影またはスキャンしたフォームの印字ラベルを選択可能にし、段落をメールにコピーできるようにする。
  • ドイツ語のスキャン済み報告書のライブラリを全文検索できるようにする場合は、ツールを実行する前に言語としてドイツ語を選択する。

よくある質問

通常のOCRツールとは何が違いますか?

OCRツールは元のレイアウトや画像をすべて捨てて、プレーンなテキストを.txtファイルとして抽出します。PDF OCRは元のPDFのページ画像をそのままの見た目で保持し、その下に見えない検索可能なテキストレイヤーを追加します。文字だけが欲しい場合はOCRツールを、文書をPDFのまま検索・選択可能にしたい場合はPDF OCRを使ってください。

出力されるPDFは、元のスキャンと見た目が変わりますか?

いいえ。各ページは元のPDFからレンダリングされ、(JPEGの再エンコードによる差を除けば)元のスキャンとピクセル単位で同一の画像として再度埋め込まれます。認識した単語は不透明度0の状態で上に描画されるため、見た目上は何も変わりません。テキスト検索や範囲選択をして初めて、追加されたレイヤーに気づく形になります。

このツールは表や段組み、フォントを再構築しますか?

いいえ。出力されたページは1枚のフラットな画像のままです。見えないテキストレイヤーは認識した単語の位置に沿って配置されますが、表の構造や、tesseract.jsが推測する以上の複数段組みの読み順、元のフォントは保持されません。これはあくまで検索可能にするためのレイヤーであり、編集可能なテキストへの文書変換ではありません。

処理中にスキャンした文書がどこかに送信されることはありますか?

いいえ。tesseract.jsエンジンと言語パックを当サイトからダウンロードした後(初回利用時のみ、数メガバイト程度の一度きりのダウンロード)、ページのレンダリングと認識処理はすべてブラウザのタブ内で完結します。スキャンした契約書や医療記録などの機密文書がサーバーに届くことはありません。

長いPDFの処理に時間がかかるのはなぜですか?

各ページは画像としてレンダリングされ、それぞれに対して個別にOCRが実行されます。これらはすべてブラウザのタブ内で行われるため、処理時間はページ数に比例して増えます。プログレスバーは実際のページ単位の進捗を反映しており、ブラウザタブのメモリ制約内に処理全体を収めるため、ファイルサイズは80MBまでに制限されています。

PDFにすでに選択可能なテキストがある場合はどうすればよいですか?

すでに実際のテキストレイヤーを持つPDFにOCRをかける必要はありません。リーダーで開いてCtrl+Fを押せば、すでに検索できるはずです。このツールは、フラットベッドスキャナーの一般的な出力や、撮影した文書を「PDFに印刷」したものなど、下地にテキストを持たないページ画像だけで構成されたPDFのためのものです。