OCR · 画像/PDFをテキストにの仕組み
OCRは、ブラウザ内で完全に動作する tesseract.js を使用して、スキャンした画像または画像ベースのPDFをコピー、検索、編集できるテキストに変換します。セレクターからドキュメントの言語を選択すると、関連する言語モデルが一度だけブラウザにダウンロードされ、それ以降のすべての認識はそのキャッシュされたモデルを使ってオフラインで実行されます。変換中にスキャンしたファイルがサーバーに送信されることはありません。
認識精度はスキャン品質に強く依存します。200 DPI以上のクリーンで高コントラストのスキャン、背景ノイズが少なく、ページが真っ直ぐなものが最良の結果を生成します。ぼやけた低解像度または強く圧縮されたJPEG、段組みや複雑なレイアウトを持つページ、手書きテキストはすべて精度を下げます。ツールはプレーンテキストブロックを出力します。保持された表や複数段組のレイアウトなどの構造化出力には後処理が必要です。OCRの前に傾いたスキャンにPDF傾き補正ツールを実行すると、通常認識率が向上します。