PDF OCR · 讓掃描檔可搜尋 的運作方式
PDF OCR 會把一份掃描 PDF(也就是只由頁面影像組成、沒有真正文字的檔案)變成可搜尋的 PDF:頁面影像維持不變,只是在每個辨識出的字詞上方,疊加一層看不見的文字層。用任何 PDF 閱讀器打開結果,你現在就能用 Ctrl+F 找字、選取並複製一段文字,或讓搜尋引擎為文件建立索引,這些都是純掃描檔做不到的事。辨識本身是用 tesseract.js 完成的(和 OCR 工具用的是同一套自架 OCR 引擎),頁面渲染則用 pdf.js;兩者都完全在你的瀏覽器分頁中執行,檔案不會被上傳。
這個工具對自己能做什麼、不能做什麼很誠實。它不會重建版面、表格或字型,也不是可編輯文件轉換工具:看得見的頁面仍然是一張圖片,和來源掃描檔一模一樣,只是外觀底下多了一層隱藏的文字。辨識準確度取決於掃描品質,適用的仍是任何 OCR 引擎共通的建議:至少 200 DPI、對比清晰、頁面端正。如果你只需要純文字內容,而不需要能在裡面搜尋的 PDF,OCR 工具會直接產生 .txt 檔,處理這類需求也更快。