PDF OCR · 让扫描件可搜索 的工作原理
PDF OCR 可以把由纯图像页面组成、没有真实文字的扫描版 PDF 转换成可搜索的 PDF:保留相同的页面图像,并在每个识别出的单词上方叠加一层不可见的文字层。在任何 PDF 阅读器中打开结果,您现在就可以用 Ctrl+F 查找单词、选中并复制一段文字,或者让搜索引擎为该文档建立索引,这些都是普通扫描件做不到的事。识别本身由 tesseract.js 完成(与本站 OCR 工具使用的自托管 OCR 引擎相同),页面渲染由 pdf.js 完成,两者都完全在您的浏览器标签内运行,您的文件从不会被上传。
这个工具对自己能做什么、不能做什么很坦诚。它不会重建版式、表格或字体,也不是一个可编辑文档转换器:可见的页面保持原样,与源扫描件一致,只是在外观下方添加了一层隐藏文字。识别准确率取决于扫描质量,与其他任何 OCR 引擎一样,建议使用 200 DPI 以上、对比清晰、页面端正的扫描件。如果您只需要提取出来的纯文本,而不是一份可以在里面搜索的 PDF,OCR 工具会直接生成 .txt 文件,处理这项具体任务时速度更快。