OCR · 图片/PDF 转文本 的工作原理
OCR 工具使用完全在浏览器内运行的 tesseract.js,将扫描图像或基于图像的 PDF 转换为可复制、可搜索、可编辑的文本。你从选择器中选择文档语言,相关语言模型一次性下载到你的浏览器,此后所有识别工作均可从缓存模型离线运行。你的扫描文件在转换过程中从不传输到任何服务器。
识别准确性在很大程度上取决于扫描质量。200 DPI 以上的清晰高对比度扫描,背景噪声少、页面对齐良好,能产生最佳效果。模糊、低分辨率或过度压缩的 JPEG、有栏目或复杂版式的页面,以及手写文本,都会降低准确性。该工具输出纯文本块;对于需要保留表格或多栏版式的结构化输出,需要后处理。在 OCR 之前对倾斜扫描运行 PDF 纠偏工具通常可以提高识别率。