Как работает OCR PDF · сделать документ доступным для поиска
PDF OCR превращает отсканированный PDF, состоящий из изображений страниц без настоящего текста, в PDF с возможностью поиска: те же изображения страниц плюс невидимый текстовый слой, размещённый поверх каждого распознанного слова. Откройте результат в любой программе для чтения PDF, и теперь вы можете использовать Ctrl+F для поиска слова, выделять и копировать абзац или дать поисковой системе проиндексировать документ. Всё это обычный скан сделать не позволяет. Само распознавание выполняется движком tesseract.js (тот же самостоятельно размещённый OCR-движок, что используется в инструменте OCR), а отрисовка страниц библиотекой pdf.js; оба работают полностью во вкладке браузера, и ваш файл никогда не загружается на сервер.
Этот инструмент честно говорит о том, что он делает и чего не делает. Он не восстанавливает вёрстку, таблицы или шрифты и не является конвертером в редактируемый документ: видимая страница остаётся картинкой, идентичной исходному скану, а под ней добавляется скрытый текстовый слой. Точность распознавания зависит от качества скана: действуют те же рекомендации (разрешение от 200 DPI, высокий контраст, ровное расположение страницы), что применимы к любому OCR-движку. Если вам нужен только обычный извлечённый текст, а не PDF с возможностью поиска, инструмент OCR создаёт вместо этого файл .txt и справляется с этой конкретной задачей быстрее.