Как работает OCR · изображение/PDF в текст
OCR конвертирует отсканированное изображение или PDF на основе изображений в текст, который можно копировать, искать и редактировать, используя tesseract.js, работающий полностью внутри браузера. Вы выбираете язык документа в селекторе, соответствующая языковая модель загружается в браузер один раз, и всё последующее распознавание выполняется офлайн на основе кэшированной модели. Отсканированные файлы никогда не передаются на сервер в процессе конвертации.
Точность распознавания сильно зависит от качества скана. Чистые высококонтрастные сканы от 200 DPI и выше с минимальным фоновым шумом и ровным выравниванием страниц дают наилучшие результаты. Размытые, низкоразрешающие или сильно сжатые JPEG, страницы с колонками или сложными макетами, а также рукописный текст снижают точность. Инструмент выводит блок обычного текста; для структурированного вывода с сохранёнными таблицами или многоколоночным макетом требуется постобработка. Запуск инструмента PDF Deskew на перекошенных сканах перед OCR обычно улучшает качество распознавания.