Як працює PDF OCR · зробити придатним для пошуку
PDF OCR перетворює сканований PDF, тобто файл із зображеннями сторінок без реального тексту, на PDF із можливістю пошуку: ті самі зображення сторінок плюс невидимий текстовий шар, розташований поверх кожного розпізнаного слова. Відкрийте результат у будь-якій програмі для читання PDF, і тепер можна натиснути Ctrl+F, щоб знайти слово, виділити й скопіювати абзац або дозволити пошуковій системі індексувати документ, тобто все те, чого не дозволяє звичайний скан. Саме розпізнавання виконує tesseract.js (той самий самостійно розміщений механізм OCR, який використовує інструмент OCR), а рендеринг сторінок виконує pdf.js; обидва працюють повністю у вкладці вашого браузера, і ваш файл ніколи не завантажується.
Цей інструмент чесно повідомляє, що він робить, а що ні. Він не відтворює макет, таблиці чи шрифти і не є конвертером у редагований документ: видима сторінка залишається зображенням, ідентичним вихідному скану, з прихованим текстовим шаром, доданим під зовнішнім виглядом. Точність розпізнавання залежить від якості скану: ті самі рекомендації щодо роздільної здатності від 200 DPI, високого контрасту й рівного положення сторінки, що застосовуються до будь-якого механізму OCR. Якщо вам потрібен лише простий витягнутий текст, а не PDF із можливістю пошуку, інструмент OCR натомість створює файл .txt і працює швидше саме для цього завдання.