Без завантаження, 100% локально, без облікового запису

Зробіть скановану PDF придатною для пошуку

Перетягніть скановану PDF і отримайте ті самі сторінки з доданим невидимим текстовим шаром, придатним для пошуку. Розпізнавання відбувається повністю у вашому браузері (локально, офлайн після першого завантаження), нічого не надсилається на сервер.

Як працює PDF OCR · зробити придатним для пошуку

PDF OCR перетворює сканований PDF, тобто файл із зображеннями сторінок без реального тексту, на PDF із можливістю пошуку: ті самі зображення сторінок плюс невидимий текстовий шар, розташований поверх кожного розпізнаного слова. Відкрийте результат у будь-якій програмі для читання PDF, і тепер можна натиснути Ctrl+F, щоб знайти слово, виділити й скопіювати абзац або дозволити пошуковій системі індексувати документ, тобто все те, чого не дозволяє звичайний скан. Саме розпізнавання виконує tesseract.js (той самий самостійно розміщений механізм OCR, який використовує інструмент OCR), а рендеринг сторінок виконує pdf.js; обидва працюють повністю у вкладці вашого браузера, і ваш файл ніколи не завантажується.

Цей інструмент чесно повідомляє, що він робить, а що ні. Він не відтворює макет, таблиці чи шрифти і не є конвертером у редагований документ: видима сторінка залишається зображенням, ідентичним вихідному скану, з прихованим текстовим шаром, доданим під зовнішнім виглядом. Точність розпізнавання залежить від якості скану: ті самі рекомендації щодо роздільної здатності від 200 DPI, високого контрасту й рівного положення сторінки, що застосовуються до будь-якого механізму OCR. Якщо вам потрібен лише простий витягнутий текст, а не PDF із можливістю пошуку, інструмент OCR натомість створює файл .txt і працює швидше саме для цього завдання.

PDF OCR · зробити придатним для пошуку: покрокова інструкція

  1. Перетягніть сканований PDF (по одному зображенню сторінки на кожну сторінку, без наявного текстового шару) у зону завантаження.
  2. Оберіть основну мову документа у випадному списку мов.
  3. Якщо ви користуєтеся інструментом уперше, зачекайте на завантаження механізму tesseract.js (це відбувається лише один раз).
  4. Натисніть «Запустити» і зачекайте, поки кожна сторінка по черзі відрендериться й розпізнається.
  5. Завантажте PDF із можливістю пошуку: той самий вигляд, але тепер із текстовим шаром під ним.

Поширені сценарії використання

  • Сканований договір потрібно зробити придатним для пошуку, щоб знайти конкретний пункт через Ctrl+F, а не читати кожну сторінку.
  • Пакет сканованих рахунків потрібно додати до архіву документів, індекс пошуку якого читає лише реальний текст PDF.
  • Друковані підписи сфотографованого чи сканованого бланка потрібно зробити такими, що виділяються, щоб скопіювати абзац у лист електронної пошти.
  • Бібліотеці сканованих звітів німецькою мовою потрібен повнотекстовий пошук; оберіть німецьку як мову перед запуском інструмента.

Поширені запитання

Чим це відрізняється від звичайного інструмента OCR?

Інструмент OCR витягує простий текст у файл .txt, повністю відкидаючи оригінальний макет і зображення. PDF OCR зберігає оригінальні зображення сторінок PDF точно такими, як вони виглядають, і додає під ними невидимий текстовий шар із можливістю пошуку. Використовуйте OCR, коли потрібні лише слова; використовуйте PDF OCR, коли хочете зберегти документ у форматі PDF, але зробити його придатним для пошуку й виділення.

Чи виглядатиме вихідний PDF інакше, ніж мій скан?

Ні. Кожна сторінка рендериться з вашого вихідного PDF і повторно вбудовується як зображення, пікселем ідентичне оригінальному скану (з поправкою на повторне кодування JPEG). Розпізнані слова малюються поверх із нульовою непрозорістю, тож нічого нового не видно; помітити доданий шар можна лише через пошук тексту чи його виділення.

Чи відтворює інструмент таблиці, колонки або шрифти?

Ні. Результат зберігає сторінку як єдине плоске зображення; невидимий текстовий шар слідує позиціям розпізнаних слів, але не зберігає структуру таблиць, порядок читання багатоколонкового тексту понад те, що визначає tesseract.js, чи оригінальні шрифти. Це шар для пошуку, а не конвертація документа в редагований текст.

Чи надсилаються мої скановані документи кудись під час обробки?

Ні. Після завантаження механізму tesseract.js і мовного пакета з цього сайту (одноразове завантаження в кілька мегабайтів під час першого використання) кожен рендер сторінки і кожен прохід розпізнавання відбуваються повністю у вкладці вашого браузера. Скановані договори, медичні записи чи інші конфіденційні документи ніколи не потрапляють на сервер.

Чому обробка довгого PDF займає багато часу?

Кожна сторінка рендериться в зображення, і OCR запускається для цього зображення окремо; усе це відбувається у вкладці вашого браузера, тому час обробки зростає пропорційно кількості сторінок. Індикатор прогресу відображає реальний прогрес по кожній сторінці, а розмір файлів обмежено 80 МБ, щоб увесь процес укладався в бюджет пам'яті вкладки браузера.

Що робити, якщо мій PDF уже має текст, що виділяється?

Запускати OCR на PDF, який уже містить реальний текстовий шар, не потрібно: відкриття у програмі для читання та натискання Ctrl+F уже працює. Цей інструмент призначений для PDF, що складаються із зображень сторінок без базового тексту, типового результату планшетного сканера чи «друку в PDF» сфотографованого документа.