Інструкція
Зробіть скановану PDF придатною для пошуку
Скована PDF виглядає як звичайний документ, але насправді це картинка сторінки: Ctrl+F нічого не знаходить, і виділити чи скопіювати жодне слово не можна. Інструмент «PDF OCR» виправляє це, не змінюючи суті файлу. Він зчитує зображення кожної сторінки, розпізнає символи локальним рушієм OCR і накладає розпізнаний текст невидимо поверх того самого зображення, тож PDF і далі виглядає й друкується точно так само, як раніше, але тепер реагує на пошук і виділення тексту. Файл ніколи не залишає ваш пристрій.
Крок за кроком
- Відкрийте інструмент «PDF OCR» і перетягніть свою скановану PDF. Приймаються лише файли PDF, обмежені 80 МБ; типовий багатосторінковий скан значно менший за цю межу.
- Оберіть мову документа зі спадного списку (англійська, французька, німецька, іспанська, португальська чи італійська) і, за бажанням, змініть назву вихідного файлу. За замовчуванням розширення .pdf зберігається автоматично.
- Натисніть «Виконати» і зачекайте, поки обробиться кожна сторінка. Кожна сторінка рендериться, проходить через рушій OCR і отримує власний невидимий текстовий шар, перш ніж інструмент перейде до наступної, тож довгий документ обробляється довше, ніж одна сторінка. Завантажте результат: він відкривається і друкується ідентично оригіналу, але тепер працюють Ctrl+F, виділення тексту й копіювання.
Придатна для пошуку PDF чи простий текст: що вам насправді потрібно
Цей інструмент і звичайний інструмент OCR розвʼязують одну й ту саму базову проблему, розпізнавання тексту на сканованому зображенні, але зберігають різні речі. Інструмент OCR відкидає зображення сторінки і повертає простий файл .txt: використовуйте його, коли хочете вставити слова в редактор, перекласти їх чи знайти пошуком як текст, і вам байдуже до збереження оригінального вигляду документа. «PDF OCR» тут зберігає оригінальну PDF точно такою, якою вона є, з усіма зображеннями сторінок, і лише додає прихований текстовий шар знизу: використовуйте його, коли документ і надалі має залишатися PDF, який можна друкувати, надсилати поштою чи архівувати, але ви також хочете мати змогу шукати чи копіювати з нього. Жоден з інструментів не відновлює макет як редагований текст із реальними шрифтами й таблицями; обидва працюють з однаковим розпізнаним текстом, лише пакують його по-різному.
Чому результат залежить від скану і де межі можливостей
Точність розпізнавання відстежує якість вихідного зображення так само, як і для звичайного OCR: чіткий, рівний скан приблизно 200-300 DPI розпізнається надійно, тоді як розмите фото, перекошена сторінка чи сильні тіні дають більше помилково розпізнаних слів. Якщо сторінка вийшла криво, вирівняйте її інструментом «Вирівнювання PDF» перед запуском OCR, щоб етап розпізнавання читав рівний текст. Інструмент охоплює шість мов (англійську, французьку, німецьку, іспанську, португальську, італійську); документ незтримуваною мовою розпізнається некоректно. Обробка йде посторінково прямо у вкладці вашого браузера, тож документ на десятки сторінок обробляється помітно довше, ніж двосторінковий скан, а файл обмежений 80 МБ. Вихідна PDF також зазвичай має схожий на оригінал розмір, оскільки самі зображення сторінок не змінюються; якщо потім потрібен менший файл, пропустіть його через компресор PDF.
Як будується невидимий текстовий шар
Кожна сторінка PDF спочатку растеризується у зображення canvas у вашому браузері, той самий етап рендерингу, що й в інструменті «PDF у зображення». Рушій OCR (Tesseract, скомпільований у WebAssembly) зчитує це зображення і повертає кожне розпізнане слово разом з його обмежувальною рамкою, тобто позицією на сторінці. Ці слова потім малюються назад на копії оригінальної сторінки PDF у своїх розпізнаних позиціях, але з нульовою непрозорістю, тож візуально нічого не змінюється: зображення сторінки, яке ви бачите й друкуєте, те саме, що було відскановано, лежить зверху. Функції пошуку й виділення тексту в переглядачі PDF дивляться лише на цей невидимий текстовий шар, тому файл стає придатним для пошуку й виділення, не виглядаючи інакше. Все це, рендеринг, розпізнавання і перезбирання, відбувається прямо у вкладці вашого браузера; PDF зчитується з локального диска і ніколи нікуди не передається.
Інструменти з цього гайда
- PDF OCR · зробити придатним для пошукуПеретворіть скановану PDF на файл із пошуком і виділенням тексту прямо в браузері, без завантаження на сервер.
- OCR · зображення/PDF у текстВидобувайте текст із відсканованих зображень чи PDF повністю у вашому браузері, працює офлайн, без завантаження.
- Вирівняти відскановані сторінкиВирівнюйте перекошені відскановані PDF чи зображення повністю у вашому браузері, без завантаження.
- Стиснення PDFЗменшіть розмір PDF-файлу завдяки безвтратній оптимізації внутрішньої структури без завантаження.
Поширені запитання
Чи виглядатиме й друкуватиметься придатна для пошуку PDF точно як оригінальний скан?
Так. Інструмент ніколи не змінює зображення сторінки; він лише додає невидимий текстовий шар знизу. На екрані й на папері результат візуально ідентичний скану, який ви завантажили. Змінюється лише те, що інструменти пошуку й виділення тексту в переглядачі тепер можуть знайти й захопити розпізнані слова, оскільки читають із цього прихованого шару.
Навіщо існує цей інструмент поряд зі звичайним інструментом OCR?
Вони відповідають на різні потреби з того самого етапу розпізнавання. Інструмент OCR дає вам простий текстовий файл, і саме це потрібно, якщо ви плануєте вставляти, редагувати чи перекладати слова і не потребуєте зберігати документ як PDF. Цей інструмент зберігає файл як PDF з оригінальними зображеннями сторінок недоторканими, і саме це потрібно, якщо документ і надалі потрібно друкувати, архівувати чи надсилати поштою як є, але ви також хочете мати змогу шукати чи копіювати з нього текст.