Стаття
Чому не з кожного PDF можна скопіювати текст
Спробуйте виділити рядок в одному PDF, і слова підсвітяться нормально, готові до копіювання. Спробуйте той самий жест в іншому PDF, і нічого не станеться, або курсор захопить усю сторінку, наче фотографію, бо саме нею вона і є. Два файли, що виглядають ідентично на екрані, можуть бути побудовані зовсім по-різному під низом. Ось як визначити, який тип у вас, і що робити з тим, що чинить опір копіюванню.
Два різні типи сторінки PDF
PDF може зберігати сторінку двома дуже різними способами. У текстовому PDF кожна літера є символьним обʼєктом зі значенням Unicode, шрифтом і позицією, так само, як вебсторінка зберігає текст: переглядач може його виділити, знайти пошуком, а програма читання з екрана може прочитати його вголос. У PDF на основі зображення сторінка є однією плоскою картинкою, часто зробленою сканером, факсом чи етапом «друку в PDF», застосованим до фото документа. Літери виглядають однаково для ваших очей, але для формату файлу під низом немає жодного символу, лише пікселі.

Швидкий спосіб визначити, який у вас тип
Натисніть Ctrl+F чи Cmd+F і знайдіть слово, яке ви чітко бачите на сторінці. Якщо пошук знаходить його і підсвічує, у сторінки є справжній текстовий шар. Якщо пошук нічого не знаходить ніде в документі, сторінка є зображенням, хай яким чітким і схожим на набраний документ воно виглядає. Перетягування миші, щоб виділити рядок, дає ту саму відповідь: підсвічування проти простого прямокутного виділення.
Відновлення тексту за допомогою OCR
Оптичне розпізнавання символів (OCR) зчитує пікселі сторінки на основі зображення і зіставляє форми з навченою моделлю літер для певної мови, а потім відновлює текстовий шар із розпізнаними символами, розміщеними там, де вони зʼявлялися. Інструмент на кшталт OCR робить це повністю в браузері: нічого не завантажується, а результат є простим текстовим файлом, який можна знайти пошуком, скопіювати чи редагувати. Точність залежить від джерела: чіткий, рівний скан високої роздільної здатності добре підтримуваною мовою розпізнається надійно, тоді як перекошена, розмита, малоконтрастна чи рукописна сторінка дає більше помилок, іноді неправильний символ чи неправильно прочитане слово.

Коли у файлі вже є текст, але видобування виглядає неправильним
Якщо у вашому PDF справді є справжній текстовий шар, але інструмент на кшталт «PDF у текст» видає текст у дивному порядку, зі змішаними колонками чи зжатими пробілами, це інша, не повʼязана проблема: текстові обʼєкти існують, але порядок їх читання на сторінці не збережено так, як природно очікує скрипт. Це особливість макета, яку слід прибрати після видобування, а не ознака відсутнього тексту, і вона не потребує OCR для виправлення.
Інструменти з цієї статті
- OCR · зображення/PDF у текстВидобувайте текст із відсканованих зображень чи PDF повністю у вашому браузері, працює офлайн, без завантаження.
- PDF у текстВидобудьте текстовий вміст із PDF і завантажте його як файл .txt без завантаження на сервер.
- PDF OCR · зробити придатним для пошукуПеретворіть скановану PDF на файл із пошуком і виділенням тексту прямо в браузері, без завантаження на сервер.
Поширені запитання
Мій PDF виглядає як звичайний набраний документ, але я все одно не можу виділити жодного тексту. Чому?
Найімовірніше, це скановна чи сфотографована сторінка, збережена як PDF, або документ, навмисно зведений до зображення. Візуально його може бути неможливо відрізнити від текстового PDF; різниця проявляється лише тоді, коли ви пробуєте знайти пошуком чи виділити його. Пропускання через OCR відновлює справжній, придатний до виділення текстовий шар із пікселів.
Чи однаково добре працює OCR для кожної мови?
Ні. Точність залежить від того, чи існує навчена модель для цієї мови й писемності, і від якості скану. Добре підтримувані мови на чіткому, рівному скані розпізнаються надійно; рукопис, зображення низької роздільної здатності чи мови з меншим обсягом навчальних даних дають більше помилок. Результат OCR завжди є найкращою спробою транскрипції, вартою швидкої перевірки перед тим, як на неї покладатися.