Статья
Почему из некоторых PDF нельзя скопировать текст
Попробуйте выделить строку в одном PDF, и слова подсвечиваются как обычно, готовые к копированию. Попробуйте то же самое в другом PDF, и ничего не происходит, либо курсор захватывает всю страницу как фотографию, потому что это она и есть. Два файла, выглядящих одинаково на экране, могут быть устроены внутри совершенно по-разному. Вот как отличить один тип от другого, и что делать с тем, что сопротивляется копированию.
Два разных вида страниц PDF
PDF может хранить страницу двумя очень разными способами. В текстовом PDF каждая буква это объект-символ с Unicode-значением, шрифтом и положением, так же как веб-страница хранит текст: программа просмотра может его выделить, найти поиском, а программа чтения с экрана озвучить. В PDF на основе изображения страница это одна плоская картинка, часто созданная сканером, факсом или шагом «печать в PDF», применённым к фото документа. Буквы выглядят одинаково для глаза, но для формата файла под ними нет никакого символа, только пиксели.

Быстрый способ узнать, какой у вас тип
Нажмите Ctrl+F или Cmd+F и найдите слово, которое явно видно на странице. Если поиск находит его и подсвечивает, у страницы есть настоящий текстовый слой. Если поиск ничего не находит нигде в документе, страница это изображение, независимо от того, насколько чётким или похожим на набранный документ оно выглядит. Перетаскивание мыши для выделения строки даёт тот же ответ: подсветка против обычного выделения прямоугольником.
Восстановление текста с помощью OCR
Оптическое распознавание символов (OCR) читает пиксели страницы на основе изображения и сопоставляет формы с обученной моделью букв для конкретного языка, а затем собирает текстовый слой из распознанных символов, размещённых там, где они находились. Инструмент вроде ocr делает это целиком в браузере: ничего не загружается, а результат это обычный текстовый файл, который можно искать, копировать или редактировать. Точность зависит от исходника: чистый, ровный скан высокого разрешения на хорошо поддерживаемом языке распознаётся надёжно, тогда как перекошенная, размытая, малоконтрастная или рукописная страница даёт больше ошибок, иногда неверный символ или неправильно прочитанное слово.

Когда в файле уже есть текст, но извлечение выглядит неправильно
Если в вашем PDF действительно есть настоящий текстовый слой, но такой инструмент, как pdf-to-text, выдаёт текст в странном порядке, со слитыми колонками или пропавшими пробелами, это другая, не связанная проблема: текстовые объекты существуют, но порядок их чтения на странице не был сохранён так, как этого естественно ожидает скрипт. Это особенность вёрстки, которую нужно поправить после извлечения, а не признак отсутствия текста, и OCR для её исправления не нужен.
Инструменты из этой статьи
- OCR · изображение/PDF в текстИзвлекайте текст из отсканированных изображений или PDF полностью в вашем браузере, работает офлайн, без загрузки.
- PDF в текстИзвлеките текстовое содержимое из PDF и скачайте его в виде файла .txt, без загрузки.
- OCR PDF · сделать документ доступным для поискаПревратите отсканированный PDF в документ с возможностью поиска и выделения текста прямо в браузере, без загрузки.
Частые вопросы
Мой PDF выглядит как обычный набранный документ, но я всё равно не могу выделить текст. Почему?
Скорее всего это отсканированная или сфотографированная страница, сохранённая как PDF, либо документ, намеренно сведённый в изображение. Визуально он может быть неотличим от текстового PDF; разница проявляется только когда вы пытаетесь его найти поиском или выделить. Прогон через OCR восстанавливает настоящий, выделяемый текстовый слой из пикселей.
Работает ли OCR одинаково хорошо на всех языках?
Нет. Точность зависит от того, существует ли обученная модель для этого языка и письменности, а также от качества скана. Хорошо поддерживаемые языки на чистом, ровном скане распознаются надёжно; рукописный текст, изображения низкого разрешения или языки с меньшим объёмом обучающих данных дают больше ошибок. Результат OCR всегда лучшая по возможности транскрипция, которую стоит быстро вычитать перед тем как на неё полагаться.