Инструкция
Сделать отсканированный PDF доступным для поиска
Отсканированный PDF выглядит как обычный документ, но на самом деле это картинка страницы: Ctrl+F ничего не находит, и нельзя выделить или скопировать ни одно слово. Инструмент «OCR PDF» исправляет это, не меняя суть файла. Он читает изображение каждой страницы, распознаёт символы локальным движком OCR и накладывает распознанный текст невидимо поверх того же изображения, так что PDF выглядит и печатается точно так же, как раньше, но теперь реагирует на поиск и выделение текста. Файл никогда не покидает устройство.
Шаг за шагом
- Откройте инструмент «OCR PDF» и загрузите отсканированный PDF. Принимаются только файлы PDF, размер ограничен 80 МБ; типичный многостраничный скан заметно меньше этого предела.
- Выберите язык документа из выпадающего списка (английский, французский, немецкий, испанский, португальский или итальянский) и при желании отредактируйте имя выходного файла. По умолчанию расширение .pdf сохраняется автоматически.
- Нажмите «Запустить» и подождите, пока обработается каждая страница. Каждая страница отрисовывается, проходит через движок OCR и получает свой невидимый текстовый слой перед тем как инструмент перейдёт к следующей, поэтому длинный документ обрабатывается дольше, чем одна страница. Скачайте результат: он открывается и печатается так же, как оригинал, но теперь работают Ctrl+F, выделение текста и копирование.
PDF с возможностью поиска или обычный текст: что вам на самом деле нужно
Этот инструмент и обычный инструмент OCR решают одну и ту же базовую задачу, распознавание текста на отсканированном изображении, но сохраняют разные вещи. Инструмент OCR отбрасывает изображение страницы и возвращает обычный файл .txt: используйте его, если хотите вставить слова в редактор, перевести их или искать как текст, и вам не важно сохранение исходного вида документа. Инструмент «OCR PDF» сохраняет исходный PDF в точности как есть, вместе с изображениями страниц, и лишь добавляет скрытый текстовый слой снизу: используйте его, если документ должен остаться PDF, который по-прежнему можно распечатать, отправить по почте или сохранить в архиве, но при этом вы хотите иметь возможность искать или копировать из него текст. Ни один из инструментов не восстанавливает макет как редактируемый текст с настоящими шрифтами и таблицами; оба работают с одним и тем же распознанным текстом, просто упаковывают его по-разному.
Почему результат зависит от скана и где границы возможностей
Точность распознавания следует за качеством исходного изображения, так же как и для обычного OCR: чистый, ровный скан около 200-300 dpi распознаётся надёжно, а размытое фото, перекошенная страница или сильные тени дают больше ошибочно распознанных слов. Если страница вышла криво, сначала выровняйте её инструментом «Выравнивание PDF (deskew)», чтобы шаг распознавания читал текст ровно. Инструмент охватывает шесть языков (английский, французский, немецкий, испанский, португальский, итальянский); документ на неподдерживаемом языке распознается неверно. Обработка идёт постранично прямо во вкладке браузера, так что документ на десятки страниц обрабатывается заметно дольше двухстраничного скана, а размер файла ограничен 80 МБ. Итоговый PDF также обычно похож по размеру на оригинал, поскольку сами изображения страниц не трогаются; если после этого нужен файл меньшего размера, пропустите его через компрессор PDF.
Как строится невидимый текстовый слой
Сначала каждая страница PDF растрируется в изображение на canvas прямо в браузере, тот же шаг отрисовки использует инструмент «PDF в изображение». Движок OCR (Tesseract, скомпилированный в WebAssembly) читает это изображение и возвращает каждое распознанное слово вместе с его ограничивающим прямоугольником, то есть положением на странице. Затем эти слова рисуются обратно на копию исходной страницы PDF в распознанных позициях, но с нулевой непрозрачностью, так что визуально ничего не меняется: изображение страницы, которое вы видите и печатаете, остаётся тем же отсканированным, лежащим сверху. Функции поиска и выделения текста в программе просмотра PDF смотрят только на этот невидимый текстовый слой, поэтому файл становится доступным для поиска и выделения, никак не меняясь внешне. Всё это, отрисовка, распознавание и пересборка, происходит прямо во вкладке браузера; PDF читается с локального диска и никогда никуда не передаётся.
Инструменты из этого гайда
- OCR PDF · сделать документ доступным для поискаПревратите отсканированный PDF в документ с возможностью поиска и выделения текста прямо в браузере, без загрузки.
- OCR · изображение/PDF в текстИзвлекайте текст из отсканированных изображений или PDF полностью в вашем браузере, работает офлайн, без загрузки.
- Выровнять отсканированные страницыВыпрямите перекошенные отсканированные PDF или изображения полностью в вашем браузере, без загрузки.
- Сжать PDFУменьшите размер PDF-файла за счёт безвозвратной оптимизации внутренней структуры без загрузки.
Частые вопросы
Будет ли PDF с возможностью поиска по-прежнему выглядеть и печататься точно как оригинальный скан?
Да. Инструмент никогда не изменяет изображение страницы; он лишь добавляет невидимый текстовый слой снизу. На экране и на бумаге результат визуально идентичен загруженному скану. Меняется то, что средства поиска и выделения текста в программе просмотра теперь могут находить и захватывать распознанные слова, потому что они читают из этого скрытого слоя.
Зачем нужен этот инструмент, если уже есть обычный OCR?
Они отвечают на разные потребности из одного и того же шага распознавания. Инструмент OCR даёт обычный текстовый файл, это то, что нужно, если вы планируете вставлять, редактировать или переводить слова и не обязаны сохранять документ как PDF. Этот инструмент сохраняет файл как PDF с нетронутыми исходными изображениями страниц, это то, что нужно, если документ по-прежнему должен печататься, храниться в архиве или отправляться по почте как есть, но при этом вы хотите иметь возможность искать или копировать из него текст.