Без загрузки, 100% локально, без аккаунта

Сделать отсканированный PDF доступным для поиска

Загрузите отсканированный PDF и получите те же страницы с добавленным невидимым слоем текста для поиска. Распознавание работает полностью в браузере (на устройстве, офлайн после первой загрузки), ничего не отправляется на сервер.

Как работает OCR PDF · сделать документ доступным для поиска

PDF OCR превращает отсканированный PDF, состоящий из изображений страниц без настоящего текста, в PDF с возможностью поиска: те же изображения страниц плюс невидимый текстовый слой, размещённый поверх каждого распознанного слова. Откройте результат в любой программе для чтения PDF, и теперь вы можете использовать Ctrl+F для поиска слова, выделять и копировать абзац или дать поисковой системе проиндексировать документ. Всё это обычный скан сделать не позволяет. Само распознавание выполняется движком tesseract.js (тот же самостоятельно размещённый OCR-движок, что используется в инструменте OCR), а отрисовка страниц библиотекой pdf.js; оба работают полностью во вкладке браузера, и ваш файл никогда не загружается на сервер.

Этот инструмент честно говорит о том, что он делает и чего не делает. Он не восстанавливает вёрстку, таблицы или шрифты и не является конвертером в редактируемый документ: видимая страница остаётся картинкой, идентичной исходному скану, а под ней добавляется скрытый текстовый слой. Точность распознавания зависит от качества скана: действуют те же рекомендации (разрешение от 200 DPI, высокий контраст, ровное расположение страницы), что применимы к любому OCR-движку. Если вам нужен только обычный извлечённый текст, а не PDF с возможностью поиска, инструмент OCR создаёт вместо этого файл .txt и справляется с этой конкретной задачей быстрее.

OCR PDF · сделать документ доступным для поиска: пошаговая инструкция

  1. Перетащите отсканированный PDF (по одному изображению страницы на страницу, без существующего текстового слоя) в область загрузки.
  2. Выберите основной язык документа в раскрывающемся списке языков.
  3. Если вы используете инструмент впервые, дождитесь загрузки движка tesseract.js (это происходит один раз).
  4. Нажмите «Запустить» и дождитесь, пока каждая страница будет по очереди отрисована и распознана.
  5. Скачайте PDF с возможностью поиска: тот же внешний вид, но теперь с текстовым слоем под изображением.

Частые сценарии использования

  • Отсканированный договор нужно сделать доступным для поиска, чтобы найти конкретный пункт через Ctrl+F, а не читать каждую страницу.
  • Пакет отсканированных счетов нужно поместить в архив документов, поисковый индекс которого читает только настоящий текст PDF.
  • Сфотографированная или отсканированная форма нуждается в том, чтобы напечатанные подписи стали выделяемыми, чтобы можно было скопировать абзац в письмо.
  • Библиотеке отсканированных отчётов на немецком языке нужен полнотекстовый поиск; перед запуском инструмента выберите немецкий язык.

Часто задаваемые вопросы

Чем это отличается от обычного инструмента OCR?

Инструмент OCR извлекает обычный текст в файл .txt, полностью отбрасывая исходную вёрстку и изображения. PDF OCR сохраняет исходные изображения страниц PDF в точности такими, какие они есть, и добавляет под ними невидимый текстовый слой с возможностью поиска. Используйте OCR, если вам нужны только слова; используйте PDF OCR, если вы хотите сохранить документ в формате PDF, но сделать его доступным для поиска и выделения текста.

Будет ли итоговый PDF выглядеть иначе, чем мой скан?

Нет. Каждая страница отрисовывается из исходного PDF и повторно встраивается как изображение, попиксельно идентичное исходному скану (с поправкой на перекодирование JPEG). Распознанные слова накладываются сверху с нулевой непрозрачностью, поэтому визуально ничего нового не появляется; заметить добавленный слой можно только с помощью поиска по тексту или выделения текста.

Восстанавливает ли инструмент таблицы, колонки или шрифты?

Нет. В результате страница остаётся единым плоским изображением; невидимый текстовый слой повторяет позиции распознанных слов, но не сохраняет структуру таблиц, порядок чтения многоколоночного текста сверх того, что определяет tesseract.js, или исходные шрифты. Это слой для поиска, а не преобразование документа в редактируемый текст.

Отправляются ли мои отсканированные документы куда-либо во время обработки?

Нет. После того как движок tesseract.js и языковой пакет загружены с этого сайта (разовая загрузка размером в несколько мегабайт при первом использовании), каждая отрисовка страницы и каждый проход распознавания происходят полностью во вкладке браузера. Отсканированные договоры, медицинские записи и другие конфиденциальные документы никогда не попадают на сервер.

Почему обработка длинного PDF занимает время?

Каждая страница отрисовывается в изображение, и OCR запускается для этого изображения по отдельности, причём всё это происходит во вкладке браузера, поэтому время обработки растёт пропорционально количеству страниц. Индикатор прогресса отражает реальный прогресс по страницам, а размер файлов ограничен 80 МБ, чтобы весь процесс укладывался в бюджет памяти вкладки браузера.

Что если в моём PDF уже есть выделяемый текст?

Запускать OCR для PDF, в котором уже есть настоящий текстовый слой, не нужно: достаточно открыть его в программе для чтения и нажать Ctrl+F. Этот инструмент предназначен для PDF, состоящих из изображений страниц без текста, типичного результата работы планшетного сканера или «печати в PDF» сфотографированного документа.