Как работает PDF в текст
PDF в текст извлекает существующий текстовый слой из PDF и сохраняет его как обычный .txt-файл. Извлечение выполняется pdf.js внутри браузера путём чтения объектов текстового содержимого, встроенных в потоки страниц PDF. Документ не покидает устройство; результат формируется локально и предлагается для прямого скачивания.
Этот инструмент читает текстовый слой, уже присутствующий в файле. Если PDF создан текстовым процессором или инструментом экспорта, он почти наверняка имеет текстовый слой, и извлечение пройдёт хорошо. Если PDF является сканом бумажного документа, страницы содержат только данные изображений и текстового слоя для извлечения нет; в таком случае этот инструмент вернёт пустой или неполный результат. Отсканированные PDF требуют оптического распознавания символов (OCR) для получения текста - это отдельный процесс, не выполняемый данным инструментом. Прежде чем использовать инструмент, проверьте, есть ли в PDF выделяемый текст в программе просмотра.