Как работи PDF към текст
PDF to Text извлича съществуващия текстов слой от PDF и го записва като обикновен .txt файл. Извличането се извършва от pdf.js в браузъра ви, четейки обектите с текстово съдържание, вградени в потоците на страниците на PDF. Документът никога не напуска устройството ви; резултатът се сглобява локално и се предлага като директно изтегляне.
Инструментът чете текстов слой, вече присъстващ в файла. Ако PDF е създаден от текстообработваща програма или инструмент за експортиране, почти сигурно има текстов слой и извличането ще работи добре. Ако PDF е сканиране на хартиен документ, страниците съдържат само данни от изображения и няма текстов слой за извличане; в такъв случай инструментът ще върне празен или непълен изход. Сканираните PDF файлове изискват оптично разпознаване на знаци (OCR), за да произведат текст - отделен процес, не извършван от инструмента. Проверете дали PDF файлът ви има избираем текст в програма за преглед, преди да използвате инструмента.