Sådan virker PDF til tekst
PDF til tekst udtrækker det eksisterende tekstlag fra en PDF og gemmer det som en ren .txt-fil. Udtrækningen udføres af pdf.js inde i din browser, der læser tekstindholdobjekterne indlejret i PDF-filens sidestrømme. Dokumentet forlader aldrig din enhed; resultatet samles lokalt og tilbydes som et direkte download.
Dette værktøj læser et tekstlag, der allerede er til stede i filen. Hvis din PDF er oprettet af et tekstbehandlingsprogram eller et eksportværktøj, har den næsten med sikkerhed et tekstlag, og udtrækning vil fungere godt. Hvis PDF-filen er en scanning af et papierdokument, indeholder siderne kun billeddata og der er intet tekstlag at udtrække; i så fald vil dette værktøj returnere tomt eller ufuldstændigt output. Scannede PDF-filer kræver optisk tegngenkendelsse (OCR) for at producere tekst, hvilket er en separat proces, som dette værktøj ikke udfører. Kontroller, om din PDF har valgbar tekst i et visningsprogram, for du bruger dette værktøj.