Slik fungerer PDF til tekst
PDF til tekst trekker ut det eksisterende tekstlaget fra en PDF og lagrer det som en vanlig .txt-fil. Uttrekkingen utføres av pdf.js inne i nettleseren din, som leser tekstinnholdobjektene innebygd i PDF-ens sidestrømmer. Dokumentet forlater aldri enheten din; resultatet settes sammen lokalt og tilbys som en direkte nedlasting.
Dette verktøyet leser et tekstlag som allerede er til stede i filen. Hvis PDF-en ble opprettet av et tekstbehandlingsprogram eller et eksportverktøy, har den nesten sikkert et tekstlag og uttrekkingen vil fungere godt. Hvis PDF-en er en skanning av et papirdokument, inneholder sidene bare bildedata og det er ingen tekstlag å trekke ut; i så fall vil dette verktøyet returnere tomme eller ufullstendige utdata. Skannede PDF-er krever optisk tegngjenkjenning (OCR) for å produsere tekst, noe som er en separat prosess dette verktøyet ikke utfører. Sjekk om PDF-en din har valgbar tekst i en leser før du bruker dette verktøyet.