Hoe PDF naar tekst werkt
PDF naar tekst extraheert de bestaande tekstlaag uit een PDF en slaat deze op als een gewoon .txt-bestand. De extractie wordt uitgevoerd door pdf.js in je browser, dat de tekstinhoudobjecten leest die zijn ingesloten in de paginastreams van de PDF. Het document verlaat je apparaat niet; het resultaat wordt lokaal samengesteld en aangeboden als directe download.
Deze tool leest een tekstlaag die al aanwezig is in het bestand. Als je PDF is aangemaakt door een tekstverwerker of exporttool, heeft hij vrijwel zeker een tekstlaag en werkt extractie goed. Als de PDF een scan is van een papieren document, bevatten de pagina's alleen afbeeldingsgegevens en is er geen tekstlaag om te extraheren; in dat geval geeft deze tool lege of onvolledige uitvoer. Gescande PDF's vereisen optische tekenherkenning (OCR) om tekst te produceren, wat een afzonderlijk proces is dat door deze tool niet wordt uitgevoerd. Controleer of je PDF selecteerbare tekst heeft in een viewer voordat je deze tool gebruikt.