Geen upload, 100% lokaal, geen account

PDF → tekstextractie

Haal alle leesbare tekst uit je PDF. Download als .txt-bestand. Alles blijft in je browser, geen bestand wordt naar een server gestuurd.

Hoe PDF naar tekst werkt

PDF naar tekst extraheert de bestaande tekstlaag uit een PDF en slaat deze op als een gewoon .txt-bestand. De extractie wordt uitgevoerd door pdf.js in je browser, dat de tekstinhoudobjecten leest die zijn ingesloten in de paginastreams van de PDF. Het document verlaat je apparaat niet; het resultaat wordt lokaal samengesteld en aangeboden als directe download.

Deze tool leest een tekstlaag die al aanwezig is in het bestand. Als je PDF is aangemaakt door een tekstverwerker of exporttool, heeft hij vrijwel zeker een tekstlaag en werkt extractie goed. Als de PDF een scan is van een papieren document, bevatten de pagina's alleen afbeeldingsgegevens en is er geen tekstlaag om te extraheren; in dat geval geeft deze tool lege of onvolledige uitvoer. Gescande PDF's vereisen optische tekenherkenning (OCR) om tekst te produceren, wat een afzonderlijk proces is dat door deze tool niet wordt uitgevoerd. Controleer of je PDF selecteerbare tekst heeft in een viewer voordat je deze tool gebruikt.

Hoe je PDF naar tekst gebruikt, stap voor stap

  1. Laad je PDF in de tekstextractietool.
  2. Wacht tot pdf.js de tekstlaag van alle pagina's heeft gelezen.
  3. Bekijk de preview van de geëxtraheerde tekst.
  4. Klik op downloaden om het .txt-bestand op te slaan.

Veelvoorkomende toepassingen

  • Extraheer de tekst uit een onderzoekspaper-PDF om in een notitietoepassing te plakken of door een samenvattertool te halen.
  • Haal de inhoud op uit een PDF-factuur naar een spreadsheet voor de boekhouding zonder handmatig overtypen.
  • Herstel de tekst uit een beschadigde of vergrendelde-layout-PDF waarbij kopiëren en plakken in een viewer niet werkt.
  • Converteer een PDF-artikel naar platte tekst voor verwerking met een script of opdrachtregeltool.

Veelgestelde vragen

Waarom is de geëxtraheerde tekst leeg of onleesbaar voor sommige PDF's?

De meest voorkomende oorzaak is dat de PDF een scan is: de pagina's zijn afbeeldingen en bevatten geen tekstlaag. Andere oorzaken zijn PDF's waarbij de tekst is opgeslagen als contouren of aangepaste lettertypecodering die pdf.js niet kan omzetten naar leesbare tekens. Voor gescande documenten is OCR nodig om tekst te produceren.

Voert deze tool OCR uit op gescande PDF's?

Nee. Deze tool leest een bestaande tekstlaag uit de PDF. Hij voert geen optische tekenherkenning uit. Voor gescande PDF's gebruik je de OCR-tool, die de paginaafbeeldingen door een lokale OCR-engine in je browser verwerkt.

Vindt de tekstextractie plaats op een server of in mijn browser?

In je browser. pdf.js leest de PDF-structuur lokaal, parseert de tekstinhoudobjecten uit elke pagestream en stelt de uitvoer samen in het browsergeheugen. De PDF-gegevens verlaten je apparaat op geen enkel moment tijdens dit proces.

Blijft de opmaak en lay-out bewaard in de tekstuitvoer?

Nee. Platte tekst bevat geen lettertype-, grootte-, kleur- of positie-informatie. De uitvoer is niet-opgemaakte tekst in leesvolgorde zoals bepaald door pdf.js. Tabellen, meerkolomse lay-outs en speciale opmaak worden afgevlakt. Voor het bewaren van opmaak zijn PDF-naar-HTML-converters geschikter.

Kan ik tekst extraheren uit een met wachtwoord beveiligde PDF?

Als de PDF een gebruikerswachtwoord heeft, moet je dat opgeven voordat de PDF leesbaar is. Extractiebeperkingen op eigenaarsniveau kunnen de bewerking ook blokkeren. Verwijder die beperkingen eerst met de PDF-ontgrendeltool en probeer de extractie daarna opnieuw.

Moet ik een account aanmaken om tekst uit een PDF te halen?

Nee. Er is geen aanmelding en geen account. Zet het bestand neer, lees de geëxtraheerde voorvertoning en download het .txt-bestand.

Werkt PDF naar tekst in een mobiele browser?

Ja. pdf.js werkt op een telefoonbrowser op dezelfde manier als op desktop. Kopieer of download de geëxtraheerde tekst rechtstreeks vanaf de mobiele pagina zodra de extractie is voltooid.