Ingen upload, 100% lokalt, ingen konto

PDF → Tekstudtrækning

Udtræk al læsbar tekst fra din PDF. Download som en .txt-fil. Alt forbliver i din browser, ingen fil sendes til en server.

Sådan virker PDF til tekst

PDF til tekst udtrækker det eksisterende tekstlag fra en PDF og gemmer det som en ren .txt-fil. Udtrækningen udføres af pdf.js inde i din browser, der læser tekstindholdobjekterne indlejret i PDF-filens sidestrømme. Dokumentet forlader aldrig din enhed; resultatet samles lokalt og tilbydes som et direkte download.

Dette værktøj læser et tekstlag, der allerede er til stede i filen. Hvis din PDF er oprettet af et tekstbehandlingsprogram eller et eksportværktøj, har den næsten med sikkerhed et tekstlag, og udtrækning vil fungere godt. Hvis PDF-filen er en scanning af et papierdokument, indeholder siderne kun billeddata og der er intet tekstlag at udtrække; i så fald vil dette værktøj returnere tomt eller ufuldstændigt output. Scannede PDF-filer kræver optisk tegngenkendelsse (OCR) for at producere tekst, hvilket er en separat proces, som dette værktøj ikke udfører. Kontroller, om din PDF har valgbar tekst i et visningsprogram, for du bruger dette værktøj.

Sådan bruger du PDF til tekst, trin for trin

  1. Indlæs din PDF i tekstudtrækningsværktøjet.
  2. Vent på, at pdf.js læser tekstlaget fra alle sider.
  3. Gennemse den udtrukne tekstforhandsvisning.
  4. Klik på download for at gemme .txt-filen.

Almindelige anvendelser

  • Udtræk teksten fra en PDF med et forskningsartikel for at indsætte i et noter-program eller køre gennem et resumeværktøj.
  • Træk indholdet fra en PDF-faktura ud i et regneark til bogføring uden manuel omskrivning.
  • Genvind teksten fra en korrupt eller låst-layout PDF, hvor kopiering-indsættelse i et visningsprogram er brudt.
  • Konverter en PDF-artikel til ren tekst til behandling med et script eller et kommandolinjeværktøj.

Ofte stillede spørgsmål

Hvorfor kommer den udtrukne tekst ud tom eller forvrænget for nogle PDF-filer?

Den mest almindelige årsag er, at PDF-filen er en scanning: siderne er billeder og indeholder intet tekstlag. Andre årsager inkluderer PDF-filer, hvor teksten er gemt som konturer eller brugerdefinerede skrifttypenkoddninger, som pdf.js ikke kan mappe til læsbare tegn. Til scannede dokumenter er OCR nødvendigt for at producere tekst.

Udfører dette værktøj OCR på scannede PDF-filer?

Nej. Dette værktøj læser et eksisterende tekstlag fra PDF-filen. Det udfører ikke optisk tegngenkendelse. Til scannede PDF-filer skal du bruge OCR-værktøjet, der sender sidebillederne gennem en lokal OCR-motor i din browser.

Udføres tekstudtrækning på en server eller i min browser?

I din browser. pdf.js læser PDF-strukturen lokalt, parser tekstindholdobjekterne fra hver sidestrøm og samler outputtet i browserhukommelsen. PDF-dataene forlader på intet tidspunkt din enhed under denne proces.

Bevares formatering og layout i tekstoutputtet?

Nej. Ren tekst indeholder ingen skrifttype-, størrelses-, farve- eller positionsoplysninger. Outputtet er uformateret tekst i læserækkefølge som bestemt af pdf.js. Tabeller, flerkolonne-layouts og speciel formatering flettes. Til rig layoutbevaring er PDF til HTML-konvertere et bedre valg.

Kan jeg udtrække tekst fra en adgangskodebeskyttet PDF?

Hvis PDF-filen har en bruger-åbningskode, skal du angive den, for PDF-filen overhovedet kan læses. Ejer-niveau-udtrækningsbegrænsninger kan også blokere operationen. Fjern disse begrænsninger først ved hjælp af PDF Unlock-værktøjet og proo derefter udtrækning igen.

Skal jeg oprette en konto for at udtrække tekst fra en PDF?

Nej. Der er ingen tilmelding og ingen konto. Slip filen, læs den udtrukne forhåndsvisning, og download .txt-filen.

Fungerer PDF til tekst i en mobilbrowser?

Ja. pdf.js kører på samme måde i en telefonbrowser som på desktop. Kopier eller download den udtrukne tekst direkte fra mobilsiden, når udtrækningen er færdig.