Ingen opplasting, 100% lokalt, ingen konto

PDF → Tekstuttrekk

Hent ut all lesbar tekst fra PDF-en din. Last ned som en .txt-fil. Alt forblir i nettleseren, ingen fil sendes til en server.

Slik fungerer PDF til tekst

PDF til tekst trekker ut det eksisterende tekstlaget fra en PDF og lagrer det som en vanlig .txt-fil. Uttrekkingen utføres av pdf.js inne i nettleseren din, som leser tekstinnholdobjektene innebygd i PDF-ens sidestrømmer. Dokumentet forlater aldri enheten din; resultatet settes sammen lokalt og tilbys som en direkte nedlasting.

Dette verktøyet leser et tekstlag som allerede er til stede i filen. Hvis PDF-en ble opprettet av et tekstbehandlingsprogram eller et eksportverktøy, har den nesten sikkert et tekstlag og uttrekkingen vil fungere godt. Hvis PDF-en er en skanning av et papirdokument, inneholder sidene bare bildedata og det er ingen tekstlag å trekke ut; i så fall vil dette verktøyet returnere tomme eller ufullstendige utdata. Skannede PDF-er krever optisk tegngjenkjenning (OCR) for å produsere tekst, noe som er en separat prosess dette verktøyet ikke utfører. Sjekk om PDF-en din har valgbar tekst i en leser før du bruker dette verktøyet.

Slik bruker du PDF til tekst, steg for steg

  1. Last inn PDF-en din i tekstuttrekkingsverktøyet.
  2. Vent på at pdf.js leser tekstlaget fra alle sider.
  3. Se gjennom forhåndsvisningen av den uttrukne teksten.
  4. Klikk last ned for å lagre .txt-filen.

Vanlige bruksområder

  • Trekk ut teksten fra en forskningsartikkel-PDF for å lime inn i et notatprogram eller kjøre gjennom et sammendragsverktøy.
  • Hent innholdet fra en PDF-faktura inn i et regneark for bokføring uten manuell omskriving.
  • Gjenopprett teksten fra en skadet eller låst PDF der kopier og lim inn i en leser er ødelagt.
  • Konverter en PDF-artikkel til ren tekst for behandling med et skript eller kommandolinjeverktøy.

Ofte stilte spørsmål

Hvorfor kommer den uttrukne teksten ut tom eller forvrengt for noen PDF-er?

Den vanligste årsaken er at PDF-en er en skanning: sidene er bilder og inneholder ingen tekstlag. Andre årsaker inkluderer PDF-er der teksten er lagret som omriss eller egendefinerte skriftkodinger som pdf.js ikke kan kartlegge til lesbare tegn. For skannede dokumenter er OCR nødvendig for å produsere tekst.

Utfører dette verktøyet OCR på skannede PDF-er?

Nei. Dette verktøyet leser et eksisterende tekstlag fra PDF-en. Det utfører ikke optisk tegngjenkjenning. For skannede PDF-er, bruk OCR-verktøyet, som sender sidebildene gjennom en lokal OCR-motor i nettleseren din.

Gjøres tekstuttrekkingen på en server eller i nettleseren min?

I nettleseren din. pdf.js leser PDF-strukturen lokalt, tolker tekstinnholdobjektene fra hver sidestrøm og setter sammen utdataene i nettleserminnet. PDF-dataene forlater ikke enheten din på noe tidspunkt i denne prosessen.

Vil formateringen og oppsettet bevares i tekstutdataene?

Nei. Ren tekst inneholder ikke skrift-, størrelses-, farve- eller posisjonsopplysninger. Utdataene er uformatert tekst i leserekkefølge som bestemt av pdf.js. Tabeller, flerkolonneoppsett og spesiell formatering flates ut. For rik oppsettbevaring er PDF til HTML-konverterere et bedre valg.

Kan jeg trekke ut tekst fra en passordbeskyttet PDF?

Hvis PDF-en har et bruker-åpnings-passord, må du oppgi det for at PDF-en skal være lesbar i det hele tatt. Eier-nivå uttrekkingsbegrensninger kan også blokkere operasjonen. Fjern disse begrensningene først med PDF Unlock-verktøyet, og prøv uttrekking igjen.

Må jeg opprette en konto for å hente ut tekst fra en PDF?

Nei. Det finnes ingen registrering og ingen konto. Slipp filen, les den uthentede forhåndsvisningen, og last ned .txt-filen.

Fungerer PDF til tekst i en mobilnettleser?

Ja. pdf.js kjører på samme måte i en telefonnettleser som på stasjonær. Kopier eller last ned den uthentede teksten direkte fra mobilsiden når utpakkingen er ferdig.