Ingen uppladdning, 100% lokalt, inget konto

PDF → Textextrahering

Extrahera all läsbar text från din PDF. Ladda ner som en .txt-fil. Allt stannar i din webbläsare, ingen fil skickas till en server.

Så fungerar PDF till text

PDF till text extraherar det befintliga textlagret från en PDF och sparar det som en vanlig .txt-fil. Extraktion utförs av pdf.js inuti din webbläsare, som läser textinnehållsobjekten inbäddade i PDF-filens sidströmmar. Dokumentet lämnar aldrig din enhet; resultatet sätts ihop lokalt och erbjuds som en direkt nedladdning.

Det här verktyget läser ett textlager som redan finns i filen. Om din PDF skapades av ett ordbehandlingsprogram eller ett exportverktyg har den nästan säkert ett textlager och extraktion fungerar bra. Om PDF-filen är en skanning av ett pappersdokument innehåller sidorna bara bilddata och det finns inget textlager att extrahera; i så fall returnerar verktyget tomma eller ofullständiga utdata. Skannade PDF-filer kräver optisk teckenigenkänning (OCR) för att producera text, vilket är en separat process som inte utförs av det här verktyget. Kontrollera om din PDF har markerbar text i en visare innan du använder verktyget.

Så här använder du PDF till text, steg för steg

  1. Läs in din PDF i textextraktionsverktyget.
  2. Vänta på att pdf.js läser textlagret från alla sidor.
  3. Granska den extraherade textförhandsgranskningen.
  4. Klicka på ladda ned för att spara .txt-filen.

Vanliga användningsområden

  • Extrahera texten från en PDF med ett forskningspapper för att klistra in i en anteckningsapplikation eller köra genom ett sammanfattningsverktyg.
  • Hämta innehållet från en PDF-faktura till ett kalkylblad för bokföring utan manuell återinmatning.
  • Återskapa texten från en skadad eller låst-layout-PDF där kopiera-klistra in i en visare är trasig.
  • Konvertera en PDF-artikel till oformaterad text för bearbetning med ett skript eller kommandoradsverktyg.

Vanliga frågor

Varför kommer den extraherade texten ut tom eller rörig för vissa PDF-filer?

Den vanligaste orsaken är att PDF-filen är en skanning: sidorna är bilder och innehåller inget textlager. Andra orsaker inkluderar PDF-filer där texten är lagrad som konturer eller anpassade teckensnittskodningar som pdf.js inte kan mappa till läsbara tecken. För skannade dokument behövs OCR för att producera text.

Utför det här verktyget OCR på skannade PDF-filer?

Nej. Det här verktyget läser ett befintligt textlager från PDF-filen. Det utför inte optisk teckenigenkänning. För skannade PDF-filer bör du använda OCR-verktyget, som skickar sidbilderna genom en lokal OCR-motor i din webbläsare.

Sker textextraktionen på en server eller i min webbläsare?

I din webbläsare. pdf.js läser PDF-strukturen lokalt, tolkar textinnehållsobjekten från varje sidström och sätter ihop utdatafilen i webbläsarminnet. PDF-data lämnar inte din enhet vid någon punkt under den här processen.

Bevaras formateringen och layouten i textutdatafilen?

Nej. Oformaterad text bär inte teckensnitts-, storleks-, färg- eller positionsinformation. Utdatafilen är oformaterad text i läsordning som bestäms av pdf.js. Tabeller, flerspaltslayouter och specialformatering plattas ut. For bevarande av rik layout passar PDF till HTML-konverterare bättre.

Kan jag extrahera text från en lösenordsskyddad PDF?

Om PDF-filen har ett lösenord för öppning måste du ange det för att PDF-filen ska vara läsbar alls. Ägarnivåbegränsningar för extraktion kan också blockera operationen. Ta först bort dessa begränsningar med verktyget PDF Unlock och försök sedan extrahera igen.

Behöver jag skapa ett konto för att extrahera text från en PDF?

Nej. Det krävs ingen registrering och inget konto. Släpp filen, läs den extraherade förhandsvisningen och ladda ner .txt-filen.

Fungerar PDF till text i en mobil webbläsare?

Ja. pdf.js fungerar likadant i en telefonwebbläsare som på stationärt. Kopiera eller ladda ner den extraherade texten direkt från mobilsidan när extraheringen är klar.