Fără încărcare, 100% local, fără cont

PDF → Extragere text

Extrageți tot textul lizibil din PDF-ul dumneavoastră. Descărcați-l ca fișier .txt. Totul rămâne în browser, niciun fișier nu este trimis către un server.

Cum funcționează PDF în text

PDF to Text extrage stratul de text existent dintr-un PDF și îl salvează ca fișier .txt simplu. Extracția este efectuată de pdf.js în browserul dumneavoastră, citind obiectele de conținut text încorporate în fluxurile de pagină ale PDF-ului. Documentul nu părăsește niciodată dispozitivul dumneavoastră; rezultatul este asamblat local și oferit ca descărcare directă.

Acest instrument citește un strat de text care este deja prezent în fișier. Dacă PDF-ul a fost creat de un procesor de text sau un instrument de export, aproape sigur are un strat de text și extracția va funcționa bine. Dacă PDF-ul este o scanare a unui document pe hârtie, paginile conțin doar date de imagine și nu există niciun strat de text de extras; în acel caz, instrumentul va returna ieșire goală sau incompletă. PDF-urile scanate necesită recunoaștere optică a caracterelor (OCR) pentru a produce text, care este un proces separat neefectuat de acest instrument. Verificați dacă PDF-ul dumneavoastră are text selectabil într-un vizualizator înainte de a folosi acest instrument.

Cum se folosește PDF în text, pas cu pas

  1. Încărcați PDF-ul în instrumentul de extracție a textului.
  2. Așteptați ca pdf.js să citească stratul de text din toate paginile.
  3. Verificați previzualizarea textului extras.
  4. Apăsați Download pentru a salva fișierul .txt.

Cazuri de utilizare frecvente

  • Extrage textul dintr-un PDF de articol de cercetare pentru a-l lipi într-o aplicație de notițe sau a-l trece printr-un rezumator.
  • Preia conținutul dintr-o factura PDF într-o foaie de calcul pentru contabilitate fără rescriere manuală.
  • Recuperează textul dintr-un PDF corupt sau cu aspect blocat unde copierea-lipirea într-un vizualizator este defecta.
  • Convertiți un articol PDF în text simplu pentru procesare cu un script sau instrument de linie de comandă.

Întrebări frecvente

De ce textul extras este gol sau distorsionat pentru unele PDF-uri?

Cea mai frecvența cauza este ca PDF-ul este o scanare: paginile sunt imagini și nu conțin niciun strat de text. Alte cauze includ PDF-uri unde textul este stocat ca contururi sau encodari de fonturi personalizate pe care pdf.js nu le poate mapa la caractere lizibile. Pentru documentele scanate, OCR este necesar pentru a produce text.

Acest instrument efectuează OCR pe PDF-urile scanate?

Nu. Acest instrument citește un strat de text existent din PDF. Nu efectuează recunoaștere optică a caracterelor. Pentru PDF-urile scanate, folosește instrumentul OCR, care trece imaginile paginii printr-un motor OCR local în browserul dumneavoastră.

Extracția textului se face pe un server sau în browserul meu?

În browserul dumneavoastră. pdf.js citește structura PDF local, analizează obiectele de conținut text din fiecare flux de pagină și asamblează fișierul de ieșire în memoria browserului. Datele PDF nu părăsesc dispozitivul dumneavoastră în niciun punct al acestui proces.

Formatarea și aspectul vor fi păstrate în fișierul text de ieșire?

Nu. Textul simplu nu transportă informații de font, dimensiune, culoare sau poziție. Fișierul de ieșire este text neformatat în ordinea de citire așa cum este determinată de pdf.js. Tabelele, aspectele mulți-coloana și formatarea specială sunt aplatizate. Pentru păstrarea aspectului bogat, convertoare PDF în HTML sunt mai potrivite.

Pot extrage text dintr-un PDF protejat cu parola?

Dacă PDF-ul are o parolă de utilizator, trebuie să o furnizați pentru ca PDF-ul să fie citibil. Restricțiile de extracție la nivel de proprietar pot bloca, de asemenea, operația. Eliminați mai întâi acele restricții cu instrumentul PDF Unlock, apoi reîncercați extracția.

Trebuie să creez un cont pentru a extrage text dintr-un PDF?

Nu. Nu există înregistrare și niciun cont. Depuneți fișierul, citiți previzualizarea extrasă și descărcați fișierul .txt.

PDF în Text funcționează pe un browser mobil?

Da. pdf.js funcționează la fel pe un browser de telefon ca pe desktop. Copiați sau descărcați textul extras direct din pagina mobilă imediat ce extragerea se termină.