Fără încărcare, 100% local, fără cont

Articol

De ce nu poți copia textul din unele PDF-uri

Încearcă să selectezi o linie într-un PDF, iar cuvintele se evidențiază normal, gata de copiat. Încearcă același gest într-un alt PDF și nu se întâmplă nimic, sau cursorul prinde întreaga pagină ca pe o fotografie, pentru că exact asta este. Două fișiere care arată identic pe ecran pot fi construite complet diferit dedesubt. Iată cum să-ți dai seama ce fel de fișier ai, și ce să faci cu cel care rezistă la copiere.

Două tipuri diferite de pagină PDF

Un PDF poate stoca o pagină în două moduri foarte diferite. Într-un PDF bazat pe text, fiecare literă este un obiect caracter cu o valoare Unicode, un font și o poziție, la fel cum o pagină web stochează text: un vizualizator o poate selecta, o poate căuta, iar un cititor de ecran o poate citi cu voce tare. Într-un PDF bazat pe imagine, pagina este o singură imagine plată, adesea produsă de un scaner, un fax, sau un pas de „tipărire ca PDF” aplicat pe o fotografie a unui document. Literele arată la fel pentru ochii tăi, dar pentru formatul de fișier nu există niciun caracter dedesubt, doar pixeli.

Comparație alăturată: o pagină PDF bazată pe text, cu o linie de text evidențiată și selectabilă, lângă o pagină PDF bazată pe imagine, unde textul cu aspect identic este o singură imagine plată, fără selecție.

Un mod rapid de a-ți da seama ce ai

Apasă Ctrl+F sau Cmd+F și caută un cuvânt pe care îl vezi clar pe pagină. Dacă îl găsește și îl evidențiază, pagina are un strat de text real. Dacă nu găsește nimic nicăieri în document, pagina este o imagine, indiferent cât de clară sau cât de mult arată ca un document tehnoredactat. Tragerea mouse-ului pentru a selecta o linie dă același răspuns: o evidențiere, versus o simplă selecție dreptunghiulară.

Reconstruirea textului cu OCR

Recunoașterea optică a caracterelor (OCR) citește pixelii unei pagini bazate pe imagine și potrivește formele cu un model antrenat de litere pentru o anumită limbă, apoi reconstruiește un strat de text cu caracterele recunoscute poziționate acolo unde apăreau. Un instrument precum OCR face asta în întregime în browser: nimic nu este încărcat, iar rezultatul este un fișier text simplu pe care îl poți căuta, copia sau edita. Acuratețea depinde de sursă: o scanare curată, dreaptă, de rezoluție înaltă, într-o limbă bine suportată, recunoaște fiabil, în timp ce o pagină înclinată, neclară, cu contrast scăzut sau scrisă de mână produce mai multe greșeli, uneori un caracter greșit sau un cuvânt citit greșit.

Diagramă de flux: pixelii unei pagini scanate trec prin recunoașterea de caractere OCR și ies ca un strat de text reconstruit și poziționat.

Când fișierul are deja text, dar extragerea arată greșit

Dacă PDF-ul tău chiar are un strat de text real, dar un instrument precum pdf-to-text produce text într-o ordine ciudată, cu coloane amestecate sau spațiere prăbușită, aceea este o problemă diferită, nelegată: obiectele de text există, dar ordinea lor de citire pe pagină nu a fost stocată așa cum se așteaptă natural un script. E o ciudățenie de aspect de curățat după extragere, nu un semn că textul lipsește, și nu are nevoie de OCR ca să fie rezolvată.

Instrumente din acest articol

Întrebări frecvente

PDF-ul meu arată ca un document tehnoredactat normal, dar tot nu pot selecta niciun text. De ce?

Cel mai probabil este o pagină scanată sau fotografiată salvată ca PDF, sau un document aplatizat intenționat într-o imagine. Vizual, poate fi imposibil de deosebit de un PDF bazat pe text; diferența apare doar când încerci să-l cauți sau să-l selectezi. Trecerea lui prin OCR reconstruiește un strat de text real, selectabil, din pixeli.

OCR funcționează la fel de bine în orice limbă?

Nu. Acuratețea depinde de dacă există un model antrenat pentru acea limbă și scriere, și de calitatea scanării. Limbile bine suportate, pe o scanare curată și dreaptă, recunosc fiabil; scrisul de mână, imaginile de rezoluție scăzută sau limbile cu mai puține date de antrenament produc mai multe erori. Rezultatul OCR este întotdeauna o transcriere de cea mai bună încercare, care merită o verificare rapidă înainte să te bazezi pe ea.

Surse