Fără încărcare, 100% local, fără cont

Tutorial

Fă un PDF scanat căutabil

Un PDF scanat arată ca un document normal, dar este de fapt o imagine a unei pagini: Ctrl+F nu găsește nimic, iar tu nu poți selecta sau copia niciun cuvânt. Instrumentul OCR PDF rezolvă asta fără să schimbe ce este fișierul. Citește fiecare imagine de pagină, recunoaște caracterele cu un motor OCR de pe dispozitiv și așază textul recunoscut invizibil deasupra aceleiași imagini, astfel încât PDF-ul arată și se tipărește exact ca înainte, dar acum răspunde la căutare și selecție de text. Fișierul nu îți părăsește niciodată dispozitivul.

Pas cu pas

  1. Deschide instrumentul OCR PDF și adaugă PDF-ul scanat. Sunt acceptate doar fișiere PDF, iar fișierul este limitat la 80 MB; o scanare tipică cu mai multe pagini este mult sub această limită.
  2. Alege limba documentului din meniul derulant (engleză, franceză, germană, spaniolă, portugheză sau italiană) și, dacă vrei, editează numele fișierului de ieșire. Implicit, extensia .pdf este păstrată automat.
  3. Apasă Rulează și așteaptă ca fiecare pagină să fie procesată. Fiecare pagină este randată, trecută prin motorul OCR și primește propriul strat de text invizibil înainte ca instrumentul să treacă la următoarea, deci un document lung durează mai mult decât o singură pagină. Descarcă rezultatul: se deschide și se tipărește identic cu originalul, dar Ctrl+F, selecția de text și copy-paste funcționează acum.

PDF căutabil sau text simplu: de care ai nevoie de fapt

Acest instrument și instrumentul OCR simplu rezolvă aceeași problemă de bază, recunoașterea textului dintr-o imagine scanată, dar păstrează lucruri diferite. Instrumentul OCR aruncă imaginea paginii și îți dă înapoi un fișier .txt simplu: folosește-l când vrei să lipești cuvintele într-un editor, să le traduci sau să le cauți ca text, și nu îți pasă să păstrezi aspectul original al documentului. Instrumentul OCR PDF de aici păstrează PDF-ul original exact așa cum este, cu imaginile paginilor incluse, și doar adaugă un strat de text ascuns dedesubt: folosește-l când documentul trebuie să rămână un PDF pe care poți încă să-l tipărești, trimiți pe email sau arhivezi, dar vrei și să poți căuta sau copia din el. Niciunul dintre instrumente nu reconstruiește aspectul ca text editabil cu fonturi și tabele reale; ambele lucrează pornind de la același text recunoscut, doar ambalat diferit.

De ce rezultatul depinde de scanare și unde sunt limitele

Acuratețea recunoașterii urmărește calitatea imaginii sursă, la fel ca la OCR-ul simplu: o scanare curată, dreaptă, în jur de 200-300 DPI recunoaște fiabil, în timp ce o fotografie neclară, o pagină înclinată sau umbre puternice produc mai multe cuvinte citite greșit. Dacă o pagină a ieșit strâmbă, îndreapt-o cu instrumentul de îndreptare PDF înainte de a rula OCR, astfel încât pasul de recunoaștere să citească text drept. Instrumentul acoperă șase limbi (engleză, franceză, germană, spaniolă, portugheză, italiană); un document într-o limbă nesuportată nu se va recunoaște corect. Procesarea rulează pagină cu pagină în tab-ul browserului, deci un document cu zeci de pagini durează vizibil mai mult decât o scanare de două pagini, iar fișierul este limitat la 80 MB. PDF-ul de ieșire tinde să fie și similar ca dimensiune cu originalul, deoarece imaginile paginilor în sine nu sunt atinse; dacă ai nevoie de un fișier mai mic ulterior, trece-l prin compresorul PDF.

Cum este construit stratul de text invizibil

Fiecare pagină PDF este mai întâi rasterizată într-o imagine canvas în browser, același pas de randare pe care îl folosește instrumentul PDF în imagine. Motorul OCR (Tesseract, compilat în WebAssembly) citește acea imagine și returnează fiecare cuvânt recunoscut împreună cu chenarul său, poziția lui pe pagină. Acele cuvinte sunt apoi desenate înapoi pe o copie a paginii PDF originale, la pozițiile lor recunoscute, dar la opacitate zero, astfel încât nimic nu se schimbă vizual: imaginea de pagină pe care o vezi și o tipărești este aceeași care a fost scanată, așezată deasupra. Funcțiile de căutare și selecție de text ale unui vizualizator PDF privesc doar acel strat de text invizibil, motiv pentru care fișierul devine căutabil și selectabil fără să arate diferit. Tot acest proces, randare, recunoaștere și reasamblare, se întâmplă în tab-ul browserului tău; PDF-ul este citit de pe discul local și nu este transmis niciodată nicăieri.

Instrumentele folosite în acest ghid

Întrebări frecvente

PDF-ul căutabil arată și se tipărește tot exact ca scanarea originală?

Da. Instrumentul nu modifică niciodată imaginea paginii; doar adaugă un strat de text invizibil dedesubt. Pe ecran și pe hârtie, rezultatul este identic vizual cu scanarea pe care ai adăugat-o. Ce se schimbă e că uneltele de căutare și selecție de text ale unui vizualizator pot acum găsi și prelua cuvintele recunoscute, pentru că citesc din acel strat ascuns.

De ce există acest instrument alături de instrumentul OCR simplu?

Ele răspund unor nevoi diferite pornind de la același pas de recunoaștere. Instrumentul OCR îți dă un fișier text simplu, ceea ce vrei dacă intenționezi să lipești, editezi sau traduci cuvintele și nu ai nevoie să păstrezi documentul ca PDF. Acest instrument păstrează fișierul ca PDF, cu imaginile paginilor originale intacte, ceea ce vrei dacă documentul trebuie tipărit, arhivat sau trimis pe email așa cum este, dar vrei și să poți căuta sau copia text din el.

Surse