Nessun upload, 100% locale, nessun account

Articolo

Perché non puoi copiare testo da alcuni PDF

Prova a selezionare una riga in un PDF e le parole si evidenziano normalmente, pronte per essere copiate. Prova lo stesso gesto in un altro PDF e non succede nulla, oppure il cursore afferra l'intera pagina come una fotografia, perché è esattamente quello che è. Due file che sembrano identici a schermo possono essere costruiti in modo completamente diverso sotto. Ecco come capire quale tipo hai, e cosa fare per quello che resiste alla copia.

Due tipi diversi di pagina PDF

Un PDF può memorizzare una pagina in due modi molto diversi. In un PDF basato su testo, ogni lettera è un oggetto carattere con un valore Unicode, un font e una posizione, allo stesso modo di come una pagina web memorizza il testo: un visualizzatore può selezionarlo, cercarlo, e uno screen reader può leggerlo ad alta voce. In un PDF basato su immagine, la pagina è un'unica immagine piatta, spesso prodotta da uno scanner, un fax, o un passaggio di "stampa in PDF" applicato alla foto di un documento. Le lettere sembrano uguali ai tuoi occhi, ma per il formato del file non c'è alcun carattere sotto, solo pixel.

Confronto affiancato: una pagina PDF basata su testo con una riga di testo evidenziata e selezionabile accanto a una pagina PDF basata su immagine dove lo stesso testo apparente è un'unica immagine piatta senza selezione.

Un modo rapido per capire quale hai

Premi Ctrl+F o Cmd+F e cerca una parola che vedi chiaramente sulla pagina. Se la ricerca la trova e la evidenzia, la pagina ha un vero livello di testo. Se la ricerca non trova nulla in nessun punto del documento, la pagina è un'immagine, per quanto nitida o simile a un documento digitato possa sembrare. Trascinare il mouse per selezionare una riga dà la stessa risposta: un'evidenziazione contro una semplice selezione rettangolare.

Ricostruire il testo con l'OCR

Il riconoscimento ottico dei caratteri (OCR) legge i pixel di una pagina basata su immagine e confronta le forme con un modello addestrato di lettere per una data lingua, poi ricostruisce un livello di testo con i caratteri riconosciuti posizionati dove apparivano. Uno strumento come OCR fa questo interamente nel browser: niente viene caricato, e l'output è un file di testo semplice che puoi cercare, copiare o modificare. La precisione dipende dalla sorgente: una scansione pulita, dritta e ad alta risoluzione in una lingua ben supportata viene riconosciuta in modo affidabile, mentre una pagina storta, sfocata, a basso contrasto o manoscritta produce più errori, a volte un carattere sbagliato o una parola letta male.

Diagramma della pipeline: i pixel di una pagina scansionata passano attraverso il riconoscimento dei caratteri OCR e ne esce un livello di testo ricostruito e posizionato.

Quando il file ha già testo ma l'estrazione sembra sbagliata

Se il tuo PDF ha davvero un vero livello di testo ma uno strumento come PDF in testo produce testo in un ordine strano, con colonne mescolate o spaziatura compressa, quello è un problema diverso e non correlato: gli oggetti di testo esistono ma il loro ordine di lettura sulla pagina non è stato memorizzato come uno script naturalmente si aspetterebbe. È una stranezza di layout da sistemare dopo l'estrazione, non un segno che il testo manchi, e non serve l'OCR per risolverla.

Strumenti citati in questo articolo

Domande frequenti

Il mio PDF sembra un normale documento digitato ma non riesco comunque a selezionare alcun testo. Perché?

È più probabile che sia una pagina scansionata o fotografata salvata come PDF, o un documento appiattito intenzionalmente in un'immagine. Visivamente può essere indistinguibile da un PDF basato su testo; la differenza emerge solo quando provi a cercarlo o selezionarlo. Passarlo attraverso l'OCR ricostruisce un vero livello di testo selezionabile a partire dai pixel.

L'OCR funziona ugualmente bene in ogni lingua?

No. La precisione dipende dal fatto che esista un modello addestrato per quella lingua e script, e dalla qualità della scansione. Le lingue ben supportate su una scansione pulita e dritta vengono riconosciute in modo affidabile; scrittura a mano, immagini a bassa risoluzione, o lingue con meno dati di addestramento producono più errori. L'output OCR è sempre una trascrizione fatta al meglio delle possibilità, che vale la pena rileggere prima di affidarcisi.

Fonti