Nessun upload, 100% locale, nessun account

Tutorial

Rendi ricercabile un PDF scansionato

Un PDF scansionato sembra un documento normale ma in realtà è l'immagine di una pagina: Ctrl+F non trova nulla, e non puoi selezionare o copiare una singola parola. Lo strumento OCR PDF risolve questo senza cambiare cosa sia il file. Legge l'immagine di ogni pagina, riconosce i caratteri con un motore OCR eseguito sul dispositivo, e posiziona il testo riconosciuto in modo invisibile sopra quella stessa immagine, così il PDF continua ad avere lo stesso aspetto e a stampare esattamente come prima ma ora risponde alla ricerca e alla selezione del testo. Il file non lascia mai il tuo dispositivo.

Passo dopo passo

  1. Apri lo strumento OCR PDF e trascina il tuo PDF scansionato. Vengono accettati solo file PDF, e il file è limitato a 80 MB; una scansione multipagina tipica è ben al di sotto di questo limite.
  2. Scegli la lingua del documento dal menu a tendina (inglese, francese, tedesco, spagnolo, portoghese o italiano) e, se vuoi, modifica il nome del file di output. Il valore predefinito mantiene automaticamente l'estensione .pdf.
  3. Clicca Esegui e aspetta che ogni pagina venga elaborata. Ogni pagina viene renderizzata, passata attraverso il motore OCR e dotata del proprio livello di testo invisibile prima che lo strumento passi alla successiva, quindi un documento lungo richiede più tempo di una singola pagina. Scarica il risultato: si apre e stampa in modo identico all'originale, ma ora Ctrl+F, la selezione del testo e il copia-incolla funzionano.

PDF ricercabile o testo semplice: di quale hai davvero bisogno

Questo strumento e lo strumento OCR semplice risolvono lo stesso problema di fondo, riconoscere il testo in un'immagine scansionata, ma conservano cose diverse. Lo strumento OCR scarta l'immagine della pagina e restituisce un file .txt semplice: usalo quando vuoi incollare le parole in un editor, tradurle o cercarle come testo, e non ti interessa preservare l'aspetto originale del documento. Lo strumento OCR PDF qui mantiene il PDF originale esattamente com'è, immagini di pagina comprese, e aggiunge solo un livello di testo nascosto sotto: usalo quando il documento deve restare un PDF che puoi ancora stampare, inviare via email o archiviare, ma vuoi anche poterlo cercare o copiare da esso. Nessuno dei due strumenti ricostruisce il layout come testo modificabile con font e tabelle reali; entrambi lavorano dallo stesso testo riconosciuto, semplicemente impacchettato in modo diverso.

Perché il risultato dipende dalla scansione, e dove sono i limiti

La precisione del riconoscimento segue la qualità dell'immagine sorgente, allo stesso modo dell'OCR semplice: una scansione pulita e dritta intorno ai 200-300 DPI viene riconosciuta in modo affidabile, mentre una foto sfocata, una pagina storta o ombre pesanti producono più parole lette male. Se una pagina è uscita storta, raddrizzala con lo strumento di raddrizzamento PDF prima di eseguire l'OCR così il passaggio di riconoscimento legge testo dritto. Lo strumento copre sei lingue (inglese, francese, tedesco, spagnolo, portoghese, italiano); un documento in una lingua non supportata non verrà riconosciuto correttamente. L'elaborazione avviene pagina per pagina nella scheda del browser, quindi un documento con decine di pagine richiede notevolmente più tempo di una scansione di due pagine, e il file è limitato a 80 MB. Il PDF di output tende anche ad avere una dimensione simile all'originale, dato che le immagini delle pagine stesse non vengono toccate; se in seguito ti serve un file più piccolo, passalo nel compressore PDF.

Come viene costruito il livello di testo invisibile

Ogni pagina PDF viene prima rasterizzata su un'immagine canvas nel tuo browser, lo stesso passaggio di rendering che usa lo strumento PDF in immagine. Il motore OCR (Tesseract, compilato in WebAssembly) legge quell'immagine e restituisce ogni parola riconosciuta insieme al suo riquadro di delimitazione, la sua posizione sulla pagina. Quelle parole vengono poi disegnate su una copia della pagina PDF originale nelle posizioni riconosciute, ma a opacità zero, così nulla cambia visivamente: l'immagine di pagina che vedi e stampi è la stessa che è stata scansionata, posizionata sopra. Le funzioni di ricerca e selezione del testo di un visualizzatore PDF guardano solo quel livello di testo invisibile, ecco perché il file diventa ricercabile e selezionabile senza sembrare diverso. Tutto questo, rendering, riconoscimento e riassemblaggio, avviene dentro la scheda del tuo browser; il PDF viene letto dal disco locale e non trasmesso mai da nessuna parte.

Gli strumenti usati in questa guida

Domande frequenti

Il PDF ricercabile continuerà a sembrare e stampare esattamente come la scansione originale?

Sì. Lo strumento non modifica mai l'immagine della pagina; aggiunge solo un livello di testo invisibile sotto di essa. Su schermo e su carta, il risultato è visivamente identico alla scansione che hai trascinato. Ciò che cambia è che gli strumenti di ricerca e selezione del testo di un visualizzatore ora possono trovare e afferrare le parole riconosciute, perché leggono da quel livello nascosto.

Perché esiste questo strumento accanto allo strumento OCR semplice?

Rispondono a esigenze diverse a partire dallo stesso passaggio di riconoscimento. Lo strumento OCR ti dà un file di testo semplice, che è ciò che vuoi se pensi di incollare, modificare o tradurre le parole e non hai bisogno di mantenere il documento come PDF. Questo strumento mantiene il file come PDF con le immagini di pagina originali intatte, che è ciò che vuoi se il documento deve ancora essere stampato, archiviato o inviato via email così com'è, ma vuoi anche poterci cercare o copiare testo.

Fonti