Nessun upload, 100% locale, nessun account

PDF → Estrazione testo

Estrai tutto il testo leggibile dal tuo PDF. Scarica come file .txt. Tutto rimane nel tuo browser, nessun file viene inviato a un server.

Come funziona PDF in testo

Da PDF a testo estrae il livello testo esistente da un PDF e lo salva come file .txt semplice. L'estrazione è eseguita da pdf.js nel tuo browser, leggendo gli oggetti contenuto testo incorporati nei flussi di pagina del PDF. Il documento non lascia mai il tuo dispositivo; il risultato viene assemblato localmente e offerto come download diretto.

Questo strumento legge un livello testo già presente nel file. Se il tuo PDF è stato creato da un elaboratore testi o uno strumento di esportazione, quasi certamente ha un livello testo e l'estrazione funzionerà bene. Se il PDF è la scansione di un documento cartaceo, le pagine contengono solo dati immagine e non c'è un livello testo da estrarre; in quel caso, questo strumento restituirà output vuoto o incompleto. I PDF scansionati richiedono il riconoscimento ottico dei caratteri (OCR) per produrre testo, un processo separato non eseguito da questo strumento. Verifica che il tuo PDF abbia testo selezionabile in un visualizzatore prima di usare questo strumento.

Come usare PDF in testo, passo dopo passo

  1. Carica il tuo PDF nello strumento di estrazione testo.
  2. Attendi che pdf.js legga il livello testo da tutte le pagine.
  3. Controlla l'anteprima del testo estratto.
  4. Fai clic su Scarica per salvare il file .txt.

Casi d'uso comuni

  • Estrai il testo da un PDF di un articolo di ricerca per incollarlo in un'applicazione per appunti o elaborarlo con uno strumento di sintesi.
  • Recupera il contenuto da una fattura PDF in un foglio di calcolo per la contabilità senza riscriverlo manualmente.
  • Recupera il testo da un PDF con layout corrotto o bloccato dove il copia-incolla nel visualizzatore non funziona.
  • Converti un articolo PDF in testo semplice per elaborarlo con uno script o uno strumento da riga di comando.

Domande frequenti

Perché il testo estratto risulta vuoto o distorto per alcuni PDF?

La causa più comune è che il PDF è una scansione: le pagine sono immagini e non contengono un livello testo. Altre cause includono PDF in cui il testo è memorizzato come contorni o codifiche di font personalizzati che pdf.js non riesce a mappare in caratteri leggibili. Per i documenti scansionati, è necessario l'OCR per produrre testo.

Questo strumento esegue l'OCR sui PDF scansionati?

No. Questo strumento legge un livello testo esistente dal PDF. Non esegue il riconoscimento ottico dei caratteri. Per i PDF scansionati, usa lo strumento OCR, che passa le immagini delle pagine attraverso un motore OCR locale nel tuo browser.

L'estrazione del testo avviene su un server o nel mio browser?

Nel tuo browser. pdf.js legge la struttura PDF localmente, analizza gli oggetti contenuto testo da ogni flusso di pagina e assembla l'output nella memoria del browser. I dati PDF non lasciano mai il tuo dispositivo durante questo processo.

La formattazione e il layout saranno preservati nell'output testo?

No. Il testo semplice non porta informazioni su font, dimensione, colore o posizione. L'output è testo non formattato in ordine di lettura come determinato da pdf.js. Tabelle, layout multi-colonna e formattazione speciale vengono appiattiti. Per la preservazione del layout completo, i convertitori PDF in HTML sono più adatti.

Posso estrarre testo da un PDF protetto da password?

Se il PDF ha una password utente di apertura, devi fornirla affinché il PDF possa essere letto. Le restrizioni di estrazione a livello proprietario possono anche bloccare l'operazione. Rimuovi prima quelle restrizioni con lo strumento PDF Unlock, poi riprova l'estrazione.

Devo creare un account per estrarre il testo da un PDF?

No. Non c'è registrazione né account. Carica il file, leggi l'anteprima estratta e scarica il file .txt.

PDF in Testo funziona su un browser mobile?

Sì. pdf.js funziona allo stesso modo su un browser da telefono e su desktop. Copia o scarica il testo estratto direttamente dalla pagina mobile una volta terminata l'estrazione.