Comment fonctionne PDF en texte
PDF en texte extrait la couche de texte existante d'un PDF et l'enregistre sous forme de fichier .txt brut. L'extraction est effectuée par pdf.js dans votre navigateur, qui lit les objets de contenu texte intégrés dans les flux de pages du PDF. Le document ne quitte jamais votre appareil ; le résultat est assemblé localement et proposé en téléchargement direct.
Cet outil lit une couche de texte déjà présente dans le fichier. Si votre PDF a été créé par un traitement de texte ou un outil d'export, il a presque certainement une couche de texte et l'extraction fonctionnera bien. Si le PDF est la numérisation d'un document papier, les pages ne contiennent que des données d'image et il n'y a pas de couche de texte à extraire ; dans ce cas, cet outil retournera un résultat vide ou incomplet. Les PDF numérisés nécessitent une reconnaissance optique des caractères (OCR) pour produire du texte, ce qui est un processus distinct non effectué par cet outil. Vérifiez que votre PDF a du texte sélectionnable dans un visionneur avant d'utiliser cet outil.