Comment fonctionne OCR PDF · rendre consultable
OCR PDF transforme un PDF scanne, compose d'images de page sans texte reel, en un PDF consultable : les memes images de page, plus une couche de texte invisible positionnee sur chaque mot reconnu. Ouvrez le resultat dans n'importe quel lecteur PDF et vous pouvez desormais utiliser Ctrl+F pour trouver un mot, selectionner et copier un paragraphe, ou laisser un moteur de recherche indexer le document, autant de choses qu'un simple scan ne permet pas. La reconnaissance elle-meme s'appuie sur tesseract.js (le meme moteur OCR auto-heberge que l'outil OCR), et le rendu des pages sur pdf.js ; les deux s'executent entierement dans l'onglet de votre navigateur, et votre fichier n'est jamais envoye.
Cet outil est honnete sur ce qu'il fait et ce qu'il ne fait pas. Il ne reconstruit ni mise en page, ni tableaux, ni polices, et ce n'est pas un convertisseur vers un document modifiable : la page visible reste une image, identique au scan source, avec une couche de texte cachee ajoutee sous l'apparence. La precision de la reconnaissance depend de la qualite du scan, les memes recommandations que pour tout moteur OCR (200 PPP ou plus, fort contraste, page bien droite). Si vous avez seulement besoin du texte extrait plutot que d'un PDF consultable, l'outil OCR produit un fichier .txt et va plus vite pour cet usage precis.