Comment fonctionne OCR · image/PDF en texte
L'OCR convertit une image numérisée ou un PDF basé sur des images en texte que vous pouvez copier, rechercher et modifier, en utilisant tesseract.js qui s'exécute entièrement dans votre navigateur. Vous choisissez la langue du document dans le sélecteur, le modèle de langue correspondant est téléchargé une fois dans votre navigateur, et toutes les reconnaissances suivantes s'exécutent hors ligne à partir de ce modèle mis en cache. Vos fichiers numérisés ne sont jamais transmis à aucun serveur pendant la conversion.
La précision de la reconnaissance dépend fortement de la qualité de la numérisation. Les numérisations propres à fort contraste à 200 PPP ou plus, avec un bruit de fond minimal et un alignement de page droit, produisent les meilleurs résultats. Les JPEG flous, basse résolution ou fortement compressés, les pages avec colonnes ou mises en page complexes, et le texte manuscrit réduisent la précision. L'outil produit un bloc de texte brut ; pour une sortie structurée comme des tableaux préservés ou une mise en page multi-colonnes, un post-traitement est nécessaire. Utiliser l'outil PDF Redresser sur les numérisations tordues avant l'OCR améliore généralement les taux de reconnaissance.