Article
Pourquoi vous ne pouvez pas copier le texte de certains PDF
Essayez de sélectionner une ligne dans un PDF et les mots se surlignent normalement, prêts à copier. Essayez le même geste dans un autre PDF et rien ne se passe, ou le curseur saisit toute la page comme une photographie, parce que c'est exactement ce que c'est. Deux fichiers qui semblent identiques à l'écran peuvent être construits de façon totalement différente en dessous. Voici comment savoir lequel vous avez, et que faire de celui qui résiste à la copie.
Deux types de page PDF différents
Un PDF peut stocker une page de deux façons très différentes. Dans un PDF basé sur du texte, chaque lettre est un objet caractère avec une valeur Unicode, une police et une position, de la même façon qu'une page web stocke du texte : un lecteur peut la sélectionner, la rechercher, et un lecteur d'écran peut la lire à voix haute. Dans un PDF basé sur une image, la page est une seule image plate, souvent produite par un scanner, un fax, ou une étape « imprimer en PDF » appliquée à une photo d'un document. Les lettres se ressemblent à l'œil, mais pour le format de fichier il n'y a aucun caractère en dessous, seulement des pixels.

Un moyen rapide de savoir lequel vous avez
Appuyez sur Ctrl+F ou Cmd+F et recherchez un mot que vous voyez clairement sur la page. Si la recherche le trouve et le surligne, la page a une vraie couche de texte. Si la recherche ne trouve rien nulle part dans le document, la page est une image, aussi nette soit-elle ou aussi semblable à un document tapé qu'elle paraisse. Faire glisser la souris pour sélectionner une ligne donne la même réponse : un surlignage contre une simple sélection rectangulaire.
Reconstruire le texte avec l'OCR
La reconnaissance optique de caractères (OCR) lit les pixels d'une page basée sur une image et compare les formes à un modèle entraîné de lettres pour une langue donnée, puis reconstruit une couche de texte avec les caractères reconnus positionnés là où ils apparaissaient. Un outil comme OCR fait cela entièrement dans le navigateur : rien n'est envoyé, et le résultat est un fichier texte brut que vous pouvez rechercher, copier ou modifier. La précision dépend de la source : un scan propre, droit et haute résolution dans une langue bien prise en charge est reconnu de façon fiable, tandis qu'une page de travers, floue, à faible contraste ou manuscrite produit plus d'erreurs, parfois un caractère erroné ou un mot mal reconnu.

Quand le fichier a déjà du texte mais que l'extraction semble incorrecte
Si votre PDF a bien une vraie couche de texte mais qu'un outil comme PDF en texte produit du texte dans un ordre étrange, avec des colonnes fusionnées ou des espacements écrasés, c'est un problème différent et sans rapport : les objets texte existent mais leur ordre de lecture sur la page n'a pas été stocké de la façon qu'un script attend naturellement. C'est une bizarrerie de mise en page à nettoyer après l'extraction, pas un signe que le texte manque, et cela ne nécessite pas l'OCR pour être corrigé.
Outils mentionnés dans cet article
- OCR · image/PDF en texteExtrayez le texte d'images ou PDF numérisés entièrement dans votre navigateur, hors ligne, sans upload.
- PDF en texteExtrayez le contenu texte d'un PDF et téléchargez-le en .txt, sans upload.
- OCR PDF · rendre consultableRendez un PDF scanné consultable et sélectionnable entièrement dans votre navigateur, sans upload.
Questions fréquentes
Mon PDF ressemble à un document tapé normal mais je ne peux toujours sélectionner aucun texte. Pourquoi ?
Il s'agit très probablement d'une page scannée ou photographiée enregistrée en PDF, ou d'un document aplati en image exprès. Visuellement, cela peut être impossible à distinguer d'un PDF basé sur du texte ; la différence n'apparaît que quand vous essayez de le rechercher ou de le sélectionner. Le passer par l'OCR reconstruit une vraie couche de texte sélectionnable à partir des pixels.
L'OCR fonctionne-t-il aussi bien dans toutes les langues ?
Non. La précision dépend de l'existence d'un modèle entraîné pour cette langue et cette écriture, et de la qualité du scan. Les langues bien prises en charge sur un scan propre et droit sont reconnues de façon fiable ; l'écriture manuscrite, les images basse résolution, ou les langues avec moins de données d'entraînement produisent plus d'erreurs. Le résultat de l'OCR est toujours une transcription au mieux, qui mérite une relecture rapide avant de s'y fier.