Aucun upload, 100 % local, sans compte

Article

Pourquoi vous ne pouvez pas copier le texte de certains PDF

Essayez de sélectionner une ligne dans un PDF et les mots se surlignent normalement, prêts à copier. Essayez le même geste dans un autre PDF et rien ne se passe, ou le curseur saisit toute la page comme une photographie, parce que c'est exactement ce que c'est. Deux fichiers qui semblent identiques à l'écran peuvent être construits de façon totalement différente en dessous. Voici comment savoir lequel vous avez, et que faire de celui qui résiste à la copie.

Deux types de page PDF différents

Un PDF peut stocker une page de deux façons très différentes. Dans un PDF basé sur du texte, chaque lettre est un objet caractère avec une valeur Unicode, une police et une position, de la même façon qu'une page web stocke du texte : un lecteur peut la sélectionner, la rechercher, et un lecteur d'écran peut la lire à voix haute. Dans un PDF basé sur une image, la page est une seule image plate, souvent produite par un scanner, un fax, ou une étape « imprimer en PDF » appliquée à une photo d'un document. Les lettres se ressemblent à l'œil, mais pour le format de fichier il n'y a aucun caractère en dessous, seulement des pixels.

Comparaison côte à côte : une page PDF basée sur du texte avec une ligne de texte surlignée et sélectionnable, à côté d'une page PDF basée sur une image où le texte d'apparence identique est une seule image plate sans sélection possible.

Un moyen rapide de savoir lequel vous avez

Appuyez sur Ctrl+F ou Cmd+F et recherchez un mot que vous voyez clairement sur la page. Si la recherche le trouve et le surligne, la page a une vraie couche de texte. Si la recherche ne trouve rien nulle part dans le document, la page est une image, aussi nette soit-elle ou aussi semblable à un document tapé qu'elle paraisse. Faire glisser la souris pour sélectionner une ligne donne la même réponse : un surlignage contre une simple sélection rectangulaire.

Reconstruire le texte avec l'OCR

La reconnaissance optique de caractères (OCR) lit les pixels d'une page basée sur une image et compare les formes à un modèle entraîné de lettres pour une langue donnée, puis reconstruit une couche de texte avec les caractères reconnus positionnés là où ils apparaissaient. Un outil comme OCR fait cela entièrement dans le navigateur : rien n'est envoyé, et le résultat est un fichier texte brut que vous pouvez rechercher, copier ou modifier. La précision dépend de la source : un scan propre, droit et haute résolution dans une langue bien prise en charge est reconnu de façon fiable, tandis qu'une page de travers, floue, à faible contraste ou manuscrite produit plus d'erreurs, parfois un caractère erroné ou un mot mal reconnu.

Schéma de traitement : les pixels d'une page scannée passent par la reconnaissance de caractères OCR et ressortent sous forme de couche de texte reconstruite et positionnée.

Quand le fichier a déjà du texte mais que l'extraction semble incorrecte

Si votre PDF a bien une vraie couche de texte mais qu'un outil comme PDF en texte produit du texte dans un ordre étrange, avec des colonnes fusionnées ou des espacements écrasés, c'est un problème différent et sans rapport : les objets texte existent mais leur ordre de lecture sur la page n'a pas été stocké de la façon qu'un script attend naturellement. C'est une bizarrerie de mise en page à nettoyer après l'extraction, pas un signe que le texte manque, et cela ne nécessite pas l'OCR pour être corrigé.

Outils mentionnés dans cet article

Questions fréquentes

Mon PDF ressemble à un document tapé normal mais je ne peux toujours sélectionner aucun texte. Pourquoi ?

Il s'agit très probablement d'une page scannée ou photographiée enregistrée en PDF, ou d'un document aplati en image exprès. Visuellement, cela peut être impossible à distinguer d'un PDF basé sur du texte ; la différence n'apparaît que quand vous essayez de le rechercher ou de le sélectionner. Le passer par l'OCR reconstruit une vraie couche de texte sélectionnable à partir des pixels.

L'OCR fonctionne-t-il aussi bien dans toutes les langues ?

Non. La précision dépend de l'existence d'un modèle entraîné pour cette langue et cette écriture, et de la qualité du scan. Les langues bien prises en charge sur un scan propre et droit sont reconnues de façon fiable ; l'écriture manuscrite, les images basse résolution, ou les langues avec moins de données d'entraînement produisent plus d'erreurs. Le résultat de l'OCR est toujours une transcription au mieux, qui mérite une relecture rapide avant de s'y fier.

Sources