Tutoriel
Rendre un PDF scanné consultable par recherche
Un PDF scanné ressemble à un document normal mais est en réalité une image de la page : Ctrl+F ne trouve rien, et vous ne pouvez sélectionner ou copier aucun mot. L'outil OCR PDF corrige cela sans changer la nature du fichier. Il lit l'image de chaque page, reconnaît les caractères avec un moteur OCR fonctionnant sur l'appareil, et pose le texte reconnu de façon invisible par-dessus cette même image, de sorte que le PDF a toujours le même aspect et s'imprime exactement comme avant, mais répond désormais à la recherche et à la sélection de texte. Le fichier ne quitte jamais votre appareil.
Pas à pas
- Ouvrez l'outil OCR PDF et déposez votre PDF scanné. Seuls les fichiers PDF sont acceptés, et le fichier est plafonné à 80 Mo ; un scan multi-pages classique reste bien en dessous.
- Choisissez la langue du document dans le menu déroulant (anglais, français, allemand, espagnol, portugais ou italien) et, si vous le souhaitez, modifiez le nom du fichier de sortie. Le réglage par défaut conserve automatiquement l'extension .pdf.
- Cliquez sur Lancer et attendez que chaque page soit traitée. Chaque page est rendue, passée au moteur OCR et reçoit sa propre couche de texte invisible avant que l'outil ne passe à la suivante, donc un long document prend plus de temps qu'une seule page. Téléchargez le résultat : il s'ouvre et s'imprime de façon identique à l'original, mais Ctrl+F, la sélection de texte et le copier-coller fonctionnent désormais.
PDF consultable ou texte brut : de quoi avez-vous vraiment besoin
Cet outil et l'outil OCR classique résolvent le même problème de fond, reconnaître le texte dans une image scannée, mais ils ne conservent pas la même chose. L'outil OCR jette l'image de la page et vous renvoie un simple fichier .txt : utilisez-le quand vous voulez coller les mots dans un éditeur, les traduire ou les rechercher comme du texte, sans vous soucier de préserver l'aspect original du document. L'outil OCR PDF d'ici conserve le PDF original exactement tel quel, images de pages comprises, et ajoute seulement une couche de texte cachée dessous : utilisez-le quand le document doit rester un PDF que vous pouvez toujours imprimer, envoyer par e-mail ou archiver, tout en pouvant y faire des recherches ou en copier du texte. Aucun des deux outils ne reconstruit la mise en page sous forme de texte modifiable avec de vraies polices et tableaux ; les deux travaillent à partir du même texte reconnu, juste présenté différemment.
Pourquoi le résultat dépend du scan, et où sont les limites
La précision de la reconnaissance suit la qualité de l'image source, comme pour l'OCR classique : un scan propre et droit autour de 200 à 300 DPI est reconnu de façon fiable, tandis qu'une photo floue, une page de travers ou des ombres marquées produisent plus de mots mal reconnus. Si une page est ressortie de travers, redressez-la avec l'outil Redresser les pages numérisées avant de lancer l'OCR, pour que l'étape de reconnaissance lise du texte droit. L'outil couvre six langues (anglais, français, allemand, espagnol, portugais, italien) ; un document dans une langue non prise en charge ne sera pas reconnu correctement. Le traitement se fait page par page dans votre onglet de navigateur, donc un document de plusieurs dizaines de pages prend nettement plus de temps qu'un scan de deux pages, et le fichier est plafonné à 80 Mo. Le PDF de sortie a aussi tendance à rester d'une taille proche de l'original, puisque les images de pages elles-mêmes ne sont pas touchées ; si vous avez besoin d'un fichier plus léger ensuite, passez-le dans le compresseur de PDF.
Comment la couche de texte invisible est construite
Chaque page PDF est d'abord rasterisée en image sur un canvas dans votre navigateur, la même étape de rendu qu'utilise l'outil PDF en images. Le moteur OCR (Tesseract, compilé en WebAssembly) lit cette image et renvoie chaque mot reconnu avec sa boîte englobante, sa position sur la page. Ces mots sont ensuite redessinés sur une copie de la page PDF originale à leurs positions reconnues, mais à opacité zéro, de sorte que rien ne change visuellement : l'image de page que vous voyez et imprimez est celle qui a été scannée, posée au-dessus. Les fonctions de recherche et de sélection de texte d'un lecteur PDF ne regardent que cette couche de texte invisible, c'est pourquoi le fichier devient consultable et sélectionnable sans avoir d'aspect différent. Tout cela, rendu, reconnaissance et réassemblage, se passe dans votre onglet de navigateur ; le PDF est lu depuis le disque local et n'est jamais transmis nulle part.
Les outils utilisés dans ce guide
- OCR PDF · rendre consultableRendez un PDF scanné consultable et sélectionnable entièrement dans votre navigateur, sans upload.
- OCR · image/PDF en texteExtrayez le texte d'images ou PDF numérisés entièrement dans votre navigateur, hors ligne, sans upload.
- Redresser les pages numériséesCorrigez l'inclinaison des PDF ou images numérisés directement dans votre navigateur, sans envoi.
- Compresser un PDFRéduisez la taille d'un PDF en optimisant sa structure interne sans perte, sans aucun envoi.
Questions fréquentes
Le PDF consultable par recherche aura-t-il toujours le même aspect et s'imprimera-t-il exactement comme le scan original ?
Oui. L'outil ne modifie jamais l'image de la page ; il ajoute seulement une couche de texte invisible en dessous. À l'écran comme sur papier, le résultat est visuellement identique au scan que vous avez déposé. Ce qui change, c'est que les outils de recherche et de sélection de texte d'un lecteur peuvent désormais trouver et saisir les mots reconnus, parce qu'ils lisent cette couche cachée.
Pourquoi cet outil existe-t-il en plus de l'outil OCR classique ?
Ils répondent à des besoins différents à partir de la même étape de reconnaissance. L'outil OCR vous donne un fichier texte brut, ce qui convient si vous prévoyez de coller, modifier ou traduire les mots sans avoir besoin de garder le document en PDF. Cet outil conserve le fichier en PDF avec les images de pages originales intactes, ce qui convient si le document doit encore être imprimé, archivé ou envoyé par e-mail tel quel, tout en pouvant y faire des recherches ou en copier du texte.