Aucun upload, 100 % local, sans compte

Rendre un PDF scanné consultable

Déposez un PDF scanné et récupérez les mêmes pages avec une couche de texte invisible et consultable ajoutée par-dessus. La reconnaissance tourne entièrement dans votre navigateur (sur appareil, hors ligne après le 1er chargement), rien n'est envoyé.

Comment fonctionne OCR PDF · rendre consultable

OCR PDF transforme un PDF scanne, compose d'images de page sans texte reel, en un PDF consultable : les memes images de page, plus une couche de texte invisible positionnee sur chaque mot reconnu. Ouvrez le resultat dans n'importe quel lecteur PDF et vous pouvez desormais utiliser Ctrl+F pour trouver un mot, selectionner et copier un paragraphe, ou laisser un moteur de recherche indexer le document, autant de choses qu'un simple scan ne permet pas. La reconnaissance elle-meme s'appuie sur tesseract.js (le meme moteur OCR auto-heberge que l'outil OCR), et le rendu des pages sur pdf.js ; les deux s'executent entierement dans l'onglet de votre navigateur, et votre fichier n'est jamais envoye.

Cet outil est honnete sur ce qu'il fait et ce qu'il ne fait pas. Il ne reconstruit ni mise en page, ni tableaux, ni polices, et ce n'est pas un convertisseur vers un document modifiable : la page visible reste une image, identique au scan source, avec une couche de texte cachee ajoutee sous l'apparence. La precision de la reconnaissance depend de la qualite du scan, les memes recommandations que pour tout moteur OCR (200 PPP ou plus, fort contraste, page bien droite). Si vous avez seulement besoin du texte extrait plutot que d'un PDF consultable, l'outil OCR produit un fichier .txt et va plus vite pour cet usage precis.

Comment utiliser OCR PDF · rendre consultable, étape par étape

  1. Deposez votre PDF scanne (une image par page, sans couche de texte existante) dans la zone de depot.
  2. Selectionnez la langue principale du document dans la liste deroulante.
  3. Si c'est la premiere fois que vous utilisez l'outil, attendez le telechargement du moteur tesseract.js (cela se produit une seule fois).
  4. Cliquez sur lancer et patientez pendant que chaque page est rendue puis reconnue tour a tour.
  5. Telechargez le PDF consultable : le meme rendu visuel, avec desormais une couche de texte dessous.

Cas d'utilisation courants

  • Un contrat scanne doit devenir consultable pour retrouver une clause precise avec Ctrl+F plutot que de relire chaque page.
  • Un lot de factures scannees doit rejoindre une archive documentaire dont l'index de recherche ne lit que du vrai texte PDF.
  • Un formulaire photographie ou scanne doit voir ses libelles imprimes devenir selectionnables pour copier un paragraphe dans un e-mail.
  • Une bibliotheque de rapports scannes en allemand a besoin d'une recherche plein texte ; selectionnez l'allemand comme langue avant de lancer l'outil.

Questions fréquentes

En quoi cet outil differe-t-il de l'OCR classique ?

L'outil OCR extrait du texte brut dans un fichier .txt, en abandonnant entierement la mise en page et les images d'origine. OCR PDF conserve les images de page du PDF original telles quelles et ajoute une couche de texte invisible et consultable en dessous. Utilisez OCR quand vous voulez seulement les mots ; utilisez OCR PDF quand vous voulez garder le document en PDF tout en le rendant consultable et selectionnable.

Le PDF produit va-t-il ressembler differemment a mon scan ?

Non. Chaque page est rendue a partir de votre PDF source puis reincorporee comme image, visuellement identique au scan d'origine (aux arrondis pres du reencodage JPEG). Les mots reconnus sont dessines par-dessus a opacite nulle, donc rien de nouveau n'est visible ; seule une recherche ou une selection de texte revele la couche ajoutee.

L'outil reconstruit-il les tableaux, les colonnes ou les polices ?

Non. La sortie garde la page comme une seule image plate ; la couche de texte invisible suit la position des mots reconnus mais ne preserve ni la structure des tableaux, ni l'ordre de lecture multi-colonnes au-dela de ce que tesseract.js deduit, ni les polices d'origine. C'est une couche de consultabilite, pas une conversion en document modifiable.

Mes documents scannes sont-ils envoyes quelque part pendant le traitement ?

Non. Une fois le moteur tesseract.js et le paquet de langue telecharges depuis ce site (un telechargement ponctuel de plusieurs megaoctets a la premiere utilisation), chaque rendu de page et chaque passe de reconnaissance se deroule entierement dans l'onglet de votre navigateur. Les contrats scannes, dossiers medicaux ou autres documents sensibles n'atteignent jamais un serveur.

Pourquoi un long PDF met-il du temps a se traiter ?

Chaque page est rendue en image puis l'OCR tourne sur cette image individuellement, le tout dans l'onglet de votre navigateur : le temps de traitement suit donc le nombre de pages. La barre de progression reflete une avancee reelle page par page, et les fichiers sont plafonnes a 80 Mo pour que tout le pipeline reste dans le budget memoire d'un onglet.

Que faire si mon PDF a deja du texte selectionnable ?

Lancer l'OCR sur un PDF qui possede deja une vraie couche de texte est inutile : l'ouvrir dans un lecteur et appuyer sur Ctrl+F fonctionne deja. Cet outil est fait pour les PDF composes d'images de page sans texte sous-jacent, la sortie habituelle d'un scanner a plat ou d'une impression en PDF d'un document photographie.