Aucun upload, 100 % local, sans compte

Article

Pourquoi noircir du texte dans un PDF échoue souvent

Un rectangle noir dessiné sur un paragraphe donne l'impression que le texte a disparu, mais dans la plupart des éditeurs PDF, ce n'est pas le cas. Les lettres que vous avez couvertes sont toujours stockées dans le fichier comme des caractères sélectionnables ; le rectangle n'est qu'une nouvelle forme posée par-dessus. Copiez la page, recherchez-la, ou ouvrez-la dans un autre lecteur, et la phrase « caviardée » peut réapparaître. Voici pourquoi cela arrive, et une méthode de caviardage qui retire réellement le texte au lieu de le cacher.

Une forme par-dessus n'est pas une suppression

Une page PDF garde deux choses séparément : les objets texte, chacun étant un caractère avec une position et une police, et les objets de dessin placés sur la page, qui incluent tout rectangle, surlignage ou annotation que vous ajoutez. Quand vous dessinez un rectangle noir dans un lecteur PDF, vous ajoutez un nouvel objet de dessin au-dessus des objets texte existants. La page semble désormais caviardée parce que le rectangle recouvre visuellement les lettres. Rien ne dit au fichier de supprimer les objets texte en dessous, donc ils restent exactement où ils étaient, à la même position, avec le même contenu.

Schéma d'une page PDF divisée en deux couches : les objets texte en dessous et un rectangle en objet de dessin posé au-dessus, recouvrant visuellement mais sans supprimer les caractères.

Comment le texte original refait surface

Comme les objets texte n'ont jamais quitté le fichier, quatre actions ordinaires peuvent les exposer : sélectionner et copier la ligne « noircie », lancer une recherche de texte dans tout le document, extraire le texte brut avec n'importe quel outil PDF vers texte, ou ouvrir le fichier dans un lecteur qui affiche les objets texte au-dessus des objets de dessin dans un ordre différent. Aucune de ces actions ne demande de compétence particulière. Cela s'est produit publiquement plus d'une fois : des PDF publiés avec des rectangles noirs sur des passages sensibles se sont révélés contenir encore du texte lisible et copiable en dessous, et l'erreur a fait la une au lieu de rester cachée.

Transformer d'abord la page en image

La solution consiste à retirer la couche de texte avant de caviarder, pas après. Convertissez la page PDF en simple image avec un outil comme PDF en images, puis dessinez sur la zone sensible de cette image avec Masquer des zones d'image. À ce stade, il ne reste plus aucun objet texte sur la page, seulement des pixels, donc le rectangle ne recouvre plus rien de récupérable. Réassemblez les images caviardées en PDF avec Images en PDF et le texte auparavant sensible n'existe tout simplement plus, seulement une image de page avec une partie recouverte.

Schéma de mode opératoire : une page PDF est convertie en image, caviardée avec un rectangle opaque sur les pixels, puis réassemblée en un nouveau PDF sans texte récupérable en dessous.

Ce que cela sacrifie

Rasteriser une page transforme du vrai texte consultable par recherche en une image statique, donc quiconque lit la page caviardée ensuite ne peut plus sélectionner ni rechercher le texte de cette page, caviardé ou non. C'est un compromis acceptable pour la page que vous protégez : l'alternative, garder la couche de texte intacte en espérant que personne ne vérifie, est exactement l'erreur par laquelle cet article a commencé. Si d'autres pages du même document ne contiennent rien de sensible, vous pouvez les laisser intactes et ne rasteriser que celles qui en ont besoin.

Utilisez un rectangle plein, et vérifiez aussi les métadonnées

Pour du texte, un rectangle noir ou de couleur pleine et totalement opaque est le choix le plus sûr ; un filtre de flou peut parfois être inversé pour du texte simple et grand si le flou est léger, il convient donc mieux à des visages ou des photos qu'à des phrases. Caviarder la page visible ne touche pas non plus aux métadonnées du fichier : nom de l'auteur, version du logiciel, coordonnées GPS sur des photos intégrées, ou historique de modification peuvent fuiter séparément du contenu de la page. Si cela compte pour votre document, vérifiez ce que révèlent les propres métadonnées de votre fichier avant de le partager.

Outils mentionnés dans cet article

Questions fréquentes

Dessiner un rectangle noir dans un lecteur PDF supprime-t-il réellement le texte en dessous ?

En général non. À moins que l'outil ait une fonction de caviardage dédiée qui supprime les objets texte sous-jacents, dessiner une forme ne fait qu'ajouter une couche par-dessus la page. Les caractères originaux restent dans le fichier et peuvent être sélectionnés, recherchés ou extraits avec des outils courants.

Flouter du texte sensible est-il plus sûr que le couvrir d'un rectangle ?

Pour du texte, non. Un flou léger appliqué à du texte simple et grand peut parfois être inversé suffisamment bien pour deviner les caractères originaux, en particulier pour des mots courts ou des nombres. Un rectangle plein et totalement opaque, ou retirer entièrement la couche de texte en rasterisant d'abord, est l'option la plus sûre pour du texte ; le flou convient mieux à des visages ou du contenu photo général.

Convertir un PDF en images avant de caviarder fait-il perdre quelque chose d'important ?

Cela fait perdre la possibilité de sélectionner ou de rechercher du texte sur les pages converties, puisqu'elles deviennent de simples images. Pour une page que vous caviardez activement, c'est justement le but : le texte sensible n'existe plus comme des caractères extractibles. Les pages qui ne contiennent rien de sensible peuvent rester des pages PDF normales si vous ne rasterisez que celles qui en ont besoin.