Aucun upload, 100 % local, sans compte

Article

La boîte à outils PDF du navigateur : nettoyer, mettre en page et structurer

La plupart des tâches PDF se rangent dans trois cases : rendre un document lisible, disposer ses pages sur la surface, et modifier les données attachées au fichier. Ce site propose environ onze petits outils qui couvrent ces cases, et chacun d'eux travaille sur le fichier dans votre onglet. Le PDF est ouvert, modifié puis enregistré sans quitter votre appareil, si bien que le même outil convient aussi bien à une fiche de paie qu'à un contrat confidentiel.

Nettoyer et corriger un scan

Une page sortie d'un scanner ou d'un appareil photo de téléphone demande souvent quelques corrections avant d'être exploitable. L'outil de rotation tourne les pages arrivées de côté ou à l'envers, par pas de 90 degrés, et remplace l'ancien guide de rotation des PDF scannés. L'outil de redressement remet droit un texte légèrement incliné, ce qui compte si vous comptez ensuite lancer une reconnaissance de texte. L'outil niveaux de gris supprime les couches de couleur, ce qui réduit le poids du fichier et enlève la teinte pâle que les scanners à plat ajoutent au papier blanc. L'outil de réparation reste honnête sur ses limites : il reconstruit les parties d'un PDF abîmé que pdf-lib parvient à analyser et à réenregistrer, donc il récupère bien des fichiers que d'autres lecteurs refusent, mais il ne peut pas recréer un contenu qui n'a jamais été écrit dans le fichier. Considérez-le comme une première tentative sur un document qui ne s'ouvre plus, pas comme une garantie.

Une page scannée penchée et terne à côté de la même page après redressement et nettoyage en niveaux de gris, droite et lisible

Mettre les pages en page

Une fois le document lisible, vous pouvez avoir besoin de changer la façon dont les pages se posent sur la feuille. L'outil de recadrage rogne les marges ou découpe une page jusqu'à la zone qui vous intéresse. L'outil de redimensionnement change les dimensions de la page, par exemple de US Letter vers A4, pour qu'un document s'imprime correctement dans un autre pays. L'outil n-pages place plusieurs pages côte à côte sur une seule feuille, ce qui est pratique pour des polycopiés ou pour économiser du papier. L'outil de mélange alterné intercale deux fichiers page par page, et la raison la plus courante d'y recourir est un scan recto verso fait sur un scanner simple face : vous scannez les rectos dans un fichier, vous retournez la pile et scannez les versos dans un second fichier, puis vous les mélangez pour que les pages retrouvent leur ordre d'origine. Aucun de ces outils ne transforme votre texte en image, donc un PDF né numérique garde son texte sélectionnable après le changement de mise en page.

Métadonnées et structure

La dernière case concerne les données qui enveloppent les pages. L'outil de métadonnées lit et réécrit les champs titre, auteur, sujet et mots-clés, et vous laisse les effacer avant de partager un document, ce qui est un petit geste de confidentialité bien réel. L'outil de signets construit le sommaire cliquable qu'un lecteur PDF affiche dans son panneau latéral, ce qui rend un long rapport navigable. L'outil HTML vers PDF fait l'inverse et transforme du balisage collé en PDF, avec une réserve claire : il rend le résultat sous forme d'image de la page, donc le texte produit n'est pas sélectionnable. Quand vous avez réellement besoin des mots contenus dans un PDF, deux chemins distincts existent. Si le fichier a été créé en numérique, l'outil PDF vers texte lit directement et exactement le texte intégré. Si le fichier est un scan, il n'y a aucun texte à lire, il vous faut donc une reconnaissance optique de caractères, qui devine les lettres à partir de l'image et peut se tromper. Savoir dans quel cas vous êtes évite beaucoup de confusion.

Structure interne d'un PDF et tables XREF

Un fichier PDF n'est pas un document linéaire : c'est une base de données d'objets discrets (dictionnaires, tableaux, flux et valeurs numériques) reliés par une table de référence croisée (XREF) placée en fin de fichier. La table XREF associe chaque identifiant d'objet à son décalage exact en octets. Certains éditeurs de bureau enregistrent les modifications sous forme de mise à jour incrémentielle : une nouvelle section XREF ajoutée au fichier qui remplace uniquement les objets modifiés, en laissant les octets d'origine en place en dessous. Les outils fonctionnant dans le navigateur et basés sur pdf-lib procèdent différemment : ils analysent l'intégralité du document en un graphe d'objets en mémoire, appliquent la modification demandée (par exemple en réécrivant l'entrée Rotate d'une page de 0 à 90), puis réécrivent le fichier entier depuis zéro sous forme d'un nouveau PDF. Cette réécriture complète implique que tout le document doit tenir en mémoire pendant que l'outil s'exécute, ce qui explique pourquoi chaque outil impose une taille d'entrée maximale ; rien n'est jamais envoyé à un serveur.

Anatomie d'un fichier PDF : en-tête, objets, table xref indexant chaque objet par position en octets, et trailer

Compression des flux et fonctionnement de la réparation PDF

Le contenu d'une page PDF (commandes de dessin de texte, tracés vectoriels, images matricielles) est contenu dans des objets Stream, presque toujours compressés avec FlateDecode (zlib). Lorsqu'un PDF est corrompu, l'altération se situe généralement dans une table XREF mal formée ou dans un flux compressé tronqué. Un outil de réparation contourne entièrement la table XREF endommagée et effectue un balayage linéaire du flux d'octets brut, en recherchant les marqueurs obj et endobj qui délimitent les objets individuels. Il extrait ces objets, tente de décompresser leurs flux associés et reconstruit de zéro une nouvelle table XREF valide. Si la corruption se situe à l'intérieur d'un flux compressé Flate lui-même, les données de cet objet spécifique ne sont pas récupérables : la structure du document peut être restaurée, mais les pages concernées peuvent apparaître vides ou dépourvues d'images.

Outils mentionnés dans cet article

Questions fréquentes

Ces outils PDF envoient-ils mon fichier vers un serveur ?

Non. Chacun de ces outils ouvre, modifie et enregistre le PDF dans votre onglet grâce à JavaScript et WebAssembly. Le fichier est lu depuis votre disque vers la page et le résultat est réécrit directement dans un téléchargement, donc rien n'est envoyé sur le réseau. Vous pouvez le vérifier en ouvrant le panneau réseau de votre navigateur pendant que vous utilisez un outil, ou en vous déconnectant d'internet une fois la page chargée et en constatant que l'outil fonctionne toujours.

L'outil de réparation peut-il réparer n'importe quel PDF cassé ?

Pas n'importe quel fichier. L'outil de réparation réanalyse le document et écrit une copie neuve et bien formée, ce qui corrige les tables de références croisées cassées et bien des défauts de structure qui empêchent un PDF de s'ouvrir. Il ne peut pas inventer des données vraiment manquantes ni défaire un chiffrement fort. Voyez-le comme une première tentative rapide : s'il récupère votre fichier, c'est gagné, et sinon, vous n'avez rien perdu et pouvez chercher l'original.