Aucun upload, 100 % local, sans compte

Tutoriel

Comment extraire les images intégrées d'un PDF

Extraire les images d'un PDF peut vouloir dire deux choses différentes, qui demandent deux outils différents. Ce guide traite de la récupération des fichiers image d'origine placés dans le document : les photos qu'un graphiste a déposées dans une brochure, le logo d'un rapport, les scans contenus dans un contrat. Ce n'est pas la même chose que transformer chaque page en image. Si vous voulez un instantané de l'aspect d'une page entière, avec son texte et sa mise en page, utilisez plutôt l'outil PDF en JPG. L'extracteur présenté ici lit les objets raster stockés dans le PDF et vous rend les images sources elles-mêmes, à leur résolution d'origine, le tout dans votre navigateur.

Pas à pas

  1. Ouvrez l'extracteur d'images PDF et déposez-y votre fichier. L'outil lit le document en local et indique combien d'images intégrées il a trouvées. Rien n'est envoyé ailleurs : l'analyse se fait dans l'onglet du navigateur, sur votre propre appareil.
    L'extracteur d'images PDF avec un document chargé, affichant le nombre d'images intégrées trouvées
  2. Laissez-le analyser les objets image intégrés. Il parcourt chaque page, collecte chaque raster qu'il rencontre et retire les copies de masques en double pour ne pas vous donner deux versions de la même image. Aucun réglage de page ni de format n'est à choisir : le but est de rendre les originaux exactement tels qu'ils étaient stockés, sans les ré-encoder.
  3. Téléchargez le résultat. Une seule image revient sous forme d'un fichier ; plusieurs images sont proposées en téléchargements individuels, nommées et triées pour rester dans l'ordre. Chaque fichier conserve le format qu'il avait dans le PDF, en général JPEG pour les photos et PNG pour les graphiques avec transparence.
    Les images extraites prêtes au téléchargement, un fichier par image

Images intégrées ou pages transformées en images

C'est la distinction qui décide de l'outil dont vous avez besoin. Une image intégrée est une photo ou un graphique que l'auteur a placé dans le PDF ; cet extracteur rend ce fichier tel qu'il était stocké, à sa taille réelle en pixels, sans rien peint autour. Rendre une page en image fait l'inverse : PDF en JPG dessine tout ce qui se trouve sur la page (texte, formes vectorielles, fonds et images intégrées réunis) dans un seul raster aplati, à la résolution que vous choisissez. Utilisez l'extracteur quand vous voulez récupérer les ressources sources, par exemple pour réutiliser une photo de produit. Utilisez PDF en JPG quand vous voulez un instantané fidèle de la page telle qu'un lecteur la voit.

Pourquoi le faire en local change tout

Les images cachées dans un PDF en sont souvent la partie la plus sensible : photos d'identité scannées, pages signées, captures internes, créations privées. Envoyer le document à un extracteur en ligne confie tout cela à un serveur que vous ne contrôlez pas, avec le calque de texte et les éventuelles métadonnées. L'extracteur présenté ici ouvre le PDF avec PDF.js dans votre navigateur et en sort les objets image sur votre machine : le fichier et tout ce qu'il contient restent sur votre appareil.

Fonctionnement de l'extraction d'images PDF

Extraire des images d'un PDF ne revient pas à convertir une page en capture d'écran. Dans un fichier PDF, les images sont stockées sous forme de flux /XObject indépendants contenant des données binaires brutes (généralement en encodage DCTDecode/JPEG, Flate, JPX ou CCITT) accompagnées de métadonnées sur les dimensions et l'espace colorimétrique. Un outil d'extraction adéquat analyse ces flux directement et récupère chaque image sans la réencoder. Puisque les octets bruts sont lus plutôt que rendus à nouveau, le fichier extrait conserve exactement la résolution, le profil colorimétrique et la qualité présents lors de l'intégration initiale. Aucune étape de recompression ne vient dégrader la qualité, quel que soit le nombre de fois où le PDF lui-même a été resauvegardé.

Les outils utilisés dans ce guide

Questions fréquentes

Vais-je obtenir les images d'origine ou des captures des pages ?

Les images d'origine. Cet outil rend les fichiers image intégrés tels qu'ils étaient stockés dans le PDF, à leur résolution native et dans leur format d'origine. Si vous voulez plutôt une image de chaque page entière, avec le texte et la mise en page, c'est une autre tâche : utilisez l'outil PDF en JPG, qui rasterise la page entière à la résolution que vous choisissez.

Pourquoi a-t-il trouvé moins d'images que prévu ?

Un PDF ne contient des images intégrées que là où l'auteur a réellement placé des fichiers raster. Les graphiques vectoriels, les diagrammes tracés avec les commandes de dessin du PDF et le texte ne sont pas des images : ils ne sont donc pas extraits. L'outil retire aussi les copies de masques en double que certains exports créent, ce qui peut faire baisser le décompte. Si une page est elle-même un scan, elle contient en général une image pleine page, et c'est ce que vous récupérerez.