Инструкция
Как извлечь встроенные изображения из PDF
Под извлечением изображений из PDF понимают две разные вещи, и для них нужны разные инструменты. Это руководство о том, как достать исходные файлы изображений, помещённые внутрь документа: фотографии, которые дизайнер вставил в брошюру, логотип в отчёте, сканы внутри договора. Это не то же самое, что превратить каждую страницу в картинку. Если вам нужен снимок того, как выглядит вся страница, вместе с текстом и вёрсткой, используйте вместо этого инструмент PDF в JPG. Экстрактор здесь читает растровые объекты, хранящиеся в PDF, и возвращает вам сами исходные изображения в их оригинальном разрешении, всё это прямо в браузере.
Шаг за шагом
- Откройте экстрактор изображений из PDF и перетащите туда свой файл. Инструмент читает документ локально и показывает, сколько встроенных изображений он нашёл. Ничего никуда не отправляется: разбор происходит во вкладке браузера на вашем собственном устройстве.

- Дайте ему просканировать встроенные графические объекты. Он проходит по каждой странице, собирает каждый найденный растр и убирает дублирующие копии мягких масок, чтобы у вас не оказалось двух версий одной и той же картинки. Никаких настроек страниц или формата выбирать не нужно: цель в том, чтобы вернуть оригиналы ровно такими, какими они хранились, а не перекодировать их.
- Скачайте результат. Одно изображение возвращается как один файл; несколько изображений предлагаются как отдельные загрузки, названные и отсортированные так, чтобы сохранять порядок. Каждый файл сохраняет тот формат, который был у него внутри PDF, обычно это JPEG для фотографий и PNG для графики с прозрачностью.

Встроенные изображения против страниц, превращённых в картинки
Именно это различие решает, какой инструмент вам нужен. Встроенное изображение, это фотография или графика, которую автор поместил внутрь PDF; этот экстрактор возвращает такой файл в том виде, как он хранился, в его реальном размере в пикселях, без ничего вокруг. Рендеринг страницы в картинку, это противоположное: PDF в JPG отрисовывает на странице всё (текст, векторные фигуры, фоны и встроенные изображения вместе) в один плоский растр в выбранном вами разрешении. Используйте экстрактор, когда хотите вернуть исходные материалы, например чтобы повторно использовать фотографию товара. Используйте PDF в JPG, когда хотите точный снимок страницы такой, какой её видит читатель.
Почему важно делать это локально
Изображения, спрятанные в PDF, часто оказываются самой чувствительной его частью: сканы фото из документов, подписанные страницы, внутренние скриншоты, личные иллюстрации. Отправляя документ в онлайн-экстрактор, вы передаёте всё это серверу, который вам не подконтролен, вместе с текстовым слоем и любыми метаданными. Экстрактор здесь открывает PDF с помощью PDF.js внутри вашего браузера и достаёт графические объекты на вашей машине, поэтому файл и всё, что в нём есть, остаются на вашем устройстве.
Как работает извлечение изображений из PDF
Извлечение изображений из PDF отличается от конвертации страницы в растровый снимок экрана. Внутри файла PDF изображения хранятся как отдельные словари потока /XObject, содержащие необработанные двоичные данные (как правило, в кодировке DCTDecode/JPEG, Flate, JPX или CCITT) вместе с метаданными о размерах и цветовом пространстве. Правильный инструмент извлечения разбирает эти потоки напрямую, извлекая каждое изображение без перекодирования. Поскольку считываются исходные байты, а не выполняется повторный рендеринг, извлечённый файл сохраняет точное разрешение, цветовой профиль и качество, присутствовавшие при первоначальном встраивании изображения. Отсутствие шага перекомпрессии означает отсутствие дополнительной потери качества, независимо от того, сколько раз PDF был пересохранён.
Инструменты из этого гайда
Частые вопросы
Я получу исходные изображения или скриншоты страниц?
Исходные изображения. Этот инструмент возвращает встроенные файлы изображений в том виде, как они хранились в PDF, в их родном разрешении и в оригинальном формате. Если же вам нужна картинка каждой целой страницы, вместе с текстом и вёрсткой, это другая задача: используйте инструмент PDF в JPG, который растрирует всю страницу в выбранном вами разрешении.
Почему он нашёл меньше изображений, чем я ожидал?
PDF содержит встроенные изображения только там, где автор действительно поместил растровые файлы. Векторная графика, диаграммы, нарисованные командами рисования PDF, и текст не являются изображениями, поэтому они не извлекаются. Инструмент также отбрасывает дублирующие копии мягких масок, которые создают некоторые программы экспорта, что может снизить количество. Если страница сама по себе является сканом, она обычно содержит одно полностраничное изображение, которое вы и получите назад.