Без качване, 100% локално, без акаунт

Урок

Как да извлечете вградените изображения от PDF

Под извличане на изображения от PDF хората разбират две различни неща, които изискват различни инструменти. Това ръководство обхваща изваждането на оригиналните файлове с изображения, поставени в документа: снимките, които дизайнер е сложил в брошура, логото в отчет, сканираните страници в договор. Това не е същото като превръщането на всяка страница в картина. Ако искате моментна снимка на това как изглежда цяла страница, включително текста и оформлението ѝ, използвайте инструмента PDF към JPG. Извличащият тук чете растерните обекти, съхранени в PDF, и ви връща самите изходни изображения в оригиналната им резолюция, изцяло в браузъра.

Стъпка по стъпка

  1. Отворете извличащия изображения от PDF и пуснете файла си вътре. Инструментът чете документа локално и показва колко вградени изображения е намерил. Нищо не се изпраща никъде: разчитането се случва в раздела на браузъра на вашето собствено устройство.
    Извличащият изображения от PDF със зареден документ, показващ броя на намерените вградени изображения
  2. Оставете го да сканира вградените обекти с изображения. Той обхожда всяка страница, събира всеки растер, който намери, и премахва дублиращите се копия на меки маски, така че да не получите две версии на една и съща картина. Няма настройки за страница или формат за избор: целта е да върне оригиналите точно както са били съхранени, а не да ги прекодира.
  3. Изтеглете резултатите. Едно изображение се връща като отделен файл; няколко изображения се предлагат като отделни изтегляния, наименувани и подредени, така че да останат в правилния ред. Всеки файл запазва формата, който е имал в PDF, обикновено JPEG за снимки и PNG за графики с прозрачност.
    Извлечените изображения, готови за изтегляне, по един файл на изображение

Вградени изображения срещу страници, превърнати в картини

Това е разликата, която решава кой инструмент ви трябва. Вграденото изображение е снимка или графика, която авторът е поставил в PDF; този извличащ връща файла такъв, какъвто е бил съхранен, в реалния му пикселен размер, без нищо нарисувано около него. Изобразяването на страница като картина е обратното: PDF към JPG рисува всичко на страницата (текст, векторни форми, фонове и вградените изображения заедно) в един плосък растер при резолюция по ваш избор. Използвайте извличащия, когато искате обратно изходните ресурси, например за да преизползвате снимка на продукт. Използвайте PDF към JPG, когато искате точна моментна снимка на страницата, както я вижда читателят.

Защо е важно това да се прави локално

Изображенията, скрити в PDF, често са най-чувствителната му част: сканирани снимки от документи за самоличност, подписани страници, вътрешни екранни снимки, частни произведения. Изпращането на документа към онлайн извличащ предава всичко това на сървър, който не контролирате, заедно с текстовия слой и всякакви метаданни. Извличащият тук отваря PDF с PDF.js в браузъра ви и изважда обектите с изображения на вашата машина, така че файлът и всичко в него остават на устройството ви.

Как работи извличането на изображения от PDF

Извличането на изображения от PDF се различава от конвертирането на страница в растерна снимка. Вътре в PDF файл изображенията се съхраняват като отделни /XObject речникови потоци, съдържащи сурови двоични данни (обикновено с кодиране DCTDecode/JPEG, Flate, JPX или CCITT) заедно с метаданни за размерите и цветовото пространство. Правилният инструмент за извличане анализира тези потоци директно, изваждайки всяко изображение без прекодиране. Тъй като суровите байтове се четат, а не се преизобразяват, извлеченият файл запазва точните резолюция, цветен профил и качество, присъстващи при първото вграждане на изображението. Липсата на стъпка за повторна компресия означава никаква допълнителна загуба на качество, независимо колко пъти е бил презаписван самият PDF.

Инструментите, използвани в това ръководство

Често задавани въпроси

Ще получа ли оригиналните изображения или екранни снимки на страниците?

Оригиналните изображения. Този инструмент връща вградените файлове с изображения такива, каквито са били съхранени в PDF, в естествената им резолюция и в оригиналния им формат. Ако вместо това искате картина на всяка цяла страница, включително текста и оформлението, това е различна задача: използвайте инструмента PDF към JPG, който растеризира цялата страница при резолюция по ваш избор.

Защо намери по-малко изображения, отколкото очаквах?

PDF съдържа вградени изображения само там, където авторът действително е поставил растерни файлове. Векторните графики, диаграмите, нарисувани с команди за чертане в PDF, и текстът не са изображения, така че не се извличат. Инструментът също отхвърля дублиращите се копия на меки маски, които някои експортирания създават, което може да намали броя. Ако дадена страница сама по себе си е сканирана, тя обикновено съдържа едно изображение на цяла страница, което е това, което ще получите обратно.