Без завантаження, 100% локально, без облікового запису

Інструкція

Як витягнути вбудовані зображення з PDF

Під витягуванням зображень з PDF люди розуміють дві різні речі, і для них потрібні різні інструменти. Цей посібник про те, як дістати оригінальні файли зображень, що були вкладені в документ: фотографії, які дизайнер вставив у брошуру, логотип у звіті, скани всередині договору. Це не те саме, що перетворити кожну сторінку на картинку. Якщо вам потрібен знімок того, як виглядає ціла сторінка разом з її текстом і розташуванням, скористайтеся натомість інструментом PDF до JPG. Тутешній екстрактор зчитує растрові обʼєкти, збережені у PDF, і повертає вам самі вихідні зображення в оригінальній роздільній здатності, повністю у вашому браузері.

Крок за кроком

  1. Відкрийте екстрактор зображень PDF і перетягніть туди свій файл. Інструмент зчитує документ локально й показує, скільки вбудованих зображень він знайшов. Нічого нікуди не надсилається: розбір відбувається у вкладці браузера на вашому власному пристрої.
    Екстрактор зображень PDF із завантаженим документом, що показує кількість знайдених вбудованих зображень
  2. Дайте йому просканувати обʼєкти вбудованих зображень. Він проходить кожну сторінку, збирає кожен знайдений растр і видаляє дублікати копій маски прозорості, щоб ви не отримали дві версії однієї картинки. Тут немає налаштувань сторінки чи формату для вибору: мета полягає в тому, щоб повернути оригінали точно такими, якими вони були збережені, а не перекодувати їх.
  3. Завантажте результати. Одне зображення повертається як один файл; кілька зображень пропонуються як окремі завантаження, названі й впорядковані так, щоб зберігати послідовність. Кожен файл зберігає формат, який мав усередині PDF, зазвичай JPEG для фото та PNG для графіки з прозорістю.
    Витягнуті зображення, готові до завантаження, по одному файлу на зображення

Вбудовані зображення проти сторінок, перетворених на картинки

Саме ця відмінність вирішує, який інструмент вам потрібен. Вбудоване зображення, це фото чи графіка, яку автор розмістив усередині PDF; цей екстрактор повертає той файл таким, яким він був збережений, у його справжньому розмірі в пікселях, без нічого домальованого навколо. Рендеринг сторінки в картинку, це протилежне: PDF до JPG промальовує все на сторінці (текст, векторні фігури, фони та вбудовані зображення разом) в один плаский растр у роздільній здатності, яку ви обираєте. Користуйтеся екстрактором, коли хочете повернути вихідні матеріали, наприклад, щоб повторно використати фото товару. Користуйтеся PDF до JPG, коли хочете точний знімок сторінки такою, якою її бачить читач.

Чому важливо робити це локально

Зображення, заховані в PDF, часто є найчутливішою його частиною: скановані фото з документів, підписані сторінки, внутрішні знімки екрана, приватні ілюстрації. Надсилання документа онлайн-екстрактору передає все це серверу, який ви не контролюєте, разом із текстовим шаром і будь-якими метаданими. Тутешній екстрактор відкриває PDF за допомогою PDF.js усередині вашого браузера й дістає обʼєкти зображень на вашій машині, тож файл і все, що в ньому, залишаються на вашому пристрої.

Як працює витягнення зображень з PDF

Витягнення зображень з PDF відрізняється від конвертування сторінки у растровий знімок екрана. Усередині файлу PDF зображення зберігаються як окремі словники потоків /XObject, що містять необроблені двійкові дані (зазвичай у кодуванні DCTDecode/JPEG, Flate, JPX або CCITT) разом із метаданими розмірів і колірного простору. Правильний інструмент витягнення безпосередньо аналізує ці потоки, витягуючи кожне зображення без повторного кодування. Оскільки читаються необроблені байти, а не повторно рендеряться, витягнутий файл зберігає точну роздільну здатність, кольоровий профіль і якість, що були наявні під час першого вбудовування зображення. Відсутність повторного стиснення означає відсутність додаткових втрат якості, незалежно від того, скільки разів сам PDF був повторно збережений.

Інструменти з цього гайда

Поширені запитання

Я отримаю оригінальні зображення чи знімки сторінок?

Оригінальні зображення. Цей інструмент повертає вбудовані файли зображень такими, якими вони були збережені у PDF, у їхній рідній роздільній здатності та оригінальному форматі. Якщо ж вам потрібна картинка кожної повної сторінки разом із текстом і розташуванням, це інше завдання: скористайтеся інструментом PDF до JPG, який растеризує всю сторінку в роздільній здатності, яку ви обираєте.

Чому він знайшов менше зображень, ніж я очікував?

PDF містить вбудовані зображення лише там, де автор справді розмістив растрові файли. Векторна графіка, діаграми, намальовані командами малювання PDF, і текст не є зображеннями, тож вони не витягуються. Інструмент також відкидає дублікати копій маски прозорості, які створюють деякі експорти, що може зменшити кількість. Якщо сторінка сама є сканом, вона зазвичай містить одне повносторінкове зображення, саме його ви й отримаєте.