Tutorial
Cara mengekstrak imej tertanam daripada PDF
Ada dua perkara berbeza yang orang maksudkan apabila menyebut mengekstrak imej daripada PDF, dan kedua-duanya memerlukan alat yang berbeza. Panduan ini merangkumi cara mengeluarkan fail imej asal yang diletakkan di dalam dokumen: foto yang dimasukkan pereka ke dalam brosur, logo dalam laporan, imbasan di dalam kontrak. Itu bukan perkara yang sama dengan menukar setiap halaman menjadi gambar. Jika anda mahukan petikan rupa keseluruhan halaman, termasuk teks dan susun aturnya, gunakan alat PDF ke JPG sebaliknya. Pengekstrak di sini membaca objek raster yang disimpan dalam PDF dan memulangkan imej sumber itu sendiri, pada resolusi asalnya, semuanya dalam pelayar anda.
Langkah demi langkah
- Buka pengekstrak imej PDF dan letakkan fail anda. Alat ini membaca dokumen secara setempat dan menyenaraikan berapa banyak imej tertanam yang ditemuinya. Tiada apa-apa dihantar ke mana-mana: penghuraian berlaku dalam tab pelayar pada peranti anda sendiri.

- Biarkan ia mengimbas objek imej tertanam. Ia menyusuri setiap halaman, mengumpul setiap raster yang ditemui, dan membuang salinan topeng lembut (soft-mask) pendua supaya anda tidak berakhir dengan dua versi gambar yang sama. Tiada tetapan halaman atau format untuk dipilih: matlamatnya adalah memulangkan imej asal tepat seperti yang disimpan, bukan mengekod semula.
- Muat turun hasilnya. Satu imej dipulangkan sebagai satu fail; beberapa imej ditawarkan sebagai muat turun berasingan, dinamakan dan disusun supaya kekal tersusun. Setiap fail mengekalkan format yang dimilikinya di dalam PDF, lazimnya JPEG untuk foto dan PNG untuk grafik dengan ketelusan.

Imej tertanam berbanding halaman yang ditukar menjadi gambar
Inilah perbezaan yang menentukan alat mana yang anda perlukan. Imej tertanam ialah foto atau grafik yang diletakkan oleh pengarang di dalam PDF; pengekstrak ini memulangkan fail itu seperti yang disimpan, pada saiz piksel sebenarnya, tanpa apa-apa dilukis di sekelilingnya. Memaparkan halaman menjadi gambar pula adalah sebaliknya: PDF ke JPG melukis segala-galanya pada halaman (teks, bentuk vektor, latar belakang dan imej tertanam sekali) menjadi satu raster rata pada resolusi yang anda pilih. Gunakan pengekstrak apabila anda mahu aset sumber dipulangkan, contohnya untuk menggunakan semula foto produk. Gunakan PDF ke JPG apabila anda mahukan petikan halaman yang setia seperti yang dilihat pembaca.
Mengapa melakukannya secara setempat itu penting
Imej yang tertanam dalam PDF selalunya bahagian yang paling sensitif: foto kad pengenalan yang diimbas, halaman bertandatangan, tangkapan skrin dalaman, karya seni peribadi. Menghantar dokumen ke pengekstrak dalam talian menyerahkan semua itu kepada pelayan yang tidak anda kawal, bersama lapisan teks dan sebarang metadata. Pengekstrak di sini membuka PDF dengan PDF.js di dalam pelayar anda dan mengeluarkan objek imej pada mesin anda, jadi fail itu dan segala isinya kekal pada peranti anda.
Cara pengekstrakan imej PDF berfungsi
Mengekstrak imej daripada PDF berbeza daripada menukar halaman kepada tangkap layar raster. Di dalam fail PDF, imej disimpan sebagai kamus aliran /XObject berasingan yang mengandungi data binari mentah (biasanya pengekodan DCTDecode/JPEG, Flate, JPX, atau CCITT) bersama metadata untuk dimensi dan ruang warna. Alat pengekstrakan yang betul menghurai aliran ini secara langsung, mengeluarkan setiap imej tanpa mengenkodnya semula. Kerana bait mentah dibaca berbanding dipapar semula, fail yang diekstrak mengekalkan resolusi, profil warna, dan kualiti tepat yang ada ketika imej mula-mula ditanam. Tiada langkah pemampatan semula bermakna tiada kehilangan kualiti tambahan, tanpa mengira berapa kali PDF itu sendiri disimpan semula.
Alat yang digunakan dalam panduan ini
Soalan lazim
Adakah saya mendapat imej asal atau tangkapan skrin halaman?
Imej asal. Alat ini memulangkan fail imej tertanam seperti yang disimpan dalam PDF, pada resolusi asli dan dalam format asalnya. Jika sebaliknya anda mahukan gambar setiap halaman penuh, termasuk teks dan susun aturnya, itu tugas yang berbeza: gunakan alat PDF ke JPG, yang meraster keseluruhan halaman pada resolusi yang anda pilih.
Mengapa ia menemui lebih sedikit imej daripada yang saya jangkakan?
Sesebuah PDF hanya mengandungi imej tertanam di tempat pengarang benar-benar meletakkan fail raster. Grafik vektor, carta yang dilukis dengan arahan lukisan PDF, dan teks bukan imej, jadi ia tidak diekstrak. Alat ini juga membuang salinan topeng lembut pendua yang dihasilkan oleh sesetengah eksport, yang boleh merendahkan kiraan. Jika sesuatu halaman itu sendiri ialah imbasan, ia biasanya memuatkan satu imej selebar halaman, dan itulah yang akan anda peroleh semula.