Không tải lên, 100% cục bộ, không cần tài khoản

Hướng dẫn cách làm

Cách trích xuất hình ảnh nhúng từ một PDF

Có hai việc khác nhau mà mọi người thường gọi là trích xuất hình ảnh từ PDF, và chúng cần những công cụ khác nhau. Hướng dẫn này nói về việc lấy ra các file ảnh gốc đã được đặt vào bên trong tài liệu: bức ảnh mà người thiết kế thả vào tờ rơi, logo trong một báo cáo, các bản quét nằm trong một hợp đồng. Việc đó không giống với việc biến mỗi trang thành một bức tranh. Nếu bạn muốn một ảnh chụp cách cả trang hiển thị, bao gồm cả văn bản và bố cục, hãy dùng công cụ PDF sang JPG. Trình trích xuất ở đây đọc các đối tượng raster lưu trong PDF và trả lại cho bạn chính những ảnh nguồn đó, ở độ phân giải gốc, hoàn toàn trong trình duyệt.

Từng bước

  1. Mở trình trích xuất hình ảnh PDF và thả file của bạn vào. Công cụ đọc tài liệu ngay trên máy và liệt kê số lượng hình ảnh nhúng mà nó tìm thấy. Không có gì được gửi đi đâu cả: việc phân tích diễn ra ngay trong tab trình duyệt trên thiết bị của bạn.
    Trình trích xuất hình ảnh PDF với một tài liệu đã nạp, hiển thị số lượng hình ảnh nhúng tìm thấy
  2. Để nó quét các đối tượng hình ảnh nhúng. Nó duyệt qua từng trang, thu thập mỗi raster tìm thấy, và loại bỏ các bản sao soft-mask trùng lặp để bạn không nhận về hai phiên bản của cùng một bức ảnh. Không có thiết lập trang hay định dạng nào để chọn: mục tiêu là trả lại bản gốc đúng như cách chúng được lưu, chứ không phải mã hóa lại chúng.
  3. Tải kết quả về. Một hình ảnh duy nhất sẽ trả về dưới dạng một file; nhiều hình ảnh được cung cấp dưới dạng các lượt tải riêng lẻ, được đặt tên và sắp xếp để giữ đúng thứ tự. Mỗi file giữ nguyên định dạng mà nó có bên trong PDF, thường là JPEG cho ảnh chụp và PNG cho đồ họa có nền trong suốt.
    Các hình ảnh đã trích xuất sẵn sàng tải về, mỗi file một ảnh

Hình ảnh nhúng so với các trang biến thành ảnh

Đây chính là điểm khác biệt quyết định bạn cần công cụ nào. Một hình ảnh nhúng là bức ảnh hay đồ họa mà tác giả đã đặt vào bên trong PDF; trình trích xuất này trả lại file đó đúng như cách nó được lưu, ở kích thước pixel thật, không có gì vẽ thêm xung quanh. Kết xuất một trang thành ảnh thì ngược lại: PDF sang JPG vẽ mọi thứ trên trang (văn bản, hình vector, nền và cả các hình ảnh nhúng) vào một raster phẳng duy nhất ở độ phân giải bạn chọn. Hãy dùng trình trích xuất khi bạn muốn lấy lại tài nguyên nguồn, ví dụ để tái sử dụng một bức ảnh sản phẩm. Hãy dùng PDF sang JPG khi bạn muốn một ảnh chụp trung thực của trang giống như người đọc nhìn thấy.

Vì sao làm việc này ngay trên máy lại quan trọng

Những hình ảnh chôn sâu trong một PDF thường là phần nhạy cảm nhất của nó: ảnh chụp giấy tờ tùy thân đã quét, các trang đã ký, ảnh chụp màn hình nội bộ, tác phẩm nghệ thuật riêng tư. Gửi tài liệu đến một trình trích xuất trực tuyến nghĩa là trao toàn bộ những thứ đó cho một máy chủ mà bạn không kiểm soát, cùng với lớp văn bản và mọi siêu dữ liệu. Trình trích xuất ở đây mở PDF bằng PDF.js ngay trong trình duyệt của bạn và lấy các đối tượng hình ảnh ra ngay trên máy bạn, nên file và mọi thứ bên trong nó luôn ở lại trên thiết bị của bạn.

Cách trích xuất hình ảnh PDF hoạt động

Trích xuất hình ảnh từ PDF khác với việc chuyển đổi trang thành ảnh chụp màn hình raster. Bên trong tệp PDF, hình ảnh được lưu trữ như các từ điển luồng /XObject riêng biệt chứa dữ liệu nhị phân thô (thường ở định dạng mã hóa DCTDecode/JPEG, Flate, JPX hoặc CCITT) cùng với metadata về kích thước và không gian màu. Công cụ trích xuất phù hợp phân tích các luồng này trực tiếp, kéo từng hình ảnh ra mà không mã hóa lại. Vì byte thô được đọc thay vì render lại, tệp được trích xuất giữ nguyên độ phân giải, hồ sơ màu và chất lượng hiện diện khi hình ảnh được nhúng lần đầu. Không có bước nén lại có nghĩa là không mất chất lượng thêm, bất kể PDF đã được lưu lại bao nhiêu lần.

Các công cụ dùng trong hướng dẫn này

Câu hỏi thường gặp

Tôi sẽ nhận được ảnh gốc hay ảnh chụp các trang?

Ảnh gốc. Công cụ này trả lại các file hình ảnh nhúng đúng như cách chúng được lưu trong PDF, ở độ phân giải gốc và định dạng gốc. Nếu thay vào đó bạn muốn một bức ảnh của mỗi trang đầy đủ, bao gồm cả văn bản và bố cục, thì đó là một việc khác: hãy dùng công cụ PDF sang JPG, công cụ này raster hóa cả trang ở độ phân giải bạn chọn.

Vì sao nó tìm thấy ít hình ảnh hơn tôi tưởng?

Một PDF chỉ chứa hình ảnh nhúng ở những nơi mà tác giả thực sự đặt các file raster vào. Đồ họa vector, biểu đồ vẽ bằng lệnh vẽ của PDF, và văn bản không phải là hình ảnh, nên chúng không được trích xuất. Công cụ cũng bỏ đi các bản sao soft-mask trùng lặp mà một số bản xuất tạo ra, điều này có thể làm giảm số lượng. Nếu bản thân một trang là một bản quét, nó thường chứa một hình ảnh chiếm trọn trang, và đó là thứ bạn sẽ nhận lại.