Không tải lên, 100% cục bộ, không cần tài khoản

Bài viết

Tại sao tô đen văn bản trong PDF thường thất bại

Một hình chữ nhật đen vẽ lên một đoạn văn trông như thể văn bản đã biến mất, nhưng trong hầu hết trình chỉnh sửa PDF thì không. Các chữ cái bạn che vẫn được lưu trong tệp dưới dạng ký tự có thể chọn; ô đen chỉ là một hình dạng mới nằm trên chúng. Sao chép trang, tìm kiếm nó, hay mở nó trong một trình xem khác, và câu "đã che" có thể xuất hiện trở lại. Đây là lý do điều đó xảy ra, và một phương pháp che thông tin thực sự loại bỏ văn bản thay vì chỉ giấu nó.

Một hình dạng nằm trên không phải là xóa

Một trang PDF giữ hai thứ tách biệt: các đối tượng văn bản, mỗi cái là một ký tự với vị trí và phông chữ, và các đối tượng vẽ đặt trên trang, bao gồm bất kỳ hình chữ nhật, tô sáng hay chú thích nào bạn thêm vào. Khi bạn vẽ một ô đen trong trình xem PDF, bạn đang thêm một đối tượng vẽ mới lên trên các đối tượng văn bản có sẵn. Trang giờ trông như đã bị che vì ô đen che khuất các chữ cái về mặt thị giác. Không gì báo cho tệp xóa các đối tượng văn bản bên dưới, nên chúng vẫn ở nguyên vị trí cũ, với nội dung cũ.

Sơ đồ một trang PDF chia thành hai lớp: các đối tượng văn bản bên dưới và một ô hình dạng vẽ đặt lên trên, che khuất về mặt thị giác nhưng không xóa các ký tự

Cách văn bản gốc trồi lên trở lại

Vì các đối tượng văn bản chưa bao giờ rời khỏi tệp, bốn hành động thông thường có thể lộ chúng ra: chọn và sao chép dòng "đã che", chạy tìm kiếm văn bản trên toàn tài liệu, trích xuất văn bản thô bằng bất kỳ công cụ PDF sang văn bản nào, hoặc mở tệp trong một trình xem hiển thị đối tượng văn bản lên trên đối tượng vẽ theo thứ tự khác. Không hành động nào trong số này đòi hỏi kỹ năng đặc biệt. Điều này đã xảy ra công khai nhiều hơn một lần: các PDF được công bố với ô đen che các đoạn nhạy cảm hóa ra vẫn chứa văn bản có thể đọc và sao chép được bên dưới, và sai lầm đó đã lên tin tức thay vì được giữ kín.

Biến trang thành ảnh trước

Cách khắc phục là loại bỏ lớp văn bản trước khi bạn che, không phải sau. Chuyển trang PDF thành ảnh thuần bằng một công cụ như PDF sang ảnh, rồi vẽ lên vùng nhạy cảm trên ảnh đó bằng Che vùng ảnh. Lúc đó không còn đối tượng văn bản nào trên trang, chỉ có pixel, nên ô đen không nằm trên bất cứ gì có thể khôi phục. Lắp ráp lại các ảnh đã che thành PDF bằng Ảnh sang PDF và văn bản từng nhạy cảm đơn giản là không còn tồn tại nữa, chỉ còn một bức ảnh của một trang với một phần bị che.

Sơ đồ quy trình: một trang PDF được chuyển thành ảnh, che bằng một ô đục trên pixel, rồi lắp ráp lại thành một PDF mới không còn văn bản nào có thể khôi phục bên dưới

Cái giá phải trả

Số hóa một trang biến văn bản thật, có thể tìm kiếm thành một bức ảnh tĩnh, nên bất kỳ ai đọc trang đã che sau đó không thể chọn hay tìm kiếm văn bản của trang đó nữa, dù đã che hay chưa. Đó là một sự đánh đổi chấp nhận được cho trang bạn đang bảo vệ: giải pháp thay thế, giữ nguyên lớp văn bản và hy vọng không ai kiểm tra, chính là sai lầm mà bài viết này bắt đầu. Nếu các trang khác trong cùng tài liệu không mang nội dung nhạy cảm, bạn có thể để chúng nguyên vẹn và chỉ số hóa những trang cần thiết.

Dùng một ô đặc, và kiểm tra cả siêu dữ liệu

Với văn bản, một ô đen hoặc màu đặc hoàn toàn là lựa chọn an toàn hơn; một bộ lọc làm mờ đôi khi có thể bị đảo ngược với văn bản thuần lớn nếu độ mờ nhẹ, nên nó phù hợp hơn cho khuôn mặt hay ảnh so với câu chữ. Che trang hiển thị cũng không động tới siêu dữ liệu của tệp: tên tác giả, phiên bản phần mềm, tọa độ GPS trên ảnh nhúng, hay lịch sử chỉnh sửa có thể rò rỉ riêng biệt khỏi nội dung trang. Nếu điều đó quan trọng với tài liệu của bạn, hãy kiểm tra siêu dữ liệu riêng của tệp tiết lộ gì trước khi chia sẻ nó.

Công cụ trong bài viết này

Câu hỏi thường gặp

Vẽ một hình chữ nhật đen trong trình xem PDF có thực sự xóa văn bản bên dưới không?

Thường là không. Trừ khi công cụ có một tính năng che thông tin chuyên dụng loại bỏ các đối tượng văn bản bên dưới, vẽ một hình dạng chỉ thêm một lớp lên trên trang. Các ký tự gốc vẫn còn trong tệp và có thể được chọn, tìm kiếm hoặc trích xuất bằng các công cụ thông thường.

Làm mờ văn bản nhạy cảm có an toàn hơn che nó bằng một ô đen không?

Với văn bản thì không. Một độ mờ nhẹ áp dụng cho văn bản thuần lớn đôi khi có thể bị đảo ngược đủ tốt để đoán các ký tự gốc, đặc biệt với từ ngắn hay số. Một ô đặc, hoàn toàn không trong suốt, hoặc loại bỏ hoàn toàn lớp văn bản bằng cách số hóa trước, là lựa chọn an toàn hơn cho văn bản; làm mờ phù hợp hơn cho khuôn mặt hay nội dung ảnh nói chung.

Chuyển PDF thành ảnh trước khi che có làm mất gì quan trọng không?

Nó làm mất khả năng chọn hay tìm kiếm văn bản trên các trang bạn chuyển đổi, vì chúng trở thành ảnh thuần. Với một trang bạn đang chủ động che, đó chính là mục đích: văn bản nhạy cảm không còn tồn tại dưới dạng ký tự có thể trích xuất nữa. Các trang không mang nội dung nhạy cảm có thể vẫn ở dạng trang PDF thông thường nếu bạn chỉ số hóa những trang cần thiết.