Không tải lên, 100% cục bộ, không cần tài khoản

Hướng dẫn cách làm

Làm cho PDF quét có thể tìm kiếm

Một PDF quét trông như một tài liệu bình thường nhưng thực chất là một bức ảnh của trang: Ctrl+F không tìm thấy gì, và bạn không thể chọn hay sao chép một từ nào. Công cụ OCR PDF khắc phục điều này mà không đổi bản chất của tệp. Nó đọc ảnh mỗi trang, nhận dạng ký tự bằng một engine OCR trên thiết bị, và đặt văn bản nhận dạng được một cách vô hình lên trên cùng ảnh đó, nên PDF vẫn trông và in y hệt như trước nhưng giờ phản hồi với tìm kiếm và chọn văn bản. Tệp không bao giờ rời khỏi thiết bị của bạn.

Từng bước

  1. Mở công cụ OCR PDF và thả PDF quét của bạn vào. Chỉ tệp PDF được chấp nhận, và tệp giới hạn ở 80 MB; một bản quét nhiều trang thông thường thấp hơn nhiều so với mức đó.
  2. Chọn ngôn ngữ tài liệu từ danh sách thả xuống (tiếng Anh, Pháp, Đức, Tây Ban Nha, Bồ Đào Nha hoặc Ý) và, nếu muốn, sửa tên tệp đầu ra. Mặc định tự giữ phần mở rộng .pdf.
  3. Bấm Chạy và chờ mọi trang được xử lý. Mỗi trang được dựng hình, chạy qua engine OCR và được gán lớp văn bản ẩn riêng trước khi công cụ chuyển sang trang tiếp theo, nên một tài liệu dài mất nhiều thời gian hơn một trang đơn. Tải kết quả về: nó mở và in giống hệt bản gốc, nhưng Ctrl+F, chọn văn bản và sao chép-dán giờ hoạt động.

PDF có thể tìm kiếm hay văn bản thuần: bạn thực sự cần cái nào

Công cụ này và công cụ OCR thuần giải quyết cùng một vấn đề cốt lõi, nhận dạng văn bản trong ảnh quét, nhưng giữ lại những thứ khác nhau. Công cụ OCR bỏ ảnh trang và trả về một tệp .txt thuần: dùng nó khi bạn muốn dán từ ngữ vào một trình soạn thảo, dịch chúng hoặc tìm kiếm chúng dưới dạng văn bản, và không quan tâm việc giữ nguyên hình thức gốc của tài liệu. Công cụ OCR PDF ở đây giữ nguyên PDF gốc y hệt, cả ảnh trang, và chỉ thêm một lớp văn bản ẩn bên dưới: dùng nó khi tài liệu cần vẫn là một PDF bạn có thể in, gửi email hay lưu trữ, nhưng cũng muốn tìm kiếm hoặc sao chép từ nó. Không công cụ nào dựng lại bố cục thành văn bản có thể chỉnh sửa với phông chữ và bảng biểu thật; cả hai đều làm việc từ cùng văn bản nhận dạng, chỉ đóng gói khác nhau.

Tại sao kết quả phụ thuộc vào bản quét, và giới hạn nằm ở đâu

Độ chính xác nhận dạng đi theo chất lượng ảnh nguồn, giống như với OCR thuần: một bản quét sạch, thẳng khoảng 200 đến 300 DPI nhận dạng đáng tin cậy, trong khi một bức ảnh mờ, một trang nghiêng hay bóng đổ nặng tạo ra nhiều từ đọc sai hơn. Nếu một trang ra bị lệch, hãy làm thẳng nó bằng công cụ Chỉnh thẳng trang quét trước khi chạy OCR để bước nhận dạng đọc văn bản ngay ngắn. Công cụ hỗ trợ sáu ngôn ngữ (Anh, Pháp, Đức, Tây Ban Nha, Bồ Đào Nha, Ý); một tài liệu bằng ngôn ngữ không được hỗ trợ sẽ không nhận dạng đúng. Xử lý diễn ra từng trang trong tab trình duyệt của bạn, nên một tài liệu hàng chục trang mất nhiều thời gian hơn đáng kể so với một bản quét hai trang, và tệp giới hạn ở 80 MB. PDF đầu ra cũng có xu hướng dung lượng tương tự bản gốc, vì bản thân ảnh trang không bị động tới; nếu sau đó cần tệp nhỏ hơn, hãy chạy nó qua công cụ nén PDF.

Lớp văn bản ẩn được dựng ra sao

Mỗi trang PDF trước tiên được số hóa thành ảnh canvas trong trình duyệt của bạn, cùng bước dựng hình mà công cụ PDF sang ảnh sử dụng. Engine OCR (Tesseract, biên dịch sang WebAssembly) đọc ảnh đó và trả về mọi từ nhận dạng được cùng khung bao quanh nó, vị trí của nó trên trang. Các từ đó sau đó được vẽ lại lên một bản sao của trang PDF gốc tại vị trí nhận dạng được, nhưng ở độ mờ bằng không, nên không gì thay đổi về mặt hình ảnh: ảnh trang bạn thấy và in là ảnh đã quét, nằm trên cùng. Tính năng tìm kiếm và chọn văn bản của trình xem PDF chỉ nhìn vào lớp văn bản ẩn đó, đó là lý do tệp trở nên có thể tìm kiếm và chọn được mà không trông khác đi. Tất cả điều này, dựng hình, nhận dạng và lắp ráp lại, diễn ra trong tab trình duyệt của bạn; PDF được đọc từ đĩa cục bộ và không bao giờ được truyền đi đâu.

Các công cụ dùng trong hướng dẫn này

Câu hỏi thường gặp

PDF có thể tìm kiếm có còn trông và in y hệt bản quét gốc không?

Có. Công cụ không bao giờ sửa ảnh trang; nó chỉ thêm một lớp văn bản ẩn bên dưới. Trên màn hình và trên giấy, đầu ra giống hệt về mặt hình ảnh với bản quét bạn thả vào. Điều thay đổi là công cụ tìm kiếm và chọn văn bản của trình xem giờ có thể tìm và lấy được các từ nhận dạng được, vì chúng đọc từ lớp ẩn đó.

Tại sao công cụ này tồn tại song song với công cụ OCR thuần?

Chúng đáp ứng những nhu cầu khác nhau từ cùng bước nhận dạng. Công cụ OCR cho bạn một tệp văn bản thuần, đó là điều bạn muốn nếu định dán, sửa hoặc dịch các từ và không cần giữ tài liệu ở dạng PDF. Công cụ này giữ tệp ở dạng PDF với ảnh trang gốc nguyên vẹn, đó là điều bạn muốn nếu tài liệu vẫn cần được in, lưu trữ hay gửi email nguyên trạng, nhưng bạn cũng muốn có thể tìm kiếm hoặc sao chép văn bản từ nó.

Nguồn