Không tải lên, 100% cục bộ, không cần tài khoản

Làm cho PDF quét có thể tìm kiếm

Thả một PDF quét vào và nhận lại các trang y nguyên với một lớp văn bản ẩn, có thể tìm kiếm được thêm lên trên. Nhận dạng chạy hoàn toàn trong trình duyệt (trên thiết bị, ngoại tuyến sau lần tải đầu), không có gì được tải lên.

Cách OCR PDF · làm cho có thể tìm kiếm hoạt động

PDF OCR biến một PDF quét, vốn chỉ gồm ảnh trang không có văn bản thật, thành một PDF có thể tìm kiếm: vẫn là những ảnh trang đó, cộng thêm một lớp văn bản vô hình được đặt chồng lên từng từ đã nhận dạng. Mở kết quả trong bất kỳ trình đọc PDF nào và giờ đây bạn có thể dùng Ctrl+F để tìm một từ, chọn và sao chép một đoạn văn, hoặc để công cụ tìm kiếm lập chỉ mục tài liệu, tất cả những điều mà một bản quét thuần túy không làm được. Việc nhận dạng chạy bằng tesseract.js (cùng cơ chế OCR tự lưu trữ được dùng trong công cụ OCR), còn việc render trang chạy bằng pdf.js; cả hai đều thực thi hoàn toàn trong tab trình duyệt của bạn, và tệp của bạn không bao giờ bị tải lên.

Công cụ này trung thực về những gì nó làm được và không làm được. Nó không tái tạo bố cục, bảng biểu hay phông chữ, và đây không phải là công cụ chuyển đổi sang tài liệu có thể chỉnh sửa: trang hiển thị vẫn là một hình ảnh, giống hệt bản quét gốc, với một lớp văn bản ẩn được thêm bên dưới phần hiển thị. Độ chính xác nhận dạng phụ thuộc vào chất lượng bản quét, cùng khuyến nghị 200 DPI trở lên, độ tương phản cao, trang thẳng áp dụng cho mọi công cụ OCR. Nếu bạn chỉ cần văn bản trích xuất thuần túy thay vì một PDF có thể tìm kiếm bên trong, công cụ OCR sẽ tạo ra tệp .txt thay thế và nhanh hơn cho công việc cụ thể đó.

Cách sử dụng OCR PDF · làm cho có thể tìm kiếm, từng bước

  1. Thả PDF đã quét của bạn (mỗi trang là một ảnh, chưa có lớp văn bản) vào khu vực tải lên.
  2. Chọn ngôn ngữ chính của tài liệu từ danh sách ngôn ngữ.
  3. Nếu đây là lần đầu bạn dùng công cụ, hãy đợi engine tesseract.js tải xuống (chỉ xảy ra một lần).
  4. Nhấn chạy và đợi từng trang được render và nhận dạng lần lượt.
  5. Tải xuống PDF có thể tìm kiếm: hình thức giống hệt, nay có thêm lớp văn bản bên dưới.

Trường hợp sử dụng thường gặp

  • Một hợp đồng đã quét cần được tìm kiếm được để tìm một điều khoản cụ thể bằng Ctrl+F thay vì đọc từng trang.
  • Một loạt hóa đơn đã quét cần đưa vào kho lưu trữ tài liệu, nơi chỉ mục tìm kiếm chỉ đọc được văn bản PDF thật.
  • Một biểu mẫu đã chụp hoặc quét cần các nhãn in trở nên có thể chọn được để sao chép một đoạn vào email.
  • Một thư viện báo cáo quét bằng tiếng Đức cần tìm kiếm toàn văn; chọn tiếng Đức làm ngôn ngữ trước khi chạy công cụ.

Câu hỏi thường gặp

Công cụ này khác gì so với công cụ OCR thông thường?

Công cụ OCR trích xuất văn bản thuần túy vào tệp .txt, bỏ hoàn toàn bố cục và hình ảnh gốc. PDF OCR giữ nguyên các ảnh trang PDF gốc y hệt hình thức ban đầu và thêm một lớp văn bản vô hình, có thể tìm kiếm bên dưới. Dùng OCR khi bạn chỉ cần lấy chữ; dùng PDF OCR khi bạn muốn giữ tài liệu ở dạng PDF nhưng làm cho nó có thể tìm kiếm và chọn được.

PDF đầu ra có trông khác với bản quét của tôi không?

Không. Mỗi trang được render từ PDF nguồn của bạn và nhúng lại dưới dạng ảnh, giống hệt từng điểm ảnh với bản quét gốc (trừ hao mã hóa lại JPEG). Các từ nhận dạng được vẽ chồng lên với độ trong suốt bằng 0, nên không có gì mới hiển thị ra; chỉ khi tìm kiếm hoặc chọn văn bản bạn mới nhận ra lớp được thêm vào.

Công cụ có tái tạo bảng biểu, cột hay phông chữ không?

Không. Đầu ra giữ trang dưới dạng một ảnh phẳng duy nhất; lớp văn bản vô hình bám theo vị trí các từ đã nhận dạng nhưng không giữ lại cấu trúc bảng, thứ tự đọc nhiều cột ngoài những gì tesseract.js tự suy luận, hay phông chữ gốc. Đây là một lớp giúp tìm kiếm được, không phải một bước chuyển đổi sang văn bản có thể chỉnh sửa.

Tài liệu quét của tôi có bị gửi đi đâu trong quá trình xử lý không?

Không. Sau khi engine tesseract.js và gói ngôn ngữ được tải xuống từ trang này (chỉ một lần, dung lượng vài megabyte khi dùng lần đầu), mọi lần render trang và mọi lượt nhận dạng đều diễn ra hoàn toàn trong tab trình duyệt của bạn. Hợp đồng đã quét, hồ sơ y tế hay các tài liệu nhạy cảm khác không bao giờ đến máy chủ.

Tại sao một PDF dài lại mất nhiều thời gian xử lý?

Mỗi trang được render thành ảnh và OCR được chạy riêng trên ảnh đó, tất cả bên trong tab trình duyệt của bạn, nên thời gian xử lý tỉ lệ với số trang. Thanh tiến trình phản ánh tiến độ thực theo từng trang, và tệp bị giới hạn ở 80 MB để giữ toàn bộ quy trình trong ngân sách bộ nhớ của một tab trình duyệt.

Nếu PDF của tôi đã có văn bản có thể chọn thì sao?

Chạy OCR trên một PDF đã có sẵn lớp văn bản thật là không cần thiết: mở nó trong trình đọc và nhấn Ctrl+F đã hoạt động rồi. Công cụ này dành cho các PDF chỉ gồm ảnh trang không có văn bản bên dưới, kết quả phổ biến từ máy quét phẳng hoặc thao tác "in ra PDF" từ một tài liệu đã chụp ảnh.