Không tải lên, 100% cục bộ, không cần tài khoản

OCR, trích xuất văn bản từ hình ảnh & PDF

Thả một hình ảnh hoặc PDF và nhận văn bản được nhận dạng. OCR chạy hoàn toàn trong trình duyệt (trên thiết bị, ngoại tuyến sau lần tải đầu), không có gì được tải lên.

Cách OCR · hình ảnh/PDF sang văn bản hoạt động

OCR chuyển đổi hình ảnh đã quét hoặc PDF dựa trên hình ảnh thành văn bản bạn có thể sao chép, tìm kiếm và chỉnh sửa, bằng cách dùng tesseract.js chạy hoàn toàn bên trong trình duyệt của bạn. Bạn chọn ngôn ngữ tài liệu từ bộ chọn, mô hình ngôn ngữ liên quan tải xuống trình duyệt một lần, và tất cả nhận dạng tiếp theo chạy ngoại tuyến từ mô hình đã được lưu vào bộ nhớ đệm đó. Các tệp đã quét của bạn không bao giờ được truyền đến bất kỳ máy chủ nào trong quá trình chuyển đổi.

Độ chính xác nhận dạng phụ thuộc mạnh vào chất lượng bản quét. Các bản quét sạch, độ tương phản cao ở 200 DPI trở lên, với ít nhiễu nền và căn chỉnh trang thẳng, cho kết quả tốt nhất. Ảnh JPEG mờ, độ phân giải thấp hoặc nén nhiều, các trang có cột hoặc bố cục phức tạp, và văn bản viết tay đều giảm độ chính xác. Công cụ xuất ra một khối văn bản thuần; để có đầu ra có cấu trúc như bảng hoặc bố cục nhiều cột được bảo toàn, cần xử lý hậu kỳ. Chạy công cụ PDF Deskew trên các bản quét lệch trước OCR thường cải thiện tỷ lệ nhận dạng.

Cách sử dụng OCR · hình ảnh/PDF sang văn bản, từng bước

  1. Kéo thả hình ảnh đã quét (PNG, JPG, TIFF) hoặc PDF dựa trên hình ảnh vào vùng tải lên.
  2. Chọn ngôn ngữ chính của tài liệu từ danh sách thả xuống ngôn ngữ.
  3. Nếu đây là lần đầu tiên bạn dùng ngôn ngữ đó, hãy chờ mô hình ngôn ngữ tải xuống (điều này xảy ra một lần).
  4. Nhấn trích xuất văn bản và chờ tesseract.js xử lý từng trang.
  5. Sao chép văn bản đã nhận dạng hoặc tải xuống dưới dạng tệp văn bản thuần.

Trường hợp sử dụng thường gặp

  • Một biên lai đã quét cần trích xuất các mục hàng vào bảng tính; chạy OCR để lấy văn bản, rồi dán vào phần mềm kế toán của bạn.
  • Một kho bài báo tạp chí đã quét cần được tìm kiếm được theo văn bản; chuyển đổi mỗi bài sang văn bản bằng OCR để lập chỉ mục.
  • Bảng trắng được chụp ảnh từ một cuộc họp chứa các ghi chú cần chuyển thành tài liệu có thể chỉnh sửa.
  • Một tài liệu lịch sử đã quét bằng tiếng Đức cần trích xuất văn bản để dịch; chọn tiếng Đức là ngôn ngữ trước khi chạy OCR.

Câu hỏi thường gặp

Tại sao tôi cần tải xuống mô hình ngôn ngữ trước khi OCR hoạt động?

tesseract.js dùng các tệp dữ liệu mạng nơ-ron đã được huấn luyện dành riêng cho từng ngôn ngữ. Các tệp này có kích thước vài megabyte mỗi tệp và được tải xuống một lần từ chính trang này (chúng tôi tự lưu trữ chúng, không qua CDN của bên thứ ba) trong lần đầu tiên bạn chọn ngôn ngữ đó. Sau khi tải xuống lần đầu, mô hình được lưu vào bộ nhớ đệm của trình duyệt, và tất cả nhận dạng tiếp theo cho ngôn ngữ đó chạy hoàn toàn ngoại tuyến.

Những yếu tố nào ảnh hưởng nhiều nhất đến độ chính xác OCR?

Độ phân giải quét (tối thiểu 200 DPI, khuyến nghị 300 DPI), độ sắc nét hình ảnh, độ tương phản giữa văn bản và nền, và việc trang có thẳng hay không đều ảnh hưởng mạnh đến độ chính xác. Các bản quét JPEG bị nén nhiều, phông chữ rất nhỏ, và các trang có hướng hỗn hợp hoặc bố cục cột phức tạp là các nguồn lỗi nhận dạng phổ biến nhất.

OCR có thể đọc văn bản viết tay không?

tesseract.js được huấn luyện chủ yếu trên văn bản in. Độ chính xác nhận dạng chữ viết tay thường thấp và không đáng tin cậy, đặc biệt với chữ viết tay thảo. Với tài liệu viết tay, các công cụ nhận dạng chữ viết tay chuyên dụng cho kết quả tốt hơn.

Tài liệu đã quét của tôi có được gửi đi đâu trong quá trình trích xuất văn bản không?

Không. Sau khi mô hình ngôn ngữ được lưu vào bộ nhớ đệm, mọi tác vụ nhận dạng đều xảy ra hoàn toàn trong trình duyệt của bạn bằng tesseract.js. Tài liệu đã quét có thể chứa nội dung cá nhân hoặc bí mật; xử lý chỉ cục bộ này có nghĩa là nội dung đó không bao giờ đến máy chủ.

Công cụ có bảo toàn bố cục của bản quét gốc không?

Đầu ra là luồng văn bản thuần theo thứ tự đọc. Bảng, cột, tiêu đề và các yếu tố bố cục khác không được bảo toàn dưới dạng cấu trúc; công cụ chỉ xuất nội dung văn bản. Để có đầu ra bảo toàn bố cục, cần đường dẫn OCR nâng cao hơn với phân tích bố cục.

Tôi có thể chạy OCR trên PDF đã có văn bản có thể chọn không?

Công cụ có thể xử lý các PDF dựa trên hình ảnh trong đó mỗi trang là hình ảnh raster không có văn bản nhúng. Nếu tệp PDF của bạn đã có lớp văn bản (bạn có thể chọn và sao chép văn bản trong trình xem), việc chạy OCR là không cần thiết; lớp văn bản hiện có cung cấp cùng thông tin đó mà không cần bước nhận dạng.

Tôi có thể chạy OCR trên một ảnh chụp bằng điện thoại không?

Có, và tesseract.js hoạt động trên trình duyệt di động, nên bạn thậm chí có thể mở trang này ngay trên chiếc điện thoại đã chụp ảnh đó. Ảnh chụp lệch góc hoặc ánh sáng không đều nhận dạng kém hơn so với bản quét flatbed; làm thẳng ảnh và cắt bỏ nền trước sẽ giúp ích.

Tôi có cần tạo tài khoản hay trả phí để dùng OCR không?

Không. Không cần đăng ký và không mất phí. Việc tải xuống duy nhất liên quan là mô hình ngôn ngữ mà tesseract.js cần một lần, tức là một lần tải engine, không phải đăng ký hay tường phí.