Jak działa OCR · obraz/PDF do tekstu
OCR konwertuje zeskanowany obraz lub PDF oparty na obrazach na tekst, który można kopiować, przeszukiwać i edytować, używając tesseract.js działającego całkowicie wewnątrz przeglądarki. Wybierasz język dokumentu z selektora, odpowiedni model językowy pobiera się do przeglądarki raz, a wszystkie kolejne rozpoznania działają w trybie offline z tego buforowanego modelu. Twoje zeskanowane pliki nigdy nie są przesyłane na żaden serwer podczas konwersji.
Dokładność rozpoznawania zależy silnie od jakości skanu. Czyste, wysokie kontrastowe skany przy 200 DPI lub powyżej, z minimalnym szumem tła i prostą linią stron, dają najlepsze wyniki. Niewyraźne, niskorozdzielcze lub silnie skompresowane JPEG-i, strony z kolumnami lub złożonego układu oraz tekst odręczny zmniejszają dokładność. Narzędzie wyprowadza zwykły blok tekstowy; do strukturalnego wyjścia, takiego jak zachowane tabele lub układ wielokolumnowy, potrzebne jest postprzetwarzanie. Uruchomienie narzędzia do korekcji przekrzywienia PDF na krzywych skanach przed OCR zazwyczaj poprawia wskaźnik rozpoznawania.