Bez przesyłania, 100% lokalnie, bez konta

Instrukcja

Zamień zeskanowany PDF w przeszukiwalny

Zeskanowany PDF wygląda jak zwykły dokument, ale w rzeczywistości jest obrazem strony: Ctrl+F nic nie znajduje, a ty nie możesz zaznaczyć ani skopiować ani jednego słowa. Narzędzie OCR PDF naprawia to, nie zmieniając tego, czym plik jest. Odczytuje obraz każdej strony, rozpoznaje znaki silnikiem OCR działającym na urządzeniu i nakłada rozpoznany tekst niewidocznie na ten sam obraz, więc PDF nadal wygląda i drukuje się dokładnie tak samo jak wcześniej, ale teraz reaguje na wyszukiwanie i zaznaczanie tekstu. Plik nigdy nie opuszcza twojego urządzenia.

Krok po kroku

  1. Otwórz narzędzie OCR PDF i upuść swój zeskanowany PDF. Akceptowane są tylko pliki PDF, a plik jest ograniczony do 80 MB; typowy wielostronicowy skan mieści się w tym limicie z dużym zapasem.
  2. Wybierz język dokumentu z listy rozwijanej (angielski, francuski, niemiecki, hiszpański, portugalski lub włoski) i, jeśli chcesz, zmień nazwę pliku wynikowego. Domyślnie rozszerzenie .pdf jest zachowywane automatycznie.
  3. Kliknij Uruchom i poczekaj, aż każda strona zostanie przetworzona. Każda strona jest renderowana, przepuszczana przez silnik OCR i otrzymuje własną niewidoczną warstwę tekstu, zanim narzędzie przejdzie do kolejnej, więc długi dokument zajmuje więcej czasu niż pojedyncza strona. Pobierz wynik: otwiera się i drukuje identycznie jak oryginał, ale Ctrl+F, zaznaczanie tekstu i kopiowanie już działają.

Przeszukiwalny PDF czy zwykły tekst: czego naprawdę potrzebujesz

To narzędzie i zwykłe narzędzie OCR rozwiązują ten sam podstawowy problem, rozpoznawanie tekstu na zeskanowanym obrazie, ale zachowują różne rzeczy. Narzędzie OCR odrzuca obraz strony i zwraca zwykły plik .txt: użyj go, gdy chcesz wkleić słowa do edytora, przetłumaczyć je albo przeszukiwać jako tekst, i nie zależy ci na zachowaniu oryginalnego wyglądu dokumentu. Narzędzie OCR PDF zachowuje oryginalny PDF dokładnie takim, jaki jest, wraz z obrazami stron, i tylko dodaje pod spodem ukrytą warstwę tekstu: użyj go, gdy dokument musi pozostać PDF, który nadal możesz drukować, wysyłać e-mailem czy archiwizować, ale chcesz też móc go przeszukiwać lub z niego kopiować. Żadne z narzędzi nie odtwarza układu jako edytowalnego tekstu z prawdziwymi czcionkami i tabelami; oba działają na tym samym rozpoznanym tekście, tylko inaczej go pakują.

Dlaczego wynik zależy od skanu i gdzie są granice

Dokładność rozpoznawania podąża za jakością obrazu źródłowego, tak samo jak przy zwykłym OCR: czysty, prosty skan w okolicach 200 do 300 DPI rozpoznaje się niezawodnie, podczas gdy rozmazane zdjęcie, przekrzywiona strona lub mocne cienie dają więcej błędnie odczytanych słów. Jeśli strona wyszła krzywo, wyprostuj ją narzędziem Prostowanie PDF przed uruchomieniem OCR, by etap rozpoznawania czytał wyrównany tekst. Narzędzie obsługuje sześć języków (angielski, francuski, niemiecki, hiszpański, portugalski, włoski); dokument w nieobsługiwanym języku nie zostanie poprawnie rozpoznany. Przetwarzanie odbywa się strona po stronie w karcie przeglądarki, więc dokument liczący kilkadziesiąt stron zajmuje zauważalnie więcej czasu niż dwustronicowy skan, a plik jest ograniczony do 80 MB. Wynikowy PDF ma też zwykle podobny rozmiar do oryginału, bo same obrazy stron nie są dotykane; jeśli potem potrzebujesz mniejszego pliku, przepuść go przez kompresor PDF.

Jak budowana jest niewidoczna warstwa tekstu

Każda strona PDF jest najpierw rasteryzowana do obrazu canvas w przeglądarce, tym samym krokiem renderowania, którego używa narzędzie PDF na obraz. Silnik OCR (Tesseract, skompilowany do WebAssembly) odczytuje ten obraz i zwraca każde rozpoznane słowo wraz z jego prostokątem otaczającym, czyli pozycją na stronie. Te słowa są następnie odrysowywane na kopii oryginalnej strony PDF w rozpoznanych pozycjach, ale przy zerowej nieprzezroczystości, więc nic nie zmienia się wizualnie: obraz strony, który widzisz i drukujesz, to ten sam zeskanowany obraz, leżący na wierzchu. Funkcje wyszukiwania i zaznaczania tekstu w przeglądarce PDF patrzą tylko na tę niewidoczną warstwę tekstu, dlatego plik staje się przeszukiwalny i zaznaczalny, nie wyglądając ani trochę inaczej. To wszystko, renderowanie, rozpoznawanie i ponowne złożenie, dzieje się wewnątrz karty przeglądarki; PDF jest odczytywany z lokalnego dysku i nigdy nigdzie nie przesyłany.

Narzędzia użyte w tym poradniku

Najczęściej zadawane pytania

Czy przeszukiwalny PDF nadal będzie wyglądał i drukował się dokładnie jak oryginalny skan?

Tak. Narzędzie nigdy nie modyfikuje obrazu strony; dodaje pod spodem tylko niewidoczną warstwę tekstu. Na ekranie i na papierze wynik jest wizualnie identyczny ze skanem, który upuściłeś. Zmienia się to, że narzędzia wyszukiwania i zaznaczania tekstu w przeglądarce mogą teraz znaleźć i pochwycić rozpoznane słowa, bo czytają z tej ukrytej warstwy.

Dlaczego to narzędzie istnieje obok zwykłego narzędzia OCR?

Odpowiadają na różne potrzeby wynikające z tego samego etapu rozpoznawania. Narzędzie OCR daje ci zwykły plik tekstowy, czego chcesz, jeśli planujesz wklejać, edytować lub tłumaczyć słowa i nie musisz zachować dokumentu jako PDF. To narzędzie zachowuje plik jako PDF z nietkniętymi oryginalnymi obrazami stron, czego chcesz, jeśli dokument nadal musi być drukowany, archiwizowany lub wysyłany e-mailem w niezmienionej postaci, ale chcesz też móc go przeszukiwać lub kopiować z niego tekst.

Źródła