Artykuł
Dlaczego nie da się skopiować tekstu z niektórych PDF
Spróbuj zaznaczyć linię w jednym PDF, a słowa podświetlają się normalnie, gotowe do skopiowania. Spróbuj tego samego gestu w innym PDF, a nic się nie dzieje, albo kursor chwyta całą stronę jak fotografię, bo dokładnie tym ona jest. Dwa pliki, które na ekranie wyglądają identycznie, mogą być pod spodem zbudowane zupełnie inaczej. Oto jak rozpoznać, który typ masz, i co zrobić z tym, który opiera się kopiowaniu.
Dwa różne rodzaje strony PDF
PDF może przechowywać stronę na dwa bardzo różne sposoby. W PDF opartym na tekście każda litera jest obiektem znakowym z wartością Unicode, czcionką i pozycją, tak samo jak strona internetowa przechowuje tekst: czytnik może go zaznaczyć, przeszukać, a czytnik ekranu może go odczytać na głos. W PDF opartym na obrazie strona jest jednym płaskim obrazem, często wyprodukowanym przez skaner, faks albo krok „drukuj do PDF” zastosowany do zdjęcia dokumentu. Litery wyglądają tak samo dla twoich oczu, ale dla formatu pliku nie ma pod spodem żadnego znaku, tylko piksele.

Szybki sposób, by sprawdzić, który masz
Naciśnij Ctrl+F lub Cmd+F i wyszukaj słowo, które wyraźnie widzisz na stronie. Jeśli wyszukiwanie je znajdzie i podświetli, strona ma prawdziwą warstwę tekstu. Jeśli wyszukiwanie niczego nie znajdzie nigdzie w dokumencie, strona jest obrazem, niezależnie od tego, jak ostro wygląda albo jak bardzo przypomina wpisany dokument. Przeciągnięcie myszą, by zaznaczyć linię, daje tę samą odpowiedź: podświetlenie kontra zwykłe zaznaczenie prostokątem.
Odtwarzanie tekstu za pomocą OCR
Optyczne rozpoznawanie znaków (OCR) odczytuje piksele strony opartej na obrazie i dopasowuje kształty do wytrenowanego modelu liter dla danego języka, a następnie odbudowuje warstwę tekstu z rozpoznanymi znakami umieszczonymi tam, gdzie się pojawiały. Narzędzie takie jak OCR robi to w całości w przeglądarce: nic nie jest wysyłane, a wynikiem jest zwykły plik tekstowy, który możesz przeszukiwać, kopiować lub edytować. Dokładność zależy od źródła: czysty, prosty skan w wysokiej rozdzielczości w dobrze obsługiwanym języku rozpoznaje się niezawodnie, podczas gdy przekrzywiona, rozmazana, niskokontrastowa lub odręczna strona daje więcej błędów, czasem błędny znak albo źle odczytane słowo.

Gdy plik już ma tekst, ale wyodrębnienie wygląda źle
Jeśli twój PDF ma już prawdziwą warstwę tekstu, ale narzędzie takie jak PDF na tekst produkuje tekst w dziwnej kolejności, z połączonymi kolumnami albo zapadniętymi odstępami, to inny, niepowiązany problem: obiekty tekstowe istnieją, ale ich kolejność czytania na stronie nie została zapisana tak, jak naturalnie oczekuje tego skrypt. To dziwactwo układu do posprzątania po wyodrębnieniu, a nie oznaka, że tekst zaginął, i nie potrzeba OCR, by to naprawić.
Narzędzia w tym artykule
- OCR · obraz/PDF do tekstuWyodrębnij tekst ze zeskanowanych obrazów lub PDF w całości w przeglądarce, działa offline, bez przesyłania.
- PDF do tekstuWyodrębnij zawartość tekstową z PDF i pobierz jako plik .txt, bez przesyłania.
- OCR PDF · zrób z niego przeszukiwalny dokumentZamień zeskanowany PDF w przeszukiwalny, zaznaczalny PDF w całości w przeglądarce, bez wysyłania.
Najczęściej zadawane pytania
Mój PDF wygląda jak zwykły wpisany dokument, ale nadal nie mogę zaznaczyć żadnego tekstu. Dlaczego?
Najprawdopodobniej to zeskanowana lub sfotografowana strona zapisana jako PDF albo dokument celowo spłaszczony do obrazu. Wizualnie może być nie do odróżnienia od PDF opartego na tekście; różnica pojawia się dopiero, gdy próbujesz go przeszukać lub zaznaczyć. Przepuszczenie go przez OCR odbudowuje prawdziwą, zaznaczalną warstwę tekstu z pikseli.
Czy OCR działa równie dobrze w każdym języku?
Nie. Dokładność zależy od tego, czy istnieje wytrenowany model dla danego języka i pisma, oraz od jakości skanu. Dobrze obsługiwane języki na czystym, prostym skanie rozpoznają się niezawodnie; pismo odręczne, obrazy w niskiej rozdzielczości lub języki z mniejszą ilością danych treningowych dają więcej błędów. Wynik OCR to zawsze transkrypcja najlepszego przybliżenia, warta szybkiej korekty, zanim na niej polegniesz.