Jak działa PDF do tekstu
PDF na tekst wyodrębnia istniejącą warstwę tekstową z PDF i zapisuje ją jako zwykły plik .txt. Wyodrębnianie jest wykonywane przez pdf.js wewnątrz przeglądarki, który czyta obiekty treści tekstowej osadzone w strumieniach stron PDF. Dokument nigdy nie opuszcza Twojego urządzenia; wynik jest składany lokalnie i oferowany jako bezpośrednie pobieranie.
To narzędzie czyta warstwę tekstową, która już istnieje w pliku. Jeśli Twój PDF został stworzony przez edytor tekstu lub narzędzie eksportujące, prawie na pewno ma warstwę tekstową i wyodrębnianie będzie działać dobrze. Jeśli PDF jest skanem dokumentu papierowego, strony zawierają tylko dane obrazu i nie ma warstwy tekstowej do wyodrębnienia; w takim przypadku to narzędzie zwróci pusty lub niekompletny wynik. Zeskanowane PDF-y wymagają optycznego rozpoznawania znaków (OCR) do produkcji tekstu, co jest osobnym procesem niewykonywanym przez to narzędzie. Przed użyciem narzędzia sprawdź, czy Twój PDF ma możliwy do zaznaczenia tekst w przeglądarce.