Jak PDF na text funguje
PDF na text extrahuje existující textovou vrstvu z PDF a uloží ji jako obyčejný soubor .txt. Extrakci provádí pdf.js uvnitř vašeho prohlížeče, který čte objekty textového obsahu vložené do proudu stránek PDF. Dokument nikdy neopouští vaše zařízení; výsledek je sestaven lokálně a nabídnut jako přímé stažení.
Tento nástroj čte textovou vrstvu, která již v souboru existuje. Pokud bylo vaše PDF vytvořeno textovým procesorem nebo exportním nástrojem, téměř jistě má textovou vrstvu a extrakce bude fungovat dobře. Pokud jde o PDF z naskenovaného papírového dokumentu, stránky obsahují pouze obrázková data a žádná textová vrstva k extrakci není; v takovém případě nástroj vrátí prázdný nebo neúplný výstup. Naskenované PDF vyžadují optické rozpoznávání znaků (OCR) pro vytvoření textu, což je odlišný proces, který tento nástroj neprovádí. Před použitím tohoto nástroje zkontrolujte, zda vaše PDF obsahuje vybíratelný text v prohlížeči.