Žádné nahrávání, 100% lokálně, bez účtu

PDF → extrakce textu

Extrahujte veškerý čitelný text z vašeho PDF. Stáhněte jako soubor .txt. Vše zůstává v prohlížeči, žádný soubor se neodesílá na server.

Jak PDF na text funguje

PDF na text extrahuje existující textovou vrstvu z PDF a uloží ji jako obyčejný soubor .txt. Extrakci provádí pdf.js uvnitř vašeho prohlížeče, který čte objekty textového obsahu vložené do proudu stránek PDF. Dokument nikdy neopouští vaše zařízení; výsledek je sestaven lokálně a nabídnut jako přímé stažení.

Tento nástroj čte textovou vrstvu, která již v souboru existuje. Pokud bylo vaše PDF vytvořeno textovým procesorem nebo exportním nástrojem, téměř jistě má textovou vrstvu a extrakce bude fungovat dobře. Pokud jde o PDF z naskenovaného papírového dokumentu, stránky obsahují pouze obrázková data a žádná textová vrstva k extrakci není; v takovém případě nástroj vrátí prázdný nebo neúplný výstup. Naskenované PDF vyžadují optické rozpoznávání znaků (OCR) pro vytvoření textu, což je odlišný proces, který tento nástroj neprovádí. Před použitím tohoto nástroje zkontrolujte, zda vaše PDF obsahuje vybíratelný text v prohlížeči.

PDF na text: návod krok za krokem

  1. Načtěte své PDF do nástroje pro extrakci textu.
  2. Počkejte, až pdf.js přečte textovou vrstvu ze všech stránek.
  3. Zkontrolujte náhled extrahovaného textu.
  4. Klikněte na stažení a uložte soubor .txt.

Časté případy použití

  • Extrahujte text z PDF vědeckého článku a vložte ho do aplikace pro dělání poznámek nebo ho zpracujte sumarizátorem.
  • Vytáhněte obsah z PDF faktury do tabulky pro účetnictví bez ručního přepisování.
  • Získejte zpět text z poškozeného nebo jinak zamčeného PDF, kde kopírovat-a-vložit v prohlížeči nefunguje.
  • Převeďte článek PDF na obyčejný text pro zpracování skriptem nebo nástrojem příkazové řádky.

Často kladené otázky

Proč je extrakce textu u některých PDF prázdná nebo komolená?

Nejčastější příčinou je, že PDF je sken: stránky jsou obrázky a neobsahují žádnou textovou vrstvu. Další příčiny zahrnují PDF, kde je text uložen jako obrysy nebo v kódování vlastního fontu, které pdf.js nemůže mapovat na čitelné znaky. Pro naskenované dokumenty je pro vytvoření textu potřebné OCR.

Provádí tento nástroj OCR na naskenovaném PDF?

Ne. Tento nástroj čte existující textovou vrstvu z PDF. Neprovádí optické rozpoznávání znaků. Pro naskenované PDF použijte nástroj OCR, který předává obrázky stránek lokálnímu enginu OCR ve vašem prohlížeči.

Probíhá extrakce textu na serveru nebo v mém prohlížeči?

Ve vašem prohlížeči. pdf.js čte strukturu PDF lokálně, parsuje objekty textového obsahu z každého proudu stránky a sestavuje výstup v paměti prohlížeče. Data PDF během tohoto procesu v žádném okamžiku neopouští vaše zařízení.

Bude formátování a rozvržení zachováno v textovém výstupu?

Ne. Obyčejný text nenese informace o fontu, velikosti, barvě nebo pozici. Výstup je neformátovaný text v pořadí čtení určeného pdf.js. Tabulky, vícesloupcová rozvržení a speciální formátování jsou srovnány. Pro zachování bohatého rozvržení se lépe hodí konvertory PDF na HTML.

Mohu extrahovat text z PDF chráněného heslem?

Pokud má PDF otevírací heslo uživatele, musíte ho zadat, aby PDF bylo vůbec čitelné. Omezení extrakce na úrovni vlastníka mohou též blokovat operaci. Nejprve tato omezení odstraňte pomocí nástroje PDF Unlock a pak opakujte extrakci.

Potřebuji si vytvořit účet, abych mohl extrahovat text z PDF?

Ne. Není potřeba žádná registrace ani účet. Přetáhněte soubor, přečtěte si extrahovaný náhled a stáhněte soubor .txt.

Funguje PDF na text v mobilním prohlížeči?

Ano. pdf.js funguje v prohlížeči telefonu stejně jako na počítači. Jakmile extrakce skončí, zkopírujte nebo stáhněte extrahovaný text přímo z mobilní stránky.