Žádné nahrávání, 100% lokálně, bez účtu

Článek

Proč nejde zkopírovat text z některých PDF

Zkuste vybrat řádek v jednom PDF a slova se zvýrazní normálně, připravená ke zkopírování. Zkuste stejné gesto v jiném PDF a nic se nestane, nebo kurzor uchopí celou stránku jako fotografii, protože přesně to je. Dva soubory, které na obrazovce vypadají identicky, mohou být pod povrchem postavené úplně jinak. Zde je, jak poznat, který typ máte, a co dělat s tím, který se brání kopírování.

Dva různé typy stránky PDF

PDF může uchovávat stránku dvěma velmi odlišnými způsoby. V textovém PDF je každé písmeno objektem znaku s hodnotou Unicode, fontem a pozicí, stejně jako webová stránka ukládá text: prohlížeč ho může vybrat, vyhledat v něm a čtečka obrazovky ho může přečíst nahlas. V obrazovém PDF je stránka jeden plochý obrázek, často vzniklý ze skeneru, faxu nebo kroku "tisk do PDF" aplikovaného na fotografii dokumentu. Písmena vypadají pro vaše oči stejně, ale pro formát souboru pod nimi žádný znak není, jen pixely.

Srovnání vedle sebe: stránka textového PDF se zvýrazněným, vybíratelným řádkem textu vedle stránky obrazového PDF, kde je stejně vypadající text jedním plochým obrázkem bez možnosti výběru.

Rychlý způsob, jak zjistit, který typ máte

Stiskněte Ctrl+F nebo Cmd+F a vyhledejte slovo, které na stránce jasně vidíte. Pokud ho vyhledávání najde a zvýrazní, stránka má skutečnou textovou vrstvu. Pokud vyhledávání nenajde nic nikde v dokumentu, je stránka obrázek, bez ohledu na to, jak ostře nebo jak podobně psanému dokumentu vypadá. Přetažení myší k výběru řádku dá stejnou odpověď: zvýraznění oproti obyčejnému obdélníkovému výběru.

Rekonstrukce textu pomocí OCR

Optické rozpoznávání znaků (OCR) přečte pixely obrazové stránky a porovná tvary s natrénovaným modelem písmen pro daný jazyk, poté znovu sestaví textovou vrstvu s rozpoznanými znaky umístěnými tam, kde se objevily. Nástroj jako ocr to dělá celé v prohlížeči: nic se nenahrává a výstupem je prostý textový soubor, který můžete vyhledávat, kopírovat nebo upravovat. Přesnost závisí na zdroji: čistý, rovný sken s vysokým rozlišením v dobře podporovaném jazyce se rozpozná spolehlivě, zatímco zešikmená, rozmazaná, nízkokontrastní nebo ručně psaná stránka produkuje víc chyb, někdy chybný znak nebo chybně přečtené slovo.

Diagram procesu: pixely naskenované stránky procházejí rozpoznáváním znaků OCR a vycházejí jako rekonstruovaná, umístěná textová vrstva.

Když soubor už text má, ale extrakce vypadá špatně

Pokud vaše PDF skutečně má reálnou textovou vrstvu, ale nástroj jako pdf-to-text vytvoří text ve zvláštním pořadí, se sloučenými sloupci nebo zborcenými mezerami, jde o jiný, nesouvisející problém: textové objekty existují, ale jejich pořadí čtení na stránce nebylo uloženo tak, jak skript přirozeně očekává. To je nedostatek rozvržení, který se čistí až po extrakci, ne známka toho, že text chybí, a k opravě není potřeba OCR.

Nástroje v tomto článku

Časté dotazy

Moje PDF vypadá jako normální psaný dokument, ale přesto nemohu vybrat žádný text. Proč?

Nejpravděpodobněji jde o naskenovanou nebo vyfotografovanou stránku uloženou jako PDF, nebo o dokument záměrně zploštěný na obrázek. Vizuálně to může být k nerozeznání od textového PDF; rozdíl se projeví, až když se ho pokusíte vyhledat nebo vybrat. Spuštění OCR znovu sestaví skutečnou, vybíratelnou textovou vrstvu z pixelů.

Funguje OCR stejně dobře ve všech jazycích?

Ne. Přesnost závisí na tom, zda pro daný jazyk a písmo existuje natrénovaný model, a na kvalitě skenu. Dobře podporované jazyky na čistém, rovném skenu se rozpoznají spolehlivě; ruční písmo, obrázky s nízkým rozlišením nebo jazyky s méně trénovacími daty produkují víc chyb. Výstup OCR je vždy přepis na nejlepší úsilí, který se vyplatí před spolehnutím rychle prokouknout.

Zdroje