Návod
Zpřístupnit naskenované PDF k vyhledávání
Naskenované PDF vypadá jako běžný dokument, ale ve skutečnosti je to obrázek stránky: Ctrl+F nic nenajde a nelze vybrat ani zkopírovat jediné slovo. Nástroj PDF OCR to napraví, aniž by změnil, čím soubor je. Přečte obrázek každé stránky, rozpozná znaky pomocí OCR enginu běžícího v zařízení a rozpoznaný text neviditelně položí navrch téhož obrázku, takže PDF stále vypadá a tiskne se přesně jako předtím, ale nyní reaguje na vyhledávání a výběr textu. Soubor nikdy neopustí vaše zařízení.
Krok za krokem
- Otevřete nástroj PDF OCR a vložte své naskenované PDF. Přijímají se jen soubory PDF a soubor je omezen na 80 MB; typický vícestránkový sken je hluboko pod tímto limitem.
- Vyberte jazyk dokumentu z rozbalovací nabídky (angličtina, francouzština, němčina, španělština, portugalština nebo italština) a případně upravte název výstupního souboru. Výchozí nastavení automaticky ponechá příponu .pdf.
- Klikněte na Spustit a počkejte, než se zpracuje každá stránka. Každá stránka se vykreslí, projde OCR enginem a dostane vlastní neviditelnou textovou vrstvu, než nástroj přejde na další, takže dlouhý dokument trvá déle než jedna stránka. Stáhněte výsledek: otevře se a vytiskne identicky jako originál, ale Ctrl+F, výběr textu i kopírování a vkládání teď fungují.
Prohledávatelné PDF nebo prostý text: co skutečně potřebujete
Tento nástroj a obyčejný nástroj OCR řeší stejný základní problém, rozpoznání textu v naskenovaném obrázku, ale zachovávají různé věci. Nástroj OCR zahodí obrázek stránky a vrátí vám prostý soubor .txt: použijte ho, když chcete slova vložit do editoru, přeložit je nebo je hledat jako text, a nezáleží vám na zachování původního vzhledu dokumentu. Zdejší nástroj PDF OCR ponechá původní PDF přesně takové, jaké je, včetně obrázků stránek, a pouze pod něj přidá skrytou textovou vrstvu: použijte ho, když dokument musí zůstat PDF, které lze stále tisknout, posílat e-mailem nebo archivovat, ale zároveň v něm chcete umět vyhledávat nebo z něj kopírovat. Žádný z nástrojů nerekonstruuje rozvržení jako editovatelný text se skutečnými fonty a tabulkami; oba pracují se stejným rozpoznaným textem, jen ho balí jinak.
Proč výsledek závisí na skenu a kde jsou limity
Přesnost rozpoznávání sleduje kvalitu zdrojového obrázku, stejně jako u obyčejného OCR: čistý, rovný sken kolem 200 až 300 DPI se rozpozná spolehlivě, zatímco rozmazaná fotografie, zešikmená stránka nebo silné stíny produkují víc chybně přečtených slov. Pokud stránka vyšla nakřivo, narovnejte ji nástrojem PDF vyrovnání šikmosti ještě před spuštěním OCR, aby krok rozpoznávání četl rovný text. Nástroj pokrývá šest jazyků (angličtinu, francouzštinu, němčinu, španělštinu, portugalštinu, italštinu); dokument v nepodporovaném jazyce se správně nerozpozná. Zpracování probíhá stránku po stránce na kartě vašeho prohlížeče, takže dokument s desítkami stránek trvá znatelně déle než dvoustránkový sken, a soubor je omezen na 80 MB. Výstupní PDF má také obvykle podobnou velikost jako originál, protože samotné obrázky stránek se nedotýkají; potřebujete-li poté menší soubor, spusťte ho přes PDF kompresor.
Jak je sestavena neviditelná textová vrstva
Každá stránka PDF se nejprve rasterizuje na obrázek canvasu ve vašem prohlížeči, stejný vykreslovací krok, jaký používá nástroj PDF na obrázek. OCR engine (Tesseract, zkompilovaný do WebAssembly) přečte tento obrázek a vrátí každé rozpoznané slovo spolu s jeho ohraničujícím rámečkem, tedy pozicí na stránce. Tato slova se pak nakreslí zpět na kopii původní stránky PDF na rozpoznaných pozicích, ale s nulovou průhledností, takže se vizuálně nic nemění: obrázek stránky, který vidíte a tisknete, je stejný jako naskenovaný, jen leží navrch. Funkce vyhledávání a výběru textu v prohlížeči PDF se dívají jen na tuto neviditelnou textovou vrstvu, a proto se soubor stane prohledávatelným a vybíratelným, aniž by vypadal jinak. Toto vše, vykreslování, rozpoznávání i opětovné sestavení, probíhá přímo na kartě vašeho prohlížeče; PDF se čte z lokálního disku a nikdy se nikam nepřenáší.
Nástroje použité v tomto návodu
- OCR PDF · zpřístupnit k vyhledáváníPřeveďte naskenované PDF na prohledávatelné a vybíratelné PDF přímo v prohlížeči, bez nahrávání.
- OCR · obrázek/PDF na textExtrahujte text z naskenovaných obrázků nebo PDF zcela v prohlížeči, běží offline, bez nahrávání.
- Narovnat naskenované stránkyNarovnejte zkosené naskenované PDF nebo obrázky zcela v prohlížeči, bez nahrávání.
- Komprimovat PDFZmenšete velikost souboru PDF bezztrátovou optimalizací jeho vnitřní struktury, bez nahrávání.
Časté dotazy
Bude prohledávatelné PDF stále vypadat a tisknout se přesně jako původní sken?
Ano. Nástroj nikdy neupravuje obrázek stránky; jen pod něj přidá neviditelnou textovou vrstvu. Na obrazovce i na papíře je výstup vizuálně totožný se skenem, který jste vložili. Změní se to, že nástroje pro vyhledávání a výběr textu v prohlížeči teď dokážou najít a uchopit rozpoznaná slova, protože čtou z této skryté vrstvy.
Proč tento nástroj existuje vedle obyčejného nástroje OCR?
Odpovídají na různé potřeby ze stejného kroku rozpoznávání. Nástroj OCR vám dá prostý textový soubor, což je to, co chcete, pokud plánujete slova vkládat, upravovat nebo překládat a nepotřebujete dokument zachovat jako PDF. Tento nástroj ponechá soubor jako PDF s nedotčenými původními obrázky stránek, což je to, co chcete, pokud se dokument stále musí tisknout, archivovat nebo posílat e-mailem tak, jak je, ale zároveň v něm chcete umět vyhledávat nebo z něj kopírovat text.