Без качване, 100% локално, без акаунт

Урок

Направете сканиран PDF търсим

Сканиран PDF изглежда като обикновен документ, но всъщност е картина на страница: Ctrl+F не намира нищо, и не можете да селектирате или копирате нито една дума. Инструментът PDF OCR поправя това, без да променя какво представлява файлът. Той чете изображението на всяка страница, разпознава символите с двигател за OCR на устройството, и полага разпознатия текст невидимо върху същото изображение, така че PDF файлът все още изглежда и се разпечатва точно както преди, но вече откликва на търсене и селектиране на текст. Файлът никога не напуска устройството ви.

Стъпка по стъпка

  1. Отворете инструмента PDF OCR и пуснете сканирания си PDF. Приемат се само PDF файлове, а файлът е ограничен до 80 MB; типичен многостраничен скан е далеч под това.
  2. Изберете езика на документа от падащото меню (английски, френски, немски, испански, португалски или италиански) и, ако желаете, редактирайте името на изходния файл. Подразбирането запазва разширението .pdf автоматично.
  3. Щракнете Старт и изчакайте всяка страница да бъде обработена. Всяка страница се изчертава, преминава през двигателя за OCR и получава собствен невидим текстов слой, преди инструментът да премине към следващата, така че дълъг документ отнема повече време от една страница. Изтеглете резултата: той се отваря и разпечатва идентично с оригинала, но Ctrl+F, селектирането на текст и копирането вече работят.

Търсим PDF или обикновен текст: от кое всъщност имате нужда

Този инструмент и обикновеният инструмент OCR решават един и същ основен проблем, разпознаване на текст в сканирано изображение, но запазват различни неща. Инструментът OCR изхвърля изображението на страницата и ви връща обикновен .txt файл: използвайте го, когато искате да поставите думите в редактор, да ги преведете или да ги търсите като текст, и не ви интересува запазването на оригиналния вид на документа. Инструментът PDF OCR тук запазва оригиналния PDF точно какъвто е, изображенията на страниците и всичко, и само добавя скрит текстов слой отдолу: използвайте го, когато документът трябва да остане PDF, който все още можете да разпечатате, изпратите по имейл или архивирате, но искате и да можете да търсите или копирате от него. Нито един от двата инструмента не възстановява оформлението като редактируем текст с истински шрифтове и таблици; и двата работят от същия разпознат текст, само опакован различно.

Защо резултатът зависи от скана, и къде са границите

Точността на разпознаване следва качеството на изходното изображение, по същия начин както при обикновеното OCR: чист, прав скан около 200 до 300 DPI разпознава надеждно, докато размазана снимка, изкривена страница или силни сенки произвеждат повече грешно прочетени думи. Ако страница е излязла накриво, изправете я с инструмента за изправяне на сканирани страници, преди да пуснете OCR, така че стъпката за разпознаване да чете изравнен текст. Инструментът покрива шест езика (английски, френски, немски, испански, португалски, италиански); документ на неподдържан език няма да се разпознае правилно. Обработката върви страница по страница в раздела на браузъра ви, така че документ с десетки страници отнема забележимо повече време от двустраничен скан, а файлът е ограничен до 80 MB. Изходният PDF също има тенденция да бъде подобен по размер на оригинала, тъй като самите изображения на страниците не се третират; ако имате нужда от по-малък файл след това, пуснете го през компресора на PDF.

Как се изгражда невидимият текстов слой

Всяка PDF страница първо се растеризира до изображение върху канва в браузъра ви, същата стъпка на изчертаване, която използва инструментът PDF към изображение. Двигателят за OCR (Tesseract, компилиран в WebAssembly) чете това изображение и връща всяка разпозната дума заедно с ограничаващата ѝ рамка, позицията ѝ на страницата. Тези думи после се изчертават обратно върху копие на оригиналната PDF страница на разпознатите им позиции, но при нулева непрозрачност, така че нищо не се променя визуално: изображението на страницата, което виждате и разпечатвате, е същото, което е било сканирано, седящо отгоре. Функциите за търсене и селектиране на текст на PDF четец разглеждат само този невидим текстов слой, затова файлът става търсим и селектируем, без да изглежда различно. Всичко това, изчертаване, разпознаване и пресъбиране, се случва вътре в раздела на браузъра ви; PDF файлът се чете от локален диск и никога не се предава никъде.

Инструментите, използвани в това ръководство

Често задавани въпроси

Ще изглежда и разпечатва ли търсимият PDF точно като оригиналния скан?

Да. Инструментът никога не променя изображението на страницата; той само добавя невидим текстов слой отдолу. На екран и на хартия резултатът е визуално идентичен със скана, който сте пуснали. Промяната е, че функциите за търсене и селектиране на текст на четец вече могат да намерят и захванат разпознатите думи, защото четат от онзи скрит слой.

Защо съществува този инструмент заедно с обикновения инструмент OCR?

Те отговарят на различни нужди от една и съща стъпка на разпознаване. Инструментът OCR ви дава обикновен текстов файл, което е това, което искате, ако планирате да поставите, редактирате или преведете думите и нямате нужда да запазите документа като PDF. Този инструмент запазва файла като PDF с оригиналните изображения на страниците непокътнати, което е това, което искате, ако документът все още трябва да бъде разпечатан, архивиран или изпратен по имейл такъв, какъвто е, но искате и да можете да търсите или копирате текст от него.

Източници