Урок
Направете сканиран PDF търсим
Сканиран PDF изглежда като обикновен документ, но всъщност е картина на страница: Ctrl+F не намира нищо, и не можете да селектирате или копирате нито една дума. Инструментът PDF OCR поправя това, без да променя какво представлява файлът. Той чете изображението на всяка страница, разпознава символите с двигател за OCR на устройството, и полага разпознатия текст невидимо върху същото изображение, така че PDF файлът все още изглежда и се разпечатва точно както преди, но вече откликва на търсене и селектиране на текст. Файлът никога не напуска устройството ви.
Стъпка по стъпка
- Отворете инструмента PDF OCR и пуснете сканирания си PDF. Приемат се само PDF файлове, а файлът е ограничен до 80 MB; типичен многостраничен скан е далеч под това.
- Изберете езика на документа от падащото меню (английски, френски, немски, испански, португалски или италиански) и, ако желаете, редактирайте името на изходния файл. Подразбирането запазва разширението .pdf автоматично.
- Щракнете Старт и изчакайте всяка страница да бъде обработена. Всяка страница се изчертава, преминава през двигателя за OCR и получава собствен невидим текстов слой, преди инструментът да премине към следващата, така че дълъг документ отнема повече време от една страница. Изтеглете резултата: той се отваря и разпечатва идентично с оригинала, но Ctrl+F, селектирането на текст и копирането вече работят.
Търсим PDF или обикновен текст: от кое всъщност имате нужда
Този инструмент и обикновеният инструмент OCR решават един и същ основен проблем, разпознаване на текст в сканирано изображение, но запазват различни неща. Инструментът OCR изхвърля изображението на страницата и ви връща обикновен .txt файл: използвайте го, когато искате да поставите думите в редактор, да ги преведете или да ги търсите като текст, и не ви интересува запазването на оригиналния вид на документа. Инструментът PDF OCR тук запазва оригиналния PDF точно какъвто е, изображенията на страниците и всичко, и само добавя скрит текстов слой отдолу: използвайте го, когато документът трябва да остане PDF, който все още можете да разпечатате, изпратите по имейл или архивирате, но искате и да можете да търсите или копирате от него. Нито един от двата инструмента не възстановява оформлението като редактируем текст с истински шрифтове и таблици; и двата работят от същия разпознат текст, само опакован различно.
Защо резултатът зависи от скана, и къде са границите
Точността на разпознаване следва качеството на изходното изображение, по същия начин както при обикновеното OCR: чист, прав скан около 200 до 300 DPI разпознава надеждно, докато размазана снимка, изкривена страница или силни сенки произвеждат повече грешно прочетени думи. Ако страница е излязла накриво, изправете я с инструмента за изправяне на сканирани страници, преди да пуснете OCR, така че стъпката за разпознаване да чете изравнен текст. Инструментът покрива шест езика (английски, френски, немски, испански, португалски, италиански); документ на неподдържан език няма да се разпознае правилно. Обработката върви страница по страница в раздела на браузъра ви, така че документ с десетки страници отнема забележимо повече време от двустраничен скан, а файлът е ограничен до 80 MB. Изходният PDF също има тенденция да бъде подобен по размер на оригинала, тъй като самите изображения на страниците не се третират; ако имате нужда от по-малък файл след това, пуснете го през компресора на PDF.
Как се изгражда невидимият текстов слой
Всяка PDF страница първо се растеризира до изображение върху канва в браузъра ви, същата стъпка на изчертаване, която използва инструментът PDF към изображение. Двигателят за OCR (Tesseract, компилиран в WebAssembly) чете това изображение и връща всяка разпозната дума заедно с ограничаващата ѝ рамка, позицията ѝ на страницата. Тези думи после се изчертават обратно върху копие на оригиналната PDF страница на разпознатите им позиции, но при нулева непрозрачност, така че нищо не се променя визуално: изображението на страницата, което виждате и разпечатвате, е същото, което е било сканирано, седящо отгоре. Функциите за търсене и селектиране на текст на PDF четец разглеждат само този невидим текстов слой, затова файлът става търсим и селектируем, без да изглежда различно. Всичко това, изчертаване, разпознаване и пресъбиране, се случва вътре в раздела на браузъра ви; PDF файлът се чете от локален диск и никога не се предава никъде.
Инструментите, използвани в това ръководство
- PDF OCR · направи го търсимПревърнете сканиран PDF в търсим и селектируем PDF изцяло в браузъра, без качване.
- OCR · изображение/PDF към текстИзвличайте текст от сканирани изображения или PDF файлове изцяло в браузъра си, работи офлайн, без качване.
- Изправяне на сканирани странициИзправете наклонени сканирани PDF файлове или изображения изцяло в браузъра си, без качване.
- Компресиране на PDFНамалете размера на PDF файла чрез безпогрешна оптимизация на вътрешната му структура, без качване.
Често задавани въпроси
Ще изглежда и разпечатва ли търсимият PDF точно като оригиналния скан?
Да. Инструментът никога не променя изображението на страницата; той само добавя невидим текстов слой отдолу. На екран и на хартия резултатът е визуално идентичен със скана, който сте пуснали. Промяната е, че функциите за търсене и селектиране на текст на четец вече могат да намерят и захванат разпознатите думи, защото четат от онзи скрит слой.
Защо съществува този инструмент заедно с обикновения инструмент OCR?
Те отговарят на различни нужди от една и съща стъпка на разпознаване. Инструментът OCR ви дава обикновен текстов файл, което е това, което искате, ако планирате да поставите, редактирате или преведете думите и нямате нужда да запазите документа като PDF. Този инструмент запазва файла като PDF с оригиналните изображения на страниците непокътнати, което е това, което искате, ако документът все още трябва да бъде разпечатан, архивиран или изпратен по имейл такъв, какъвто е, но искате и да можете да търсите или копирате текст от него.