Как работи OCR · изображение/PDF към текст
OCR преобразува сканирано изображение или PDF на базата на изображения в текст, който можете да копирате, търсите и редактирате, използвайки tesseract.js, работещ изцяло в браузъра ви. Избирате езика на документа от селектора, съответният езиков модел се изтегля в браузъра ви веднъж, а всички последващи разпознавания работят офлайн от кеширания модел. Сканираните ви файлове никога не се предават на сървър по време на конвертирането.
Точността на разпознаването зависи силно от качеството на сканирането. Чисти сканирания с висок контраст при 200 DPI или повече, с минимален фонов шум и изправено наравняване на страниците, дават най-добри резултати. Замъглени, нискорезолюционни или силно компресирани JPEG изображения, страниците с колони или сложни оформления и ръкопис намаляват точността. Инструментът извежда блок от обикновен текст; за структуриран изход като запазени таблици или многоколонно оформление е необходима допълнителна обработка. Провеждането на PDF Deskew на наклонени сканирания преди OCR обикновено подобрява степента на разпознаване.