Як працює OCR · зображення/PDF у текст
OCR конвертує відскановане зображення або PDF на основі зображення у текст, який можна скопіювати, знайти в пошуку та відредагувати, використовуючи tesseract.js, що працює повністю у вашому браузері. Ви обираєте мову документа з селектора, відповідна мовна модель завантажується до вашого браузера один раз, і всі наступні розпізнавання виконуються офлайн з тієї кешованої моделі. Ваші відскановані файли ніколи не передаються на жодний сервер під час конвертації.
Точність розпізнавання суттєво залежить від якості сканування. Чисті, контрастні скани з роздільною здатністю 200 DPI і вище, з мінімальним фоновим шумом і рівним вирівнюванням сторінок, дають найкращі результати. Розмиті, низькороздільні або сильно стислі JPEG, сторінки з колонками або складними макетами, а також рукописний текст знижують точність. Інструмент виводить блок звичайного тексту; для структурованого виводу, як-от збережених таблиць або багатоколонного макету, потрібна постобробка. Запускання інструмента PDF Deskew на кривих сканах перед OCR зазвичай покращує показники розпізнавання.