Как работи PDF OCR · направи го търсим
PDF OCR превръща сканиран PDF (файл от изображения на страници без истински текст) в PDF с възможност за търсене: същите изображения на страниците, плюс невидим текстов слой, поставен върху всяка разпозната дума. Отворете резултата в четец за PDF и вече можете да използвате Ctrl+F, за да намерите дума, да маркирате и копирате абзац, или да позволите на търсачка да индексира документа, все неща, които обикновено сканиране не може. Самото разпознаване работи с tesseract.js (същият самостоятелно хостван OCR механизъм, използван от инструмента за OCR), а изобразяването на страниците с pdf.js; и двете се изпълняват изцяло в раздела на браузъра ви, а файлът ви никога не се качва.
Този инструмент е честен за това какво прави и какво не прави. Той не възстановява оформление, таблици или шрифтове и не е конвертор в редактируем документ: видимата страница остава изображение, идентично на изходния скан, с добавен скрит текстов слой отдолу. Точността на разпознаването зависи от качеството на скана, същите насоки за 200 DPI или повече, висок контраст и изправена страница, които важат за всеки OCR механизъм. Ако ви трябва само чист извлечен текст, а не PDF, в който да търсите, инструментът за OCR произвежда файл .txt вместо това и е по-бърз за тази конкретна задача.