Без качване, 100% локално, без акаунт

Направете сканиран PDF търсим

Пуснете сканиран PDF и получете същите страници с добавен невидим, търсим текстов слой отгоре. Разпознаването се извършва изцяло в браузъра (на устройството, офлайн след първото зареждане), нищо не се качва.

Как работи PDF OCR · направи го търсим

PDF OCR превръща сканиран PDF (файл от изображения на страници без истински текст) в PDF с възможност за търсене: същите изображения на страниците, плюс невидим текстов слой, поставен върху всяка разпозната дума. Отворете резултата в четец за PDF и вече можете да използвате Ctrl+F, за да намерите дума, да маркирате и копирате абзац, или да позволите на търсачка да индексира документа, все неща, които обикновено сканиране не може. Самото разпознаване работи с tesseract.js (същият самостоятелно хостван OCR механизъм, използван от инструмента за OCR), а изобразяването на страниците с pdf.js; и двете се изпълняват изцяло в раздела на браузъра ви, а файлът ви никога не се качва.

Този инструмент е честен за това какво прави и какво не прави. Той не възстановява оформление, таблици или шрифтове и не е конвертор в редактируем документ: видимата страница остава изображение, идентично на изходния скан, с добавен скрит текстов слой отдолу. Точността на разпознаването зависи от качеството на скана, същите насоки за 200 DPI или повече, висок контраст и изправена страница, които важат за всеки OCR механизъм. Ако ви трябва само чист извлечен текст, а не PDF, в който да търсите, инструментът за OCR произвежда файл .txt вместо това и е по-бърз за тази конкретна задача.

Как да използвате PDF OCR · направи го търсим, стъпка по стъпка

  1. Пуснете сканирания си PDF (по едно изображение на страница, без съществуващ текстов слой) в зоната за качване.
  2. Изберете основния език на документа от падащото меню за език.
  3. Ако това е първото ви използване на инструмента, изчакайте изтеглянето на механизма tesseract.js (случва се само веднъж).
  4. Натиснете старт и изчакайте, докато всяка страница бъде изобразена и разпозната поред.
  5. Изтеглете PDF с възможност за търсене: същият изглед, вече с текстов слой отдолу.

Често срещани приложения

  • Сканиран договор трябва да стане с възможност за търсене, за да може конкретна клауза да бъде намерена с Ctrl+F, вместо да се чете всяка страница.
  • Пакет от сканирани фактури трябва да влезе в архив от документи, чийто индекс за търсене чете само истински текст на PDF.
  • Снимана или сканирана форма трябва да направи отпечатаните надписи маркируеми, за да може абзац да бъде копиран в имейл.
  • Библиотека от сканирани доклади на немски език се нуждае от пълнотекстово търсене; изберете немски като език, преди да стартирате инструмента.

Често задавани въпроси

С какво това се различава от обикновения инструмент за OCR?

Инструментът за OCR извлича чист текст във файл .txt, като напълно изхвърля оригиналното оформление и изображения. PDF OCR запазва оригиналните изображения на страниците на PDF точно както изглеждат и добавя невидим текстов слой отдолу, с възможност за търсене. Използвайте OCR, когато искате само думите; използвайте PDF OCR, когато искате да запазите документа като PDF, но да го направите с възможност за търсене и маркиране.

Ще изглежда ли изходният PDF различно от моя скан?

Не. Всяка страница се изобразява от изходния ви PDF и се вгражда отново като изображение, пиксел по пиксел идентично на оригиналния скан (с допускане за повторно кодиране на JPEG). Разпознатите думи се изчертават отгоре с нулева непрозрачност, така че нищо ново не се вижда; търсене на текст или маркиране на текст е единственият начин да забележите добавения слой.

Инструментът възстановява ли таблици, колони или шрифтове?

Не. Изходът запазва страницата като едно плоско изображение; невидимият текстов слой следва позициите на разпознатите думи, но не запазва структурата на таблиците, реда на четене на много колони отвъд това, което tesseract.js извежда, или оригиналните шрифтове. Това е слой за възможност за търсене, а не конвертиране на документа в редактируем текст.

Изпращат ли се някъде сканираните ми документи по време на обработката?

Не. След като механизмът tesseract.js и езиковият пакет се изтеглят от този сайт (еднократно, няколко мегабайта при първо използване), всяко изобразяване на страница и всяко разпознаване се случват изцяло в раздела на браузъра ви. Сканирани договори, медицински досиета или други чувствителни документи никога не достигат до сървър.

Защо дълъг PDF отнема известно време за обработка?

Всяка страница се изобразява като изображение и OCR се изпълнява върху него поотделно, всичко в раздела на браузъра ви, така че времето за обработка нараства с броя на страниците. Лентата за напредък отразява реален напредък по страници, а файловете са ограничени до 80 MB, за да се поберат в бюджета на паметта на раздела на браузъра.

Ами ако моят PDF вече има маркируем текст?

Стартирането на OCR върху PDF, който вече носи истински текстов слой, е излишно: отварянето му в четец и натискането на Ctrl+F вече работят. Този инструмент е за PDF файлове, направени от изображения на страници без наличен текст, обичайният резултат от плосък скенер или „печат в PDF“ на снимка на документ.