كيف تعمل التعرف الضوئي على PDF · اجعله قابلاً للبحث
يحوّل PDF OCR ملف PDF ممسوحًا ضوئيًا (أي مكوّنًا من صور صفحات دون نص حقيقي) إلى PDF قابل للبحث: نفس صور الصفحات، مع إضافة طبقة نص غير مرئية موضوعة فوق كل كلمة مُتعرَّف عليها. افتح النتيجة في أي قارئ PDF، وستتمكن الآن من استخدام Ctrl+F للعثور على كلمة، أو تحديد فقرة ونسخها، أو السماح لمحرك بحث بفهرسة المستند، وكلها أمور لا يمكن لمسح ضوئي عادي القيام بها. يعمل التعرّف نفسه عبر tesseract.js (محرك OCR ذاته المستضاف ذاتيًا والمستخدم في أداة OCR)، بينما يُنفَّذ عرض الصفحات عبر pdf.js؛ وكلاهما يعمل بالكامل داخل تبويب متصفحك، ولا يُرفع ملفك أبدًا.
هذه الأداة صريحة بشأن ما تفعله وما لا تفعله. فهي لا تعيد بناء التخطيط أو الجداول أو الخطوط، وليست محوّلًا إلى مستند قابل للتحرير: تبقى الصفحة المرئية صورة مطابقة للمسح الأصلي، مع إضافة طبقة نص مخفية تحت المظهر الظاهر. تعتمد دقة التعرّف على جودة المسح الضوئي، وفق نفس الإرشادات المعتادة لأي محرك OCR: دقة 200 نقطة لكل بوصة (DPI) أو أعلى، وتباين عالٍ، وصفحة مستقيمة. إذا كنت تحتاج فقط إلى النص المستخرج البسيط بدلًا من ملف PDF قابل للبحث بداخله، فإن أداة OCR تنتج بدلًا من ذلك ملف .txt وهي أسرع لهذه المهمة بالذات.