بدون رفع, 100% محلي، بدون حساب

اجعل ملف PDF الممسوح قابلاً للبحث

أفلت ملف PDF ممسوحًا ضوئيًا واحصل على الصفحات ذاتها مع طبقة نص خفية وقابلة للبحث مضافة فوقها. يعمل التعرف بالكامل داخل متصفحك (على جهازك، وبلا اتصال بعد التحميل الأول)، دون رفع أي شيء.

كيف تعمل التعرف الضوئي على PDF · اجعله قابلاً للبحث

يحوّل PDF OCR ملف PDF ممسوحًا ضوئيًا (أي مكوّنًا من صور صفحات دون نص حقيقي) إلى PDF قابل للبحث: نفس صور الصفحات، مع إضافة طبقة نص غير مرئية موضوعة فوق كل كلمة مُتعرَّف عليها. افتح النتيجة في أي قارئ PDF، وستتمكن الآن من استخدام Ctrl+F للعثور على كلمة، أو تحديد فقرة ونسخها، أو السماح لمحرك بحث بفهرسة المستند، وكلها أمور لا يمكن لمسح ضوئي عادي القيام بها. يعمل التعرّف نفسه عبر tesseract.js (محرك OCR ذاته المستضاف ذاتيًا والمستخدم في أداة OCR)، بينما يُنفَّذ عرض الصفحات عبر pdf.js؛ وكلاهما يعمل بالكامل داخل تبويب متصفحك، ولا يُرفع ملفك أبدًا.

هذه الأداة صريحة بشأن ما تفعله وما لا تفعله. فهي لا تعيد بناء التخطيط أو الجداول أو الخطوط، وليست محوّلًا إلى مستند قابل للتحرير: تبقى الصفحة المرئية صورة مطابقة للمسح الأصلي، مع إضافة طبقة نص مخفية تحت المظهر الظاهر. تعتمد دقة التعرّف على جودة المسح الضوئي، وفق نفس الإرشادات المعتادة لأي محرك OCR: دقة 200 نقطة لكل بوصة (DPI) أو أعلى، وتباين عالٍ، وصفحة مستقيمة. إذا كنت تحتاج فقط إلى النص المستخرج البسيط بدلًا من ملف PDF قابل للبحث بداخله، فإن أداة OCR تنتج بدلًا من ذلك ملف .txt وهي أسرع لهذه المهمة بالذات.

كيفية استخدام التعرف الضوئي على PDF · اجعله قابلاً للبحث خطوة بخطوة

  1. أسقط ملف PDF الممسوح ضوئيًا لديك (صورة صفحة واحدة لكل صفحة، دون طبقة نص موجودة مسبقًا) في منطقة الرفع.
  2. اختر اللغة الأساسية للمستند من القائمة المنسدلة الخاصة باللغة.
  3. إذا كانت هذه المرة الأولى التي تستخدم فيها الأداة، انتظر تنزيل محرك tesseract.js (يحدث هذا مرة واحدة فقط).
  4. اضغط على تشغيل وانتظر حتى تُعرض كل صفحة ويجري التعرّف عليها بدورها.
  5. نزّل ملف PDF القابل للبحث: بنفس المظهر، لكن مع طبقة نص أسفله الآن.

حالات الاستخدام الشائعة

  • عقد ممسوح ضوئيًا يحتاج إلى أن يكون قابلًا للبحث حتى يمكن إيجاد بند معيّن باستخدام Ctrl+F بدلًا من قراءة كل صفحة.
  • دفعة من الفواتير الممسوحة ضوئيًا تحتاج إلى الدخول في أرشيف مستندات حيث لا يقرأ فهرس البحث سوى نص PDF حقيقي.
  • استمارة مصوَّرة أو ممسوحة ضوئيًا تحتاج إلى أن تصبح تسمياتها المطبوعة قابلة للتحديد حتى يمكن نسخ فقرة إلى بريد إلكتروني.
  • مكتبة من التقارير الممسوحة ضوئيًا باللغة الألمانية تحتاج إلى بحث في النص الكامل؛ اختر الألمانية كلغة قبل تشغيل الأداة.

الأسئلة الشائعة

ما الفرق بين هذه الأداة وأداة OCR البسيطة؟

تستخرج أداة OCR النص البسيط إلى ملف .txt، متجاهلةً التخطيط والصور الأصلية تمامًا. أما PDF OCR فتحافظ على صور صفحات PDF الأصلية كما هي بالضبط، وتضيف طبقة نص غير مرئية وقابلة للبحث أسفلها. استخدم OCR عندما تريد الكلمات فقط؛ واستخدم PDF OCR عندما تريد الإبقاء على المستند بصيغة PDF مع جعله قابلًا للبحث والتحديد.

هل سيبدو ملف PDF الناتج مختلفًا عن المسح الضوئي الأصلي؟

لا. تُعرض كل صفحة من ملف PDF المصدر وتُدرج مجددًا كصورة مطابقة تمامًا للمسح الأصلي على مستوى البكسل (مع مراعاة إعادة ترميز JPEG). تُرسم الكلمات المُتعرَّف عليها فوقها بشفافية كاملة (صفر في العتامة)، بحيث لا يظهر أي شيء جديد؛ والطريقة الوحيدة لملاحظة الطبقة المضافة هي البحث عن نص أو تحديده.

هل تعيد الأداة بناء الجداول أو الأعمدة أو الخطوط؟

لا. تُبقي النتيجة الصفحة صورة مسطحة واحدة؛ وتتبع طبقة النص غير المرئية مواضع الكلمات المُتعرَّف عليها، لكنها لا تحافظ على بنية الجداول، ولا على ترتيب القراءة متعدد الأعمدة بما يتجاوز ما يستنتجه tesseract.js، ولا على الخطوط الأصلية. هذه طبقة لإتاحة البحث، وليست تحويلًا للمستند إلى نص قابل للتحرير.

هل تُرسل مستنداتي الممسوحة ضوئيًا إلى أي مكان أثناء المعالجة؟

لا. بعد تنزيل محرك tesseract.js وحزمة اللغة من هذا الموقع (تنزيل لمرة واحدة بحجم بضع ميغابايتات عند أول استخدام)، يجري كل عرض للصفحات وكل عملية تعرّف بالكامل داخل تبويب متصفحك. لا تصل العقود الممسوحة ضوئيًا أو السجلات الطبية أو أي مستندات حساسة أخرى إلى أي خادم.

لماذا يستغرق ملف PDF الطويل بعض الوقت للمعالجة؟

تُعرض كل صفحة كصورة ويُجرى التعرّف الضوئي عليها بشكل منفرد، وكل ذلك داخل تبويب متصفحك، لذا يزداد وقت المعالجة مع عدد الصفحات. يعكس شريط التقدم تقدمًا حقيقيًا صفحة بصفحة، والملفات محدودة بحجم أقصى قدره 80 ميغابايت للحفاظ على سير العملية بأكمله ضمن حدود ذاكرة تبويب المتصفح.

ماذا لو كان ملف PDF لدي يحتوي بالفعل على نص قابل للتحديد؟

تشغيل OCR على ملف PDF يحمل بالفعل طبقة نص حقيقية أمر غير ضروري: فتحه في أي قارئ والضغط على Ctrl+F يعمل بالفعل. هذه الأداة مخصصة لملفات PDF المكوّنة من صور صفحات دون نص أساسي، وهي الناتج الشائع لماسح ضوئي مسطح أو لعملية "طباعة إلى PDF" لمستند مصوَّر.