بدون رفع, 100% محلي، بدون حساب

مقال

لماذا لا يمكنك نسخ النص من بعض ملفات PDF

حاول تحديد سطر في PDF ما وتُظلَّل الكلمات بشكل طبيعي، جاهزة للنسخ. جرّب الحركة نفسها في PDF آخر ولا يحدث شيء، أو يمسك المؤشر بالصفحة كلها كصورة فوتوغرافية، لأن هذا بالضبط ما هي عليه. ملفان يبدوان متطابقين على الشاشة يمكن أن يُبنيا بشكل مختلف تمامًا من الداخل. إليك كيف تعرف أي نوع لديك، وماذا تفعل حيال الذي يقاوم النسخ.

نوعان مختلفان من صفحات PDF

يمكن لملف PDF أن يخزّن صفحة بطريقتين مختلفتين جدًا. في PDF نصي، كل حرف عنصر ذو قيمة يونيكود وخط وموضع، بالطريقة نفسها التي تخزّن بها صفحة ويب النص: يستطيع العارض تحديده والبحث فيه، ويستطيع قارئ شاشة قراءته بصوت عالٍ. في PDF قائم على الصور، الصفحة صورة مسطحة واحدة، غالبًا منتَجة بماسحة ضوئية أو فاكس أو خطوة "طباعة إلى PDF" مطبقة على صورة لمستند. تبدو الأحرف متماثلة لعينيك، لكن بالنسبة لصيغة الملف لا يوجد حرف تحتها، فقط بكسلات.

مقارنة جنبًا إلى جنب: صفحة PDF نصية بسطر نص مظلل وقابل للتحديد بجانب صفحة PDF قائمة على الصور حيث النص المتماثل المظهر صورة مسطحة واحدة بلا تحديد.

طريقة سريعة لمعرفة أي نوع لديك

اضغط Ctrl+F أو Cmd+F وابحث عن كلمة تراها بوضوح على الصفحة. إذا وجدها البحث وظللها، فالصفحة تملك طبقة نص حقيقية. إذا لم يجد البحث شيئًا في أي مكان بالمستند، فالصفحة صورة، مهما بدت واضحة أو شبيهة بمستند مكتوب. سحب الفأرة لتحديد سطر يعطي الإجابة نفسها: تظليل مقابل تحديد مستطيل عادي.

إعادة بناء النص بتقنية OCR

التعرف الضوئي على الحروف (OCR) يقرأ بكسلات صفحة قائمة على الصور ويطابق الأشكال مع نموذج مدرَّب على أحرف لغة معينة، ثم يعيد بناء طبقة نص بالأحرف المتعرَّف عليها موضوعة حيث ظهرت. تفعل أداة كـOCR هذا بالكامل في المتصفح: لا يُرفع شيء، والناتج ملف نص عادي يمكنك البحث فيه أو نسخه أو تحريره. تعتمد الدقة على المصدر: مسح نظيف ومستقيم وعالي الدقة بلغة مدعومة جيدًا يتعرَّف بموثوقية، بينما تنتج صفحة مائلة أو ضبابية أو منخفضة التباين أو مكتوبة بخط اليد أخطاء أكثر، أحيانًا حرفًا خاطئًا أو كلمة مقروءة خطأ.

مخطط مسار: بكسلات صفحة ممسوحة تمر عبر تعرف OCR على الأحرف وتخرج كطبقة نص مُعاد بناؤها وموضوعة.

عندما يملك الملف نصًا أصلًا لكن الاستخراج يبدو خاطئًا

إذا كان ملف PDF لديك يملك طبقة نص حقيقية فعلًا لكن أداة كتحويل PDF إلى نص تنتج نصًا بترتيب غريب، بأعمدة مدمجة أو تباعد منهار، فتلك مشكلة مختلفة وغير مرتبطة: عناصر النص موجودة لكن ترتيب قراءتها على الصفحة لم يُخزَّن بالطريقة التي يتوقعها نص برمجي بشكل طبيعي. هذه غرابة تنسيق تُنظَّف بعد الاستخراج، لا علامة على أن النص مفقود، ولا تحتاج OCR لإصلاحها.

الأدوات المذكورة في هذا المقال

الأسئلة الشائعة

يبدو PDF لدي كمستند مكتوب عادي لكن لا يزال بإمكاني تحديد أي نص. لماذا؟

هي على الأرجح صفحة ممسوحة ضوئيًا أو مصوَّرة محفوظة كـPDF، أو مستند سُطِّح إلى صورة عمدًا. بصريًا قد لا يمكن تمييزها عن PDF نصي؛ يظهر الفرق فقط عندما تحاول البحث فيها أو تحديدها. تشغيلها عبر OCR يعيد بناء طبقة نص حقيقية وقابلة للتحديد من البكسلات.

هل يعمل OCR بجودة متساوية في كل لغة؟

لا. تعتمد الدقة على وجود نموذج مدرَّب لتلك اللغة والكتابة، وعلى جودة المسح. اللغات المدعومة جيدًا على مسح نظيف ومستقيم تتعرَّف بموثوقية؛ الخط اليدوي أو الصور منخفضة الدقة أو اللغات ذات بيانات تدريب أقل تنتج أخطاء أكثر. ناتج OCR دائمًا نسخ بأفضل جهد، يستحق مراجعة سريعة قبل الاعتماد عليه.

المصادر