مقال
تحسين دقة OCR: أصلح الصورة قبل التعرف على النص
دقة OCR مرتبطة بجودة الصورة التي تُغذّيه إياها. صورة مائلة أو منخفضة التباين أو مشوّشة ستنتج نصاً مشوّهاً بصرف النظر عن كفاءة المحرك. فيما يلي ما يؤثر فعلاً في النتيجة، مرتّباً بالتسلسل الصحيح للتنفيذ، كل ذلك محلياً داخل المتصفح.
لماذا يخفق OCR مع الصور الممسوحة ضوئياً في الواقع العملي
محرك OCR مثل Tesseract دُرِّب على نص نظيف وأفقي وعالي التباين. يقسّم الصفحة إلى أسطر، والأسطر إلى كلمات، والكلمات إلى أشكال حروف، ثم يطابق كل شكل مع نموذجه المدرَّب. أما الصور الممسوحة ضوئياً في الواقع فتخرق هذه الافتراضات: الصفحة مائلة بضع درجات، والإضاءة غير متساوية، والدقة منخفضة، وحافة لوح الماسح أو الصفحة المقابلة تضيف تشويشاً داكناً. كل واحدة من هذه المشكلات تُخطئ خطوة تجزئة الأسطر والحروف، وخطأ التجزئة يتسلسل ليُنتج أخطاء في الحروف. النادر أن يكون الحل اختيار محرك مختلف، بل الحل إعداد الصورة بحيث تتحقق افتراضات المحرك. في الممارسة، تؤثر المعالجة المسبقة في الدقة أكثر من اختيار محرك OCR.

ابدأ بالدقة: استهدف 300 DPI
يعمل Tesseract بأفضل حالاته عند حوالي 300 DPI للنص العادي. تحت 200 DPI تقريباً تتمازج خطوط كل رمز مع المجاورة لها وتنخفض الدقة بحدة. إن كنت تتحكم في الماسح، اضبطه على 300 DPI قبل أي شيء آخر، فهذا هو الخيار الأعلى تأثيراً. إن لم يتوفر لديك سوى صورة منخفضة الدقة، فتكبير الصورة لا يُنشئ تفاصيل لم تُلتَقط أصلاً، لكن تكبيراً معتدلاً قد يساعد المحرك على فصل الحروف المتلامسة بإعطاء التجزئة مزيداً من البكسلات للعمل بها. الطباعة الصغيرة جداً تستفيد من 400 إلى 600 DPI، وما فوق ذلك لا يزيد إلا حجم الملف دون مكسب في الدقة. حين يكون المصدر PDF، حوّل كل صفحة أولاً إلى صورة بالدقة المستهدفة ثم شغّل OCR على تلك الصورة.
تصحيح اتجاه الصفحة
إن كانت الصفحة مدورة 90 أو 180 أو 270 درجة، فالمحرك يقرأ النص أفقياً أو مقلوباً فيُخرج هراءً. يمتلك Tesseract مرحلة للكشف عن الاتجاه والخط (OSD) تستطيع تخمين الدوران، لكنها غير موثوقة مع النص المتناثر أو النماذج أو الصفحات التي تغلب عليها الصور. تدوير الصفحة بنفسك إلى الوضع المستقيم يُزيل التخمين. هذه الخطوة بلا خسارة وتتم فوراً: الدوران بمضاعفات 90 درجة لا يفعل سوى إعادة تعيين البكسلات الموجودة إلى مواضع جديدة دون إعادة أخذ عينات. نفّذها قبل تقويم الميل، إذ يفترض ذلك الأخير أن النص أفقي تقريباً بالفعل.
تقويم الميل: سوّ الانحراف الطفيف
حتى ميل من 2 إلى 3 درجات، ذلك الذي يحدث عند إدخال صفحة في الماسح بانحراف طفيف، يضر بالـ OCR: تقسّم خطوة البحث عن الأسطر الأفقية سطراً واحداً إلى اثنين، أو تدمج سطرين في واحد. يقيس تقويم الميل الزاوية السائدة لأسطر النص (عادةً بتحليل مخطط الإسقاط أو تحليل Hough) ويعيد الصفحة إلى الأفق. خلافاً للدوران 90 درجة، يستلزم التقويم دوراناً بزاوية اعتباطية صغيرة مما يُعيد أخذ عينات من البكسلات ويضيف قدراً ضئيلاً من الضبابية. هذه المقايضة تستحق دائماً تقريباً، إذ تتجزأ الأسطر المستقيمة بنظافة وكسب الدقة يفوق بكثير التلطيف الطفيف. قوّم الميل بعد تصحيح الاتجاه وقبل الاقتصاص.

اقتصص حتى النص واحذف التشويش
كل ما ليس النص المطلوب يُمثّل تشويشاً قد يُساء تفسيره من المحرك: الحافة الداكنة للوح الماسح، وجزء من الصفحة المقابلة، وزاوية مدبّسة، وإصبع، أو ثقب تدبيس. الاقتصاص حتى كتلة النص يُزيل هذه الأهداف الزائفة، مما يحسن الدقة ويُسرّع التعرف لأن المحرك يحلل مساحة أصغر. في المستند متعدد الأعمدة، يمنع الاقتصاص (أو تشغيل OCR على عمود واحد في كل مرة) كذلك قراءة المحرك عبر الفاصل الأعمدة وخلط العمودين في سطر مشوّه واحد. اقتصص بعد تقويم الميل، حتى يستقر المحتوى منتظماً في الإطار.
التباين والتدرج الرمادي وكيف تعمل البنرة فعلاً
يعمل OCR في نهاية المطاف على صورة ثنائية: كل بكسل يُحدَّد إما حبراً أو ورقاً. يُجري Tesseract ذلك داخلياً بطريقة Otsu التي تختار عتبة عالمية واحدة من رسم الهيستوجرام للصورة. يعمل ذلك جيداً حين تكون الإضاءة متساوية والتباين جيداً، لكنه يُخفق حين تجعل ظل أو خلفية ملوّنة أحد الأركان أكثر داكنة مما تتوقعه العتبة. المكاسب الموثوقة: التحويل إلى التدرج الرمادي، لئلا يُربك الصبغة اللونية العتبة، ثم معادلة الإضاءة كي تقع الصفحة كلها على جانب واحد منها. رفع التباين باعتدال يفيد النص الشاحب. ما يأتي بنتائج عكسية في الغالب هو البنرة اليدوية الصارمة: إن طبّقت عتبة بنسبة خاطئة محوت خطوطاً خفيفة كان المحرك سيحتفظ بها. دع المحرك يبنّر بنفسه وزوّده بصورة متدرجة الرمادي ومتساوية الإضاءة. يوفر Sunasty أداة تحويل PDF إلى التدرج الرمادي، أما للضبط الدقيق للتباين فمحرر سطح المكتب لا يزال أفضل، غير أن الإضاءة المتساوية وقت المسح أهم من أي شريط تمرير.
اختر اللغة الصحيحة وتحقق من النتيجة
يُحمِّل Tesseract ملف بيانات مدرَّبة منفصلاً لكل لغة وخط. تشغيل نموذج إنجليزي على نص فرنسي أو يوناني يُنتج أخطاء قابلة للتجنب، خاصةً على الحروف المشكّلة أو غير اللاتينية، لذا اختر اللغة المطابقة للمستند. أخيراً، تعامل مع مخرجات OCR باعتبارها مسوّدة لا إجابة نهائية: المحرك لا يعرف أن اسماً ما مكتوب بصحة أو أن 0 ليس حرف O. تحقق من الأرقام والأسماء العلم وكل ما هو مهم قانونياً أو مالياً. بالنسبة للجداول والتخطيطات متعددة الأعمدة، توقع إصلاح البنية يدوياً، لأن OCR يُعيد تدفقاً من النص المتعرَّف عليه لا تخطيطاً معاداً بناؤه.
الأدوات المذكورة في هذا المقال
- OCR · تحويل صورة/PDF إلى نصاستخرج نصًا من صور أو ملفات PDF ممسوحة ضوئيًا كليًا في متصفحك, يعمل دون اتصال، بدون تحميل.
- تصحيح انحراف الصفحات الممسوحةقوّم ملفات PDF أو صورًا ممسوحة ضوئيًا بشكل منحرف كليًا في متصفحك, بدون تحميل.
- تدوير الصور وقلبهادوّر الصور 90/180/270° أو اقلبها أفقيًا وعموديًا، بدون رفع.
- قص الصوراقصص صورك بمعاينة تفاعلية, اسحب وغيّر حجم منطقة القص. بدون رفع.
- PDF إلى تدرج الرماديحوّل ملف PDF ملونًا إلى تدرج الرمادي كليًا في متصفحك, بدون تحميل.
- تغيير حجم الصورغيّر حجم صورك وحوّلها (JPEG، PNG، WebP) دون رفعها.
- تحويل PDF إلى صورحوّل كل صفحة من PDF إلى PNG أو JPG مباشرةً في متصفحك.
الأسئلة الشائعة
هل تكبير الصورة الضبابية يحسّن دقة OCR؟
لا كثيراً في حد ذاته. التكبير لا يستعيد تفاصيل لم يلتقطها المسح قط، فصورة ضبابية بـ 100 DPI تبقى ضبابية. التكبير المعتدل قد يساعد المحرك على فصل الحروف المتلامسة بإعطاء التجزئة مزيداً من البكسلات، لكن إعادة المسح بـ 300 DPI أكثر جدوى بكثير من أي قدر من التكبير.
هل يجب أن أحوّل الصورة إلى أبيض وأسود خالص مسبقاً؟
في الغالب لا. يُنفّذ Tesseract البنرة داخلياً بطريقة Otsu، وعتبة يدوية صارمة بنسبة خاطئة تمحو خطوطاً خفيفة كان المحرك سيحتفظ بها. حوّل إلى التدرج الرمادي وسوّ الإضاءة بدلاً من ذلك، ثم دع المحرك يختار عتبته.
نصي أفقي ومائل. هل سيُدير OCR الصفحة تلقائياً؟
أحياناً. يمتلك Tesseract مرحلة للكشف عن الاتجاه، لكنها غير موثوقة مع النماذج والنص المتناثر أو الصفحات الغنية بالصور. تدوير الصفحة بنفسك 90 أو 180 أو 270 درجة خيار بلا خسارة ويُزيل التخمين، فهو الخيار الأكثر أماناً.
هل يُرفع مستندي في هذه العملية؟
لا. التدوير وتقويم الميل والاقتصاص والتحويل إلى التدرج الرمادي والـ OCR نفسه تعمل كلها داخل متصفحك. يستخدم OCR إصدار WebAssembly من Tesseract، وبيانات اللغة المدرَّبة تُنزَّل مرة واحدة وتُخزَّن في ذاكرة التخزين المؤقت. ملفك لا يغادر الجهاز قط.