استخراج النصوص من الصور (Offline OCR) والتعرف الضوئي على الحروف
يعد التعرف الضوئي على الحروف (Optical Character Recognition - OCR) تقنية ثورية لتحويل النصوص المطبوعة في الصور، والمستندات الممسوحة ضوئياً، ولقطات الشاشة، وملفات PDF المصورة إلى نصوص رقمية قابلة للنسخ والبحث والتعديل. في حين تتطلب معظم خدمات OCR إرسال وثائقك إلى خوادم سحابية للتعرف عليها، توفر لك أداتنا تجربة فريدة تعمل بالكامل دون اتصال بالإنترنت.
تستخدم الأداة نموذج Tesseract OCR المتطور المترجم إلى WebAssembly داخل متصفحك مباشرة للتعرف على مختلف اللغات بدقة متناهية. تتم المعالجة محلياً 100% داخل المتصفح لضمان حماية وسرية وثائقك وعقودك الهامة.
البنية الأساسية والمعادلة الرياضية
الصورة المدخلة ➔ معالجة التباين وتعديل المنظور ➔ تجزئة الحروف والكلمات ➔ مطابقة الأنماط بالذكاء الاصطناعي ➔ النص المستخرج
يقوم المحرك بتحويل الصورة إلى أبيض وأسود عالي التباين، ورصد الأسطر النصية، ومقارنة أشكال الحروف بقاعدة بيانات الخطوط المدربة لاستخراج الكلمات بدقة.
أفضل الممارسات والإرشادات الأساسية
- التقاط صور ذات إضاءة ممتازة وتباين حاد: يعمل محرك OCR بأعلى كفاءة عندما تكون الحروف سوداء داكنة فوق خلفية بيضاء نقية وخالية من الظلال.
- تجنب التقاط الصور بزوايا مائلة أو مشوهة: احرص على أن تكون الكاميرا موازية لسطح الورقة تماماً لتكون الأسطر مستقيمة وأفقية لتسهيل رصد الكلمات.
- اختيار لغة المستند الصحيحة قبل بدء الاستخراج: حدد لغة النص (العربية، الإنجليزية، أو غيرها) بدقة ليستخدم المحرك القاموس والشبكة العصبية المناسبة لتلك اللغة.
- مراجعة وتدقيق النص المستخرج للكلمات النادرة: رغم دقة المحرك الفائقة، إلا أن الكلمات المكتوبة بخطوط يد غير منتظمة أو نصوص الإيصالات الباهتة قد تتطلب مراجعة بشرية طفيفة.