OCR Advanced — مقارنة + Auto-Routing
الترتيب الذهبي (محدّث 2026-05-24 بعد التحليل المقارن)
| الترتيب | الأداة | الأقوى في | السرعة | التكلفة | |---|---|---|---|---| | 1 | Gemini 3.5 Flash Vision | كل اللغات + handwriting + layouts معقدة + جداول | ⚡⚡ | $0.15/M cached | | 2 | GPT-5.6 Sol Vision | bilingual معقد + reasoning مع النص | ⚡⚡ | متوسط | | 3 | Mathpix | رياضي/معادلات + LaTeX + عربي علمي | ⚡⚡ | API key مدفوع | | 4 | PaddleOCR ⭐ مجاني | جداول معقدة + chinese/asian + structured docs | ⚡⚡⚡ | مجاني محلي | | 5 | EasyOCR ⭐ مجاني | 80+ لغة + sample سريع | ⚡⚡ | مجاني محلي | | 6 | Tesseract 5.5 ⭐ مجاني | نصوص مطبوعة واضحة | ⚡⚡⚡ | مجاني محلي |
نتيجة المقارنة (الصراحة)
PaddleOCR vs Tesseract
- ✅ PaddleOCR يتفوق في: جداول هندسية، layouts معقدة (BOQ, drawings), chinese/japanese/korean
- ✅ Tesseract يبقى الأسرع للنص المطبوع البسيط
- القرار: الاثنين يكملون بعض، PaddleOCR طبقة جديدة قوية
EasyOCR vs Tesseract
- ✅ EasyOCR أفضل للصور غير الواضحة + خطوط متنوعة + scene text
- ✅ EasyOCR يفهم arabic/urdu/persian أفضل في الصور المنحنية
- القرار: يضيف قيمة فعلية — مفيد للصور من الموبايل بزوايا غير مثالية
Gemini Vision vs الكل
- ✅ Gemini 3.5 Flash يتفوق في كل شي عملياً للحالات الصعبة (يفهم context, ينظف noise, يفهم arabic handwriting)
- ❌ لكنه online + يكلف API call
Auto-Routing الذكي
صورة جديدة:
├─ نص بسيط واضح → Tesseract (مجاني, محلي, فوري)
├─ جدول/layout معقد → PaddleOCR (مجاني, ممتاز للهياكل)
├─ صورة من موبايل غير مثالية → EasyOCR (مجاني, robust)
├─ خط يدوي / لغة نادرة / scientific → Gemini 3.5 Flash Vision
├─ معادلات / LaTeX → Mathpix
استخدام موحّد
python
scripts/ocr_smart.py auto image.jpg --lang ara+eng --to-lang en
يختار الأداة الأنسب تلقائياً + يترجم لو طُلب
الناتج: نص → ترجمة → تنسيق Markdown نظيف