← كل الأخبار
الذكاء الاصطناعي١٠ أغسطس ٢٠٢٦

مشروع FineBooks يطوّر تقنيات معالجة نصوص OCR لتدريب النماذج

شارك
مشروع FineBooks يطوّر تقنيات معالجة نصوص OCR لتدريب النماذج

اختبر مشروع FineBooks، وهو تعاون بين Hugging Face وEleutherAI، قدرة نماذج OCR مفتوحة الأوزان على تحويل صفحات الكتب التاريخية المصوّرة إلى بيانات تدريب أنظف للذكاء الاصطناعي. شملت التجربة ١٤ نموذجًا و٢٬١٦٥ صفحة، وتجاوزت دقة أفضلها ٩٧٪ على مستوى الحروف، بكلفة تقل عن دولارين لكل ألف صفحة. والمفارقة أن نماذج أصغر تفوقت على أخرى أكبر، فيما تعمل النماذج محليًا دون مفتاح API. ويرى المشروع أن النتائج مناسبة لتدريب نماذج اللغة، لكنها لا تزال غير دقيقة بما يكفي للاستخدام الأكاديمي، كما أن الاختبار اقتصر على أربعة لغات وصفحات الكتب ذات العمود الواحد.

الحقائق الأساسية

  • يستخدم النموذج المتصدر ٣ مليارات مَعلمة، بينما حلّ نموذج OvisOCR2 ثانيًا بحجم ٠٫٩ مليار مَعلمة وكلفة ٤٦ سنتًا لكل ألف صفحة.

    «The leading dots.mocr model uses just 3 billion parameters, while Qwen3.5-9B scores lower despite being nearly three times as large. OvisOCR2 takes second place with only 0.9 billion parameters at 46 cents per thousand pages.»
    عرض المصدر ←
  • استند التقييم إلى نسخ بشرية لستة مجلدات من مكتبة التراث الحيوي، كُتبت بالإنجليزية والفرنسية والألمانية واللاتينية.

    «That data is available under a CC-BY license in a GitHub repository and forms the basis of the new ground-truth dataset.»
    عرض المصدر ←
  • يخطط الفريق لإعادة معالجة نحو ٢٠٠ ألف وثيقة متاحة في الملكية العامة من مكتبة التراث الحيوي، ثم نشر النصوص كبيانات مفتوحة.

    «The team plans to reprocess about 200,000 public-domain BHL documents with one of the top models and release the text as an open dataset.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر