بحث: تدريب النماذج اللغوية على محتوى مبسط يغير قدراتها

قدّم مؤلفو ورقة LittleLearner نماذج لغوية دُرّبت من الصفر على محتوى يطابق منهج المرحلة الابتدائية الأمريكية، لاختبار حدود ما تتعلمه من بياناتها. اعتمد المشروع مجموعة بيانات من ٨٨ مليار رمز، واستبعد المفاهيم والمعلومات والمفردات التي تُدرّس بعد الصف الخامس، ثم درّب نماذج بأحجام ٠٫٦ و١٫٣ و٥ مليارات مُعامل مع نماذج ضابطة غير مفلترة. أظهرت التجارب أن تكبير النموذج والتدريب اللاحق والتعلّم من سياق المحادثة عززت قدراته ضمن نطاق المنهج، لكنها لم تحسن أداءه بوضوح في المهام التي تقع خارجه؛ ما يشير إلى أن بيانات التدريب المسبقة ترسم سقف قدراته الفعلي.
الحقائق الأساسية
تتوافر نماذج LittleLearner بثلاثة أحجام: ٠٫٦ و١٫٣ و٥ مليارات مُعامل، ولكل منها نموذج ضابط غير مفلتر يطابقه في البنية وعدد الرموز ووصفة التدريب.
«Three scales (0.6B / 1.3B / 5B) trained from scratch on LittleCurriculum: chattable models with an interpretable knowledge boundary. Each ships with a matched Unfiltered control for clean comparison.»
عرض المصدر ←التدريب اللاحق عبر GRPO رفع أداء النماذج في قدرات الصفوف من الروضة إلى الخامس، لكنه لم يستعد قدرات المهام الأبعد من هذا النطاق.
«Post-training through GRPO significantly boosts in-scope K–5 capabilities, but fails to recover out-of-scope beyond-K–5 capabilities, even when training with out-of-scope data.»
عرض المصدر ←تستند LittleCurriculum إلى بيانات FineWeb-Edu بعد خمس مراحل تصفية مرتبطة بمعايير Common Core للصفوف من الروضة إلى الخامس.
«An 88B-token corpus distilled from FineWeb-Edu through a five-stage filtering pipeline aligned with Common Core standards (K–5). Concepts, facts, and vocabulary taught above Grade 5 are explicitly excluded.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر