بحث يستكشف قدرة المعلمين الآليين على تحديد توقيت المساعدة

قدّم فريق TutorMoments إطارًا لاختبار ما إذا كانت نماذج اللغة الكبيرة تعرف متى تساعد الطالب ومتى تترك له مساحة أكبر للتفكير. يعتمد الإطار على ٤٦٢ محادثة نصية مجهّلة من جلسات تدريس رياضيات فردية لطلاب أميركيين في الصفوف من الثاني إلى السابع، تضم أكثر من ١٥٠٠ لحظة تعليمية علّق عليها ٢٧ معلّمًا. وتُظهر النتائج الأولية أن النماذج تميل إلى تقديم دعم زائد بدل دفع الطلاب إلى التفكير الأعمق، فيما يحسّن توضيح هذا التوازن في التعليمات أداءها من دون أن يسد الفجوة مع التدريس البشري. وأُتيحت للمجتمع البحثي البيانات المجهّلة، وشيفرة التقييم، وإعادات الجلسات التي ولّدتها النماذج.
الحقائق الأساسية
يضم إصدار TutorMoments-Preview محادثات تدريس رياضيات فردية مجهّلة ومكتوبة فقط، مع أكثر من ١٥٠٠ لحظة علّم عليها المعلمون.
«The dataset we're releasing, TutorMoments-Preview, is 462 de-identified, text-only transcripts of real one-on-one math tutoring with U.S. students in grades 2-7, with more than 1,500 teacher-annotated key moments and several thousand free-text annotations from 27 U.S.-based teacher annotators.»
عرض المصدر ←عندما طُلب من النماذج أن تدرّس جيدًا فحسب، بالغت غالبًا في المساعدة ونادرًا ما دفعت الطلاب إلى تفكير أعمق.
«Told only to "tutor well," we find that models tend to over-help by giving too much support and rarely pushing students to do deeper thinking.»
عرض المصدر ←يتاح الإطار مع مجموعة بيانات مجهّلة، وشيفرة تشغيل مسار إعادة الجلسات، وإعادات النموذج للحظات التي جرى تقييمها.
«As part of our commitment to open research, we're releasing a dataset of de-identified tutoring transcripts, the code for running our replay pipeline, and the model tutor replays of the key moments we evaluated in those transcripts for reproducibility.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر