بحث: نماذج العالم التي تتجاهل المعتقدات البشرية تتوقع أفعالًا خاطئة
تجادل ورقة جديدة بأن نماذج العالم التي تكتفي بتمثيل الأشياء وحركتها قد تتوقع أفعال البشر خطأً، لأنها تتجاهل معتقداتهم ونواياهم وحالاتهم الاجتماعية. ويقترح الباحثون إطار «نمذجة العالم العقلي» (MWM)، الذي يربط بين التغيرات الفيزيائية والمتغيرات الذهنية، ثم يختبر الخيارات وفق plausibility الفيزيائية والاتساق العقلي والملاءمة الاجتماعية. وفي تطبيق مرجعي اسمه MENTIS، ارتفع مقياس F1 من ٦٣٫٣ للإجابات المباشرة إلى ٨٧٫٩ عبر الإطار الكامل، مقابل ٩٨٫٥ للبشر، ضمن اختبار شمل ٤٤٨ مشهد قرار. وكان أكبر تحسن في المشاهد التي تتضمن تفاعلًا بين الأشخاص، بينما ظلّت محاكاة انتقال الحالة العقلية والفيزيائية معًا أكبر عنق زجاجة.
الحقائق الأساسية
ضمّ الاختبار ٤٤٨ مشهد قرار، احتوى كل منها على ستة خيارات وإجابة مرجعية أعدّها بشر.
«For evaluation, the authors built Menti-Bench, a dataset of 448 decision scenes: 320 text descriptions, 100 picture stories, and 28 sound-video clips. Each scene contains six response options and a human-created reference solution that documents not just the correct action but also the underlying mental and physical states.»
عرض المصدر ←وصلت دقة الإطار الكامل إلى ٨٧٫٩، مقارنةً بـ٦٣٫٣ للإجابة المباشرة و٩٨٫٥ للبشر.
«Direct answers land at 63.3. Self-consistency, where the model answers the same question six times and picks the most common response, pushes that to 77.9. The full MWM pipeline reaches 87.9. Humans hit 98.5 under the same protocol.»
عرض المصدر ←تحسّن الأداء في المشاهد الشخصية بمقدار ٢٦٫٤ نقطة، مقابل ١٤ نقطة في المشاهد التي تركز على الأشياء.
«In interpersonal scenes, the F1 score improves by 26.4 points. In object-focused scenes, the gain is only 14.0.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر