دراسة: نماذج الذكاء الاصطناعي لا تزال تعاني في الإدراك البصري

قدّمت Moonshot AI اختبارًا جديدًا باسم PerceptionBench لقياس الإدراك البصري في نماذج الذكاء الاصطناعي متعددة الوسائط، بعيدًا عن الاستدلال والمعرفة الخارجية. يقسم الاختبار القدرة البصرية إلى ١٠ مهارات، مثل العدّ وتحديد المواقع والتعرّف الدقيق وقراءة النصوص داخل الصور، وقد اختُبرت فيه ١٦ من أحدث النماذج. تصدّر GPT-5.6 Sol بنتيجة ٥٩.٧٪، لكن أي نموذج لم يتجاوز ٦٠٪، فيما رأى الباحثون أن أخطاء تُنسب عادةً إلى الاستدلال تبدأ أحيانًا من قراءة الصورة نفسها. وتتوفر مجموعة البيانات وشيفرة التقييم على GitHub.
الحقائق الأساسية
تنشر Moonshot AI ثلاثة آلاف مهمة من أصل أكثر من ١٧ ألف سؤال جرى التحقق منه؛ ٦٠٪ منها مبني على أخطاء نماذج موثقة و٤٠٪ أعيدت صياغتها باستخدام صور معززة.
«From an internal pool of over 17,000 verified questions, Moonshot AI is publishing 3,000 tasks. Sixty percent were derived from attributed model errors, while 40 percent were reformulated using augmented images.»
عرض المصدر ←سجّل GPT-5.6 Sol أعلى دقة عامة عند ٥٩.٧٪، يليه Kimi K3 بنسبة ٥٨.٥٪ ثم Claude Fable 5 بنسبة ٥٧.٢٪.
«Among the 16 frontier models tested, the highest overall accuracy is 59.7 percent, scored by GPT-5.6 Sol. Kimi K3 follows at 58.5 percent, Claude Fable 5 at 57.2 percent, and Gemini 3.1 Pro at 56.2 percent.»
عرض المصدر ←كان اكتشاف الهلوسة أضعف المهارات في المتوسط؛ إذ حقق GPT-5.6 Sol فيه ٢٦.٩٪ رغم تصدره الترتيب العام.
«On average, "hallucination" is the weakest skill across the board. GPT-5.6 Sol scores only 26.9 percent there despite taking the top spot overall, while the weaker Gemini 3.5 Flash ranks among the best with 50.6 percent.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر