← كل الأخبار
الذكاء الاصطناعي٥ سبتمبر ٢٠٢٦

أرتيفيشال أناليسيس تعيد هيكلة مؤشرها بعد تشكيك في نتائج Astra

شارك

أطلقت أرتيفيشال أناليسيس الإصدار 4.2 من مؤشر الذكاء بعد انتقادات لعدم عكس تقييماته تقدّم GPT-6 Astra كما ينبغي. رفع التحديث نتيجة Astra أربع نقاط مقارنة بسلفه، لكنه أبقى Claude Fable 5.1 في الصدارة، تليه Astra ثم Meta. وأضاف المؤشر اختبارَي AA-Briefcase وGDP.pdf، وأسقط GPQA-Diamond بعدما حُلّت أسئلته، ورفع وزن البيانات الخاصة إلى 40٪ للحد من التلاعب بالنتائج. وتقول الشركة إن الإصدار الخامس قيد التطوير منذ ثمانية أشهر وسيصل على مراحل.

الحقائق الأساسية

  • أضاف الإصدار الجديد اختبارين للعمل المعرفي الواقعي وتحليل مستندات PDF، وأسقط اختبارًا آخر بعدما تمكنت النماذج من حله.

    «The index adds two new benchmarks: AA-Briefcase for real-world knowledge work and GDP.pdf from Surge AI for PDF document analysis. GPQA-Diamond has been dropped because models have solved it.»
    عرض المصدر ←
  • تمثل بيانات الاختبارات الخاصة 40٪ من أوزان المؤشر بعد التحديث، بهدف جعل التحايل على التقييم أصعب.

    «Private test data now makes up 40 percent of the weighting to make gaming harder.»
    عرض المصدر ←
  • احتلت Claude Fable 5.1 المركز الأول، وجاءت Astra ثانية وMeta ثالثة، بينما استخدمت Astra عددًا أقل من الرموز في كل مهمة مقارنةً بسائر النماذج الرائدة.

    «Anthropic's Claude Fable 5.1 still leads the ranking, followed by Astra in second and Meta in third. Astra also uses fewer tokens per task than every other frontier model, according to Artificial Analysis.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر