← كل الأخبار
الذكاء الاصطناعي٢٥ سبتمبر ٢٠٢٦

إطلاق معيار Terminal-Bench-Science لتقييم أداء الوكلاء في البحث العلمي

شارك

أعلن حساب @ArtificialAnlys إطلاق لوحة صدارة لمعيار Terminal-Bench-Science 0.1، المصمم لتقييم عمل وكلاء الذكاء الاصطناعي في البحث العلمي. ويتصدر GPT-6 Astra (max) الترتيب بنسبة ٦٣٪، يليه Claude Opus 5.5 (xhigh) بنسبة ٦٢٪. وكان الإصدار قد أُعلن في أغسطس ٢٠٢٦، بينما يشير المنشور إلى أنه بُني عبر رابط خارجي.

الحقائق الأساسية

  • يتصدر GPT-6 Astra (max) المعيار بنسبة ٦٣٪، يليه Claude Opus 5.5 (xhigh) بنسبة ٦٢٪.

    «GPT-6 Astra (max) and Claude Opus 5.5 (xhigh) currently top it at 63% and 62%»
    عرض المصدر ←
  • يختبر Terminal-Bench-Science 0.1 أداء الوكلاء في مهام البحث العلمي.

    «an agentic benchmark for scientific research work.»
    عرض المصدر ←
  • أُعلن عن الإصدار 0.1 في أغسطس 2026.

    «Terminal-Bench-Science 0.1 was announced in August 2026»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر