الذكاء الاصطناعي٢٥ سبتمبر ٢٠٢٦
إطلاق معيار Terminal-Bench-Science لتقييم أداء الوكلاء في البحث العلمي
أعلن حساب @ArtificialAnlys إطلاق لوحة صدارة لمعيار Terminal-Bench-Science 0.1، المصمم لتقييم عمل وكلاء الذكاء الاصطناعي في البحث العلمي. ويتصدر GPT-6 Astra (max) الترتيب بنسبة ٦٣٪، يليه Claude Opus 5.5 (xhigh) بنسبة ٦٢٪. وكان الإصدار قد أُعلن في أغسطس ٢٠٢٦، بينما يشير المنشور إلى أنه بُني عبر رابط خارجي.
الحقائق الأساسية
يتصدر GPT-6 Astra (max) المعيار بنسبة ٦٣٪، يليه Claude Opus 5.5 (xhigh) بنسبة ٦٢٪.
«GPT-6 Astra (max) and Claude Opus 5.5 (xhigh) currently top it at 63% and 62%»
عرض المصدر ←يختبر Terminal-Bench-Science 0.1 أداء الوكلاء في مهام البحث العلمي.
«an agentic benchmark for scientific research work.»
عرض المصدر ←أُعلن عن الإصدار 0.1 في أغسطس 2026.
«Terminal-Bench-Science 0.1 was announced in August 2026»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر