← كل الأخبار
الذكاء الاصطناعي٢٦ يوليو ٢٠٢٦

Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence

شارك
Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence

حقّق نموذج «أوبوس 5» من شركة أنثروبيك رقمًا قياسيًا جديدًا في اختبار «ARC-AGI-3» المصمم لقياس الذكاء العام، إذ سجّل 30.2% متجاوزًا الرقم السابق البالغ 7.8% الذي سجّله نموذج «GPT-5.6 Sol» من أوبن إيه آي. يعود هذا التفوّق وفق فريق الاختبار إلى قدرة استدلال منطقي أقوى مكّنت النموذج من حل خمس بيئات لم تُحل من قبل، أربع منها بمستوى يضاهي البشر أو يفوقهم، مع ظهور سلوكيات غير مسبوقة كترجمة المهام إلى رموز جبرية وصياغة معادلات تأملية بشكل مستقل. في المقابل، تشير اختبارات مستقلة على معيار «Witness» إلى أن مكاسب النموذج قد تكون أضيق وتتجه نحو التخصص في أنماط الألغاز، رغم عدم نفي باحثين لاحتمالية وجود تحسّن أوسع في الاستدلال.

الحقائق الأساسية

  • سجّل نموذج أوبوس 5 من أنثروبيك 30.2% في اختبار ARC-AGI-3، متجاوزًا الرقم القياسي السابق البالغ 7.8% لنموذج GPT-5.6 Sol من أوبن إيه آي.

    «Anthropic's Claude Opus 5 scored 30.2 percent on the ARC-AGI-3 benchmark, nearly four times the previous record of 7.8 percent set by OpenAI's GPT-5.6 Sol (Max).»
    عرض المصدر ←
  • أظهر النموذج سلوكيات غير مسبوقة من أي نموذج ذكاء اصطناعي، مثل ترجمة المهام إلى رموز جبرية وصياغة معادلات تأملية بشكل مستقل، وحل خمس بيئات لم تُحل سابقًا.

    «Opus 5 displayed behavior not previously seen from an AI model, including translating tasks into algebraic notation and independently formulating reflection equations, while also solving five previously unsolved environments.»
    عرض المصدر ←
  • أظهرت اختبارات مستقلة على معيار Witness أن أوبوس 5 سجّل 43.4 نقطة، متعادلًا إحصائيًا مع نموذجي Kimi K3 وFable 5، بتحسّن أقل مقارنة بأدائه في ARC-AGI-3.

    «Opus 5 scored 43.4, statistically tying Kimi K3 and Fable 5 while improving far less over Opus 4.8 than it did on ARC-AGI-3.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر