الذكاء الاصطناعي١٦ أغسطس ٢٠٢٦
نموذج GPT-5.6 Luna Max يتفوق على Sonnet 5 Max في اختبارات البرمجة

أظهر اختبار لوكلاء البرمجة تفوق GPT-5.6 Luna Max على Sonnet 5 Max بفارق ١٣٫٣ نقطة، بحسب منشور @reach_vb على إكس. ويقيس اختبار DeepSWE v1.1 أداء الوكلاء في ١١٣ مهمة هندسية أصلية وطويلة الأمد، بينما سجل Luna نسبة ٦٧٫٢٪ بتكلفة ٠٫٦١ دولار للمهمة. كما تفوق على Gemini 3.7 Flash Medium بفارق ١٫٧ نقطة، مع تكلفة أقل بنسبة ٧٠٪، في حين بلغت تكلفة Sonnet ٤٤ ضعفًا.
الحقائق الأساسية
اختبار DeepSWE v1.1 يضم ١١٣ مهمة هندسية أصلية وطويلة الأمد لتقييم وكلاء البرمجة.
«DeepSWE tests coding agents on 113 original, long-horizon engineering tasks.»
عرض المصدر ←سجل Luna نسبة ٦٧٫٢٪ بتكلفة ٠٫٦١ دولار للمهمة، متقدمًا على Gemini 3.7 Flash Medium بفارق ١٫٧ نقطة.
«Luna posts 67.2% at $0.61/task, 1.7 points above Gemini 3.7 Flash Medium at 70% lower cost.»
عرض المصدر ←كانت تكلفة Sonnet أعلى بـ٤٤ مرة من تكلفة Luna.
«GPT-5.6 Luna Max scores 13.3 points above Sonnet 5 Max on DeepSWE v1.1 while Sonnet costs 44x as much.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر