تحسين أداء وكيل ذكاء اصطناعي إنتاجي عبر الانتقال إلى نموذج GPT-5.6

أعلنت شركة Ploy انتقال وكيل الذكاء الاصطناعي الإنتاجي الخاص بها إلى نموذج GPT-5.6 Sol الذي أصدرته OpenAI، ليحل محل Claude Opus 4.8 الذي ظلّ النموذج الافتراضي لأربعة أشهر. جاء القرار بعد أن تفوّق النموذج الجديد في الاختبارات المباشرة، حيث أنهى المهام في أقل من نصف الوقت وبكلفة أقل بنسبة 27% مع جودة مماثلة أو أفضل. لكن الانتقال لم يكن سلسًا، إذ كشف فريق Ploy أن ثلث الإخفاقات الأولية تعود لافتراضات في بيئة الاختبار كانت مُهيّأة خصيصًا للنموذج السابق وليست أخطاءً في النموذج الجديد. كما اكتشفوا مشكلة جوهرية في استدعاء الأدوات، حيث يرسل GPT-5.6 جميع المعاملات الـ25 حتى غير المستخدمة مع اختراع قيم افتراضية، ما أدى إلى قراءة ملفات فارغة في 52% إلى 64% من الحالات، وهو سلوك لا يُحل بالتوجيه النصي بل بتعديل المخطط عند حدود المزود.
الحقائق الأساسية
انتقل وكيل Ploy الإنتاجي إلى GPT-5.6 Sol ليحل محل Claude Opus 4.8 الذي شغل الموقع الافتراضي لأربعة أشهر
«For the four months Opus held the default slot (first Opus 4.7, then 4.8), nothing we tested beat it. GPT-5.6 is the first model that did.»
عرض المصدر ←حقق النموذج الجديد إنجاز المهام بسرعة 2.2 ضعف وبتكلفة أقل بنسبة 27% مع نصف عدد رموز الإخراج تقريبًا
«This is the shape of the promise: 2.2× faster to a finished page, 27% cheaper, and about half the output tokens.»
عرض المصدر ←كان GPT-5.6 يرسل جميع المعاملات الـ25 في كل استدعاء أداة ويخترع قيمًا للمعاملات غير المستخدمة، مما أدى إلى قراءة ملفات فارغة في 52% إلى 64% من الحالات
«52% to 64% of GPT-5.6’s file reads were coming back empty because of it.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر