OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections
قدّمت OpenAI نموذج GPT-6 Astra، الذي يخطئ في المعلومات أقل من GPT-5.6 Sol ويصدّ هجمات حقن الأوامر المباشرة بمعدل ٩٩.٩٩٪. وفي اختبارات كسر الحواجز، رفض Astra الطلبات الضارة في ٩١.٥٪ إلى ٩٨.٣٪ من الحالات، لكن دفاعه تراجع إلى نحو ٦٧٪ أمام مهاجمين يغيّرون أساليبهم عبر جولات محادثة متعددة. أما الأوامر الخفية المزروعة داخل المستندات، فانخفض معدل نجاحها من ٢٧٪ مع النموذج السابق إلى ٨.٥٪ مع Astra، وفق اختبار أجرته شركة Gray Swan الأمنية على ١٬٨١٠ هجمات. وتظل النتيجة مهمة لمن يستخدم وكلاء يقرؤون المستندات ويشغّلون الأدوات، لأن النموذج قد يُخدع في نحو حالة من كل ١٢ سيناريو.
الحقائق الأساسية
استخدمت OpenAI أسلوب GPT-Red، الذي يستعين بمهاجم آلي لتقوية النموذج أثناء التدريب ضد حقن الأوامر المباشرة.
«OpenAI credits its GPT-Red method for this, which uses an automated attacker to harden the model during training.»
عرض المصدر ←في الاختبار نفسه، كان معدل فشل Claude Opus 5 أمام الأوامر الخفية ٤.٨٪، مقارنةً بـ٨.٥٪ لـAstra.
«Claude Opus 5 did better at 4.8 percent in the same evaluation, but it wasn't immune either.»
عرض المصدر ←أُجريت اختبارات كسر الحواجز على النموذج الأساسي من دون طبقات الأمان الإنتاجية، مثل المصنّفات، الموجودة في المنتج الفعلي.
«OpenAI notes that these tests ran on the bare model without the production safety layers like classifiers that ship with the actual product.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر