أوبن أيه آي تطلق مشروع GPT-Red لتعزيز قوة النماذج عبر التحسين الذاتي

أطلقت أوبن أيه آي نموذجًا داخليًا اسمته GPT-Red يعمل كهاكر اختبار أمني آلي يكتشف الثغرات في نماذجها عبر محاكاة هجمات حقن الأوامر. ويعتمد النموذج على تقنية التعلم المعزز باللعب الذاتي، حيث يهاجم بينما تدافع نماذج أخرى، فيتحسن الطرفان تدريجيًا. ونجح GPT-Red في إيجاد هجمات فعّالة في 84% من سيناريوهات الاختبار مقابل 13% فقط للفرق البشرية، واكتشف نمط هجوم جديد لم يُرَ من قبل يُسمى «سلسلة الأفكار المزيّفة». وبفضل التدريب ضد هذا الهاكر، انخفضت نسبة الاختراقات في نموذج GPT-5.6 إلى أقل من 23% بعد أن تجاوزت 90% في الإصدار السابق GPT-5، وسيبقى النموذج داخليًا ولن يُطرح للعموم.
الحقائق الأساسية
نجح GPT-Red في إيجاد هجمات فعّالة في 84% من سيناريوهات الاختبار مقابل 13% للفرق البشرية
«It finds successful attacks in 84 percent of test scenarios versus 13 percent for human red teamers.»
عرض المصدر ←انخفضت نسبة نجاح أقوى الهجمات إلى أقل من 23% ضد GPT-5.6 بعد أن تجاوزت 90% ضد GPT-5
«more than 90% of them worked against GPT-5 (released in August last year), and fewer than 23% worked against the new GPT-5.6.»
عرض المصدر ←اكتشف GPT-Red نمط هجوم حقن أوامر جديد أسماه الباحثون «سلسلة الأفكار المزيّفة» يخدع النموذج بإقحام مدخل زائف في ملاحظاته الداخلية
«GPT-Red found a way to insert a fake entry into another model's chain of thought that would trick that model into acting on spoofed information.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر