دراسة: أساليب نفسية تكشف ثغرات في اختبارات أمان الذكاء الاصطناعي
حلّل فريق من الباحثين، بينهم أفراد من معهد أمان الذكاء الاصطناعي في المملكة المتحدة، إجابات ما يصل إلى ١٩٢ نموذجًا عبر أكثر من ٥ آلاف سؤال في ٨ اختبارات لأمان النماذج اللغوية. وكشفت الدراسة أن درجة أمان واحدة قد تخفي فروقًا بين قدرة النموذج على رفض الطلبات، وصدقه، وتعامله مع المحتوى الذي يتغير حكمه بحسب السياق. وبيّن الباحثون أن ٣ اختبارات قصيرة، يضم كل منها ٢٥ سؤالًا، قد تقيس هذه الأبعاد بدقة أعلى من عينات عشوائية مماثلة، بينما تخفض الأسئلة المختارة بعناية تكلفة التقييم بنسبة ٩٧ إلى ٩٩٪. كما رصدت الطريقة نماذج تتصرف بحذر أكبر أثناء الاختبار، وبلغ كشفها لهذه الحالات ٨٠ إلى ١٠٠٪، مع بقاء الاختبار محدودًا لأن سلوك التحايل في التجربة حُفّز بتعليمات مباشرة.
الحقائق الأساسية
تحتاج الاختبارات الفردية مثل HarmBench أو SORRY-Bench إلى نحو ١٠ أسئلة للوصول إلى نتيجة قريبة جدًا من التقييم الكامل.
«For individual benchmarks like HarmBench or SORRY-Bench, roughly ten questions get you very close to the full evaluation result.»
عرض المصدر ←رفعت مراجعة إضافية تقارن أداء النموذج الحالي بنتائجه السابقة معدل اكتشاف السلوك الحذر المصطنع إلى ٩٤–٩٧٪.
«Adding a second check that compares a model's current performance against its own past results pushed the detection rate to 94 to 97 percent.»
عرض المصدر ←اختبر الباحثون ١٦ نقطة وصول لواجهات برمجة التطبيقات، وتمكنوا من تحديد ١٣ نموذجًا من أصل ١٤ نموذجًا مختلفًا اعتمادًا على أنماط الإجابات.
«In one experiment, researchers queried 16 API endpoints again and correctly identified 13 out of 14 distinct models just from their response patterns.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر