باحثو جوجل يطورون تقنية لمنع وكلاء الذكاء الاصطناعي من حفظ الاختبارات

طوّر باحثون من Google Cloud AI Research وجامعات عدة طريقةً للحد من حفظ وكلاء الذكاء الاصطناعي مهام اختباراتهم أثناء تحسين بيئة عملهم ذاتيًا. وتعمل طريقة RRSI على تقليص عدد التعديلات المسموح بها تدريجيًا، مع مراجع ينتقي التغييرات التي لا تعتمد على أسماء المهام أو حيل خاصة بالاختبار. اختُبرت الطريقة على ٨ معايير في البرمجة والعمل المكتبي وتصميم الهندسة، فحققت زيادة تصل إلى ٤٫٧ نقاط في ٥ معايير لم ترها سابقًا، مع استهلاك رموز أقل بنحو ٣٠٪ أثناء التشغيل. ويقول الباحثون إن التجربة اقتصرت على بيئات مبنية حول نماذج ثابتة، بينما الكود متاح على GitHub.
الحقائق الأساسية
حققت RRSI زيادة تصل إلى ٤٫٧ نقاط في معايير لم تُستخدم في تدريبها.
«According to the paper, RRSI gains up to 14.1 points on the tasks it was trained on and up to 4.7 points on five benchmarks it never saw.»
عرض المصدر ←استهلكت الطريقة نحو ٣٠٪ رموز أقل أثناء التشغيل مقارنة بالنسخة غير المقيّدة.
«It also uses about 30 percent fewer tokens at runtime than the unregularized version.»
عرض المصدر ←تستبعد آلية التقييم التغييرات التي تثبّت أسماء المهام أو حلولها أو حيلًا مرتبطة بمعيار اختبار محدد.
«When it comes to picking changes, a critic reviews every proposal and throws out any that hardcode task names, solutions, or other benchmark-specific tricks.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر