هاجينج فيس تناقش تحديات موثوقية وكلاء الذكاء الاصطناعي
عرضت هاجينج فيس طريقة لقياس موثوقية وكلاء الذكاء الاصطناعي، لا عبر متوسط النجاح فحسب، بل عبر قدرتهم على تكرار النتيجة نفسها في المهمة ذاتها. وتضيف الطريقة نوعًا جديدًا من الإرشادات إلى نظام ALTK-Evolve، بعد أن يحلل Consistency Analyzer خطوات القرار التي قد تتبدل من تشغيل إلى آخر. وفي اختبار وكيل ReAct مدعوم بـGPT-4.1 على AppWorld، بلغ النجاح المتوسط ٧٧٫٤٪، لكن النجاح في التشغيلات الخمس كلها اقتصر على ٥٣٫٠٪ من المهام. ويقول المقال إن تحويل نتائج التشخيص إلى إرشادات خفّض فجوة الاتساق من ٢٤٫٤ نقطة مئوية إلى ١٢٫٠ نقطة، من دون تراجع في متوسط الدقة.
الحقائق الأساسية
يقيس Consistency Analyzer نقاط القرار المعرّضة للتبدّل عبر إعادة أخذ عينات من مسار مسجّل، باستخدام إكمالات عدة في استدعاء واحد لكل خطوة، وبقيمة افتراضية k=5.
«It needs one trace and no ground truth — it resamples each decision point in that trace with a single call requesting k completions (k=5 by default), rather than re-running the task end-to-end.»
عرض المصدر ←أدى تحويل التشخيص إلى إرشادات إلى تقليص فجوة الاتساق بمقدار ١٢٫٤ نقطة مئوية، مع زيادة النجاح في المهام نفسها ١٦٫٠ نقطة مئوية.
«Turning that diagnosis into guidelines halves the gap — from 24.4pp to 12.0pp (same-task Pass⁵ +16.0pp, similar-task +13.0pp), without costing anything in average accuracy.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر