Goodfire تطلق نظام مراقبة داخلي لرصد وكلاء الذكاء الاصطناعي

أطلقت Goodfire مراقبات تتابع الإشارات الداخلية لنموذج الذكاء الاصطناعي أثناء عمله، بدل الاكتفاء بقراءة ما ينتجه، وتقول إن هذا النهج أقل كلفة. ترصد مجسّات صغيرة كل خطوة، ولا يستدعي الأمر نموذجًا ثانيًا للتدقيق إلا إذا رصد أحدها إشارة مقلقة. ويمكن لعملاء Baseten اختيار المخاطر التي يتابعونها، مثل الاختراق، وتحديد الاستجابة بين تسجيل الواقعة أو إحالتها لمراجعة بشرية أو رفض الطلب. وفي اختبارات الشركة على Kimi K3، كلفت مراقبة نحو ١٥٠٠ جلسة قرابة ٥١ دولارًا، وأتاحت المراقبات لعملاء Baseten.
الحقائق الأساسية
يمكن لعملاء Baseten تحديد المخاطر التي تراقبها المنظومة والاستجابة الآلية لها.
«Baseten customers can choose which risks to monitor, including offensive hacking, chemical and biological weapons misuse, and reward hacking. They also decide the automated response: logging the event, sending it for human review, or refusing the request entirely.»
عرض المصدر ←كلفت مراقبة نحو ١٥٠٠ جلسة على Kimi K3 قرابة ٥١ دولارًا، ورصدت ٩٤٪ من جلسات الاختراق الخبيثة.
«In Goodfire’s tests on Kimi K3, monitoring about 1,500 sessions cost roughly $51, compared with $233 for a cheaper AI model checking every step and about $10,000 for a top-tier one. The probes caught 94% of malicious hacking sessions and sent 8.7% of harmless ones for a second look.»
عرض المصدر ←أضاف تشغيل أربعة مجسّات أقل من ٢٪ إلى وقت بدء النموذج في الرد.
«Running four probes at once added less than 2% to the time it takes the model to start responding, the company said.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر