الذكاء الاصطناعي١٠ أكتوبر ٢٠٢٦
شاومي تنشر ورقة بحثية حول نموذج MiMo-V2.6 ذاتي التدريب

نشرت شاومي ورقة عن MiMo-V2.6، الذي يتولى جانبًا كبيرًا من دورة تدريبه بنفسه، بحسب منشور @rohanpaul_ai على إكس. وتبني الوكلاء المهام وتراجع الاختبارات وتقيّم الإجابات وتبحث عن أساليب التحايل، فيما يحدد البشر الميزانية والقواعد. ويشير المنشور إلى أن نماذج الوكلاء واصلت التحسن كلما زادت حوسبة التعلم بالتعزيز.
الحقائق الأساسية
يتولى النموذج جانبًا كبيرًا من دورة تدريبه، فيما يضع البشر الميزانية والقواعد.
«In MiMo-V2.6, AI runs much of its own training loop: agents build the tasks, audit the tests, grade the answers and hunt for cheats. Humans set the budget and the rules.»
عرض المصدر ←استمرت نماذج الوكلاء في التحسن مع زيادة حوسبة التعلم بالتعزيز.
«shows that agent models kept improving with more RL compute»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر