نموذج "أوركا" الصيني يحقق أداءً متفوقاً في الروبوتات دون الحاجة لبيانات حركية

طرح معهد بكين للذكاء الاصطناعي نموذجًا أطلق عليه اسم «أوركا» يتنبأ بالحالة القادمة للعالم في تمثيل داخلي مجرد بدل التنبؤ بالكلمات أو الإطارات المرئية التقليدية. دُرّب النموذج على 125 ألف ساعة من الفيديو و160 مليون وصف للأحداث دون أي بيانات حركية موصومة، ومع ذلك جارى أنظمة متخصصة في خمس مهام روبوتية كترتيب الكتب وترصيق الأوعية. يعتمد أوركا على نواة لغوية بصرية مجمّدة مع رؤوس إخراج قابلة للتبديل، ويتفوق على مولدات صور مخصصة في دقة توقع المشهد الناتج عن الأوامر. يفتح هذا المسلك طريقًا لتخفيف النقص المزمن في بيانات الإجراءات الموثقة في مجال الروبوتات.
الحقائق الأساسية
نموذج أوركا دُرّب على 125 ألف ساعة فيديو و160 مليون وصف حدث و11.5 مليون زوج سؤال-جواب، واستُخدم منها عُشر البيانات فقط في النسخة الحالية
«For training, the researchers put together 125,000 hours of video footage, 160 million event descriptions, and 11.5 million question-answer pairs.»
عرض المصدر ←في خمس مهام تشغيل لروبوت ذراعين على عجلات، جارى أوركا نظام π0.5 المبني خصيصًا على بيانات الروبوت رغم أن نموذجه الأساسي لم يرَ أي بيانات حركية أثناء التدريب المسبق
«In five manipulation tasks using a two-armed humanoid robot on wheels, including shelving books, stacking bowls, and scooping sugar, Orca matches π0.5, a system built specifically on robot data.»
عرض المصدر ←في معيار توليد الصور PRICE-V0.1، حقق أوركا-4 مليار 59.8% متفوقًا على مولدات صور متخصصة كـ FLUX.2 small (56.1%) وFLUX.1-context (40.9%)
«Orca-4B hits 59.8 percent on average, beating specialized image generators like FLUX.2 small (56.1 percent), FLUX.1-context (40.9 percent), and OmniGen2 (39.6 percent).»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر