وكلاء الذكاء الاصطناعي يواجهون صعوبة في التحقق من دقة المشاهد ثلاثية الأبعاد

قدّم باحثون من جامعة ماريلاند وAWS مشروع LEGO-Anything، الذي يحوّل صورة واحدة إلى مشهد ثلاثي الأبعاد قابل للتعديل عبر كتابة كود لبرنامج Blender ومراجعته على مراحل. ويكشف معيار LEGO-Bench أن وكلاء البرمجة ينجحون غالبًا في إنتاج مشهد قابل للاستخدام، لكن دقتهم الهندسية تتفاوت بشدة؛ فسجّل GPT-6 Astra نسبة ٥٣٫٤٪ في المشاهد الداخلية و٣٩٫٦٪ في الخارجية، مقابل نحو ١٥٪ للإعدادات الأضعف. ووجد الباحثون أن الوكلاء لا يحسنون تقييم تحسّن مشاهدهم، فطوّروا إضافة LEGO-Plugin تستبدل الحكم الذاتي بقياسات ملموسة وتحمي التعديلات الصحيحة، ورفعت أداء النماذج الأضعف بما يصل إلى ٦٢٫٧٪. ومع ذلك، تظل المشاهد المعاد بناؤها محدودة في مهام اكتشاف الأجسام وتقسيمها وتقدير العمق، ولا تزال بعيدة عن إعادة بناء دقيقة ووفية.
الحقائق الأساسية
يضم معيار LEGO-Bench ٢٠٨ صور مأخوذة من ١٠٤ مشاهد داخلية وخارجية، مع ٤٤٣ أصلًا مسجلًا.
«It contains 208 images from 104 indoor and outdoor scenes and uses 443 registered assets.»
عرض المصدر ←قفز أداء Astra في مجموعة اختبار مكتبية من ٣٢٫٣٪ إلى ٦١٫٨٪ عند زيادة ميزانية الاستدلال.
«Astra's score on an office test subset jumped from 32.3 to 61.8 percent.»
عرض المصدر ←حسّنت إضافة LEGO-Plugin أداء النماذج الستة، وكانت أكبر زيادة للنماذج الأضعف وبلغت ٦٢٫٧٪.
«Weaker agents saw the biggest gains, with boosts up to 62.7 percent.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر