← كل الأخبار
الذكاء الاصطناعي١٣ سبتمبر ٢٠٢٦

إطلاق معيار Real-SWE لتقييم نماذج الذكاء الاصطناعي في البرمجيات

شارك

أُطلق معيار Real-SWE لتقييم نماذج الذكاء الاصطناعي على قواعد شيفرة خاصة وحقيقية تستخدمها شركات في الإنتاج، بدل الاكتفاء بمهام مصطنعة أو عامة. تأتي المهام من مشكلات هندسية فعلية، وقد تتطلب فهم قواعد الفوترة والضرائب والعمل عبر خدمات وقواعد بيانات وأدوات متعددة، فيما يُقيَّم النموذج مع بيئة التشغيل التي يعمل داخلها لا بمعزل عنها. وأخفق ٧١.٤٪ من الاختبارات التي استغرقت أقل من ١٠ دقائق، مقابل ٧٣.٤٪ للاختبارات الأطول، ما يعكس صعوبة التعامل مع منطق الأعمال وأنماط البرمجة الخاصة بكل شركة.

الحقائق الأساسية

  • تستخدم المهام قواعد شيفرة خاصة بُنيت لمنتجات حقيقية، ولا تتاح شيفرتها وحلولها على الإنترنت العام.

    «Each task comes from a private production codebase that we licensed from a real-world company.»
    عرض المصدر ←
  • يختبر المعيار تركيبة النموذج وبيئة التشغيل التي يعمل فيها، لا النموذج منفردًا.

    «We use native harnesses to reflect how enterprise engineers work in practice, evaluating model-and-harness combinations rather than models in isolation.»
    عرض المصدر ←
  • بلغ معدل الإخفاق ٧١.٤٪ في الاختبارات الأقصر من ١٠ دقائق، و٧٣.٤٪ في الاختبارات الأطول.

    «71.4% of rollouts under 10 minutes failed, compared with 73.4% of longer rollouts.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر