نتليفاين تنشر مقارنة لأداء 11 نموذج ذكاء اصطناعي

أطلقت نتليفاين شراكة مع OpenRouter لتوسيع النماذج المتاحة عبر بوابة الذكاء الاصطناعي وميزة Agent Runners. وأتاحت الشركة نماذج مفتوحة حديثة مثل Kimi K3 وGLM 5.2 وDeepSeek V4، إلى جانب Claude Agent وOpenAI Codex وGemini CLI، مع إضافة OpenCode خيارًا جديدًا للوكيل. واختبرت نتليفاين النماذج بإعداداتها الافتراضية عبر بناء صفحة ثابتة لمقهى، ثم قارنت المواقع الناتجة واستهلاك الأرصدة، وشغّلت كل نموذج ٣ مرات. وتوضح الشركة أن GPT 5.6 Sol يعمل افتراضيًا بإعداد جهد منخفض لتقديم خيار أوفر من Opus، مع إمكانية تغيير هذا الإعداد.
الحقائق الأساسية
شملت الاختبارات بناء صفحة لمقهى محلي، ثم إضافة خيار بسيط لحجز المقاعد في طلب لاحق.
«A site for a local coffee shop. LLMs just love making sites for local coffee shops! The initial prompt is simple, and a static site with no fancy database or the like will do. Then we do a follow-up prompt that asks for a simple option to reserve seats, and check how the model handled that.»
عرض المصدر ←شغّلت نتليفاين كل نموذج ٣ مرات، وأتاحت الانتقال من نتائج الاختبار إلى المواقع المُنشأة.
«Each model was run three times, and clicking any of the results will take you to the actual generated site!»
عرض المصدر ←بلغ استهلاك إحدى تشغيلات Claude Opus مقدار ١٬٠٥٥ رصيدًا، ما رفع متوسطه بوضوح.
«Not only that: the Claude Opus average is heavily slanted upwards because one of its three runs spent a whopping 1,055 credits!»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر