← كل الأخبار
الذكاء الاصطناعي٢١ سبتمبر ٢٠٢٦

تجارب تقنية تظهر أداء نموذج Qwen3.8 على معالجات إنفيديا

شارك

عرض مشروع vLLM أداء نموذج Qwen3.8-2.4T على معالجات NVIDIA GB300 NVL72، ضمن إعدادات مختلفة لمعالجة الطلبات. تراوح الأداء بين ٥ آلاف رمز إجمالي في الثانية لكل معالج عند رفع معدل المعالجة، و١٨٠ رمز إخراج في الثانية لكل مستخدم عند خفض زمن الاستجابة، مع مدخلات من ٨ آلاف رمز ومخرجات من ألف رمز. ويستعرض المشروع هذه النتائج بوصفها حصيلة تجارب متتابعة لضبط الإعدادات.

الحقائق الأساسية

  • بلغ الأداء الأقصى ٥ آلاف رمز إجمالي في الثانية لكل معالج عند معدل معالجة مرتفع.

    «5K total tokens/s/GPU at high throughput»
    عرض المصدر ←
  • وصل الأداء عند خفض زمن الاستجابة إلى ١٨٠ رمز إخراج في الثانية لكل مستخدم، مع ٨ آلاف رمز إدخال وألف رمز إخراج.

    «180 output tokens/s/user at low latency, across tuned PD configurations on @nvidia GB300 NVL72. Workload: 8K input / 1K output.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر