الذكاء الاصطناعي٢١ سبتمبر ٢٠٢٦
تجارب تقنية تظهر أداء نموذج Qwen3.8 على معالجات إنفيديا
عرض مشروع vLLM أداء نموذج Qwen3.8-2.4T على معالجات NVIDIA GB300 NVL72، ضمن إعدادات مختلفة لمعالجة الطلبات. تراوح الأداء بين ٥ آلاف رمز إجمالي في الثانية لكل معالج عند رفع معدل المعالجة، و١٨٠ رمز إخراج في الثانية لكل مستخدم عند خفض زمن الاستجابة، مع مدخلات من ٨ آلاف رمز ومخرجات من ألف رمز. ويستعرض المشروع هذه النتائج بوصفها حصيلة تجارب متتابعة لضبط الإعدادات.
الحقائق الأساسية
بلغ الأداء الأقصى ٥ آلاف رمز إجمالي في الثانية لكل معالج عند معدل معالجة مرتفع.
«5K total tokens/s/GPU at high throughput»
عرض المصدر ←وصل الأداء عند خفض زمن الاستجابة إلى ١٨٠ رمز إخراج في الثانية لكل مستخدم، مع ٨ آلاف رمز إدخال وألف رمز إخراج.
«180 output tokens/s/user at low latency, across tuned PD configurations on @nvidia GB300 NVL72. Workload: 8K input / 1K output.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر