الذكاء الاصطناعي٧ أكتوبر ٢٠٢٦
بيانات أداء جديدة تظهر تفوق التناثر المقترن في معالجة vLLM

عرض حساب vLLM بيانات عن التناثر ٤:٨، أظهرت أن عمليات ضرب المصفوفات الخاصة بالخبراء أسرع من NVFP4 الكثيف على B200. وبلغت السرعة بين ١٫٣٥ و١٫٦٥ مرة، بينما حقق Kimi-K2.5 زيادةً قدرها ١٫١٨ مرة أثناء تقديم الخدمة عبر vLLM. وتشير الأرقام إلى مكاسب في سرعة المعالجة ضمن هذه الحالات.
الحقائق الأساسية
عمليات GEMM الخاصة بالخبراء أسرع من NVFP4 الكثيف على B200 بمقدار ١٫٣٥ إلى ١٫٦٥ مرة.
«expert GEMMs ran 1.35-1.65x faster than dense NVFP4 on B200»
عرض المصدر ←حقق Kimi-K2.5 سرعةً تبلغ ١٫١٨ مرة أثناء تقديم الخدمة عبر vLLM.
«Kimi-K2.5 reaching 1.18x in vLLM serving.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر