الذكاء الاصطناعي٢ سبتمبر ٢٠٢٦
تحديث نموذج Qwen3.8-Flash يرفع سرعة الاستدلال محليًا
قال حساب @UnslothAI على إكس إن Qwen3.8-Flash أصبح أسرع محليًا بنحو ١٫٧ مرة عند استخدام تقنية MTP. وتصل نسخ GGUF، بحسب المنشور، إلى ١٧٠ رمزًا في الثانية على جهاز RTX PRO 6000. كما يقدّم Qwen3.8-Flash-Next استدلالًا أسرع بنحو ١٫٣ إلى ١٫٧ مرة من دون تغيير في الدقة، مع توفير النسخ ودليل الاستخدام عبر روابط مرفقة.
الحقائق الأساسية
تصل نسخ GGUF إلى ١٧٠ رمزًا في الثانية على RTX PRO 6000.
«GGUFs can reach 170 tokens/s on a RTX PRO 6000.»
عرض المصدر ←يرفع MTP سرعة استدلال Qwen3.8-Flash-Next بنحو ١٫٣ إلى ١٫٧ مرة من دون تغيير في الدقة.
«MTP enables Qwen3.8-Flash-Next ~1.3–1.7× faster inference with no accuracy change.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر