الذكاء الاصطناعي٤ سبتمبر ٢٠٢٦
تحسين أداء استنتاج نموذج GLM-5.3-Flash محليًا
أعلنت UnslothAI تسريع تشغيل نموذج GLM-5.3-Flash محليًا بمقدار ٣٫٣ مرات. وتقول إن استدلال GGUF المحلي أصبح أسرع بين ١٫٦ و٣٫٤ مرات بفضل فك ترميز مُحسّن وتنبؤ متعدد الرموز. ويمكن تشغيل النموذج بدقة ٣ بت على أجهزة بذاكرة ١٢٨ غيغابايت عبر Unsloth Desktop أو llama.cpp.
الحقائق الأساسية
يتراوح تحسن سرعة استدلال GGUF المحلي بين ١٫٦ و٣٫٤ مرات.
«Local GGUF inference is now 1.6–3.4× faster with optimized decoding and bonus multi-token prediction.»
عرض المصدر ←يتاح تشغيل النموذج بصيغة ٣ بت على أجهزة بذاكرة ١٢٨ غيغابايت باستخدام Unsloth Desktop أو llama.cpp.
«Run 3-bit on 128GB setups via Unsloth Desktop or llama.cpp.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر