AirLLM يتيح تشغيل نماذج 70B على بطاقة رسوميات 4GB

يتيح مشروع AirLLM تشغيل نماذج لغوية ضخمة بحجم ٧٠ مليار معامل على بطاقة رسوميات بذاكرة ٤ غيغابايت، من دون تكميم أو تقطير أو تقليم. ويعرض المشروع تشغيل Llama 3.1 بحجم ٤٠٥ مليارات معامل على ٨ غيغابايت، وDeepSeek-V3 بحجم ٦٧١ مليارًا على نحو ١٢ غيغابايت، بينما تُحمّل نماذج MoE الخبيرة المطلوبة لكل رمز بدل الطبقة كاملة. وقبل الاستدلال، يفكك AirLLM النموذج ويحفظه على مستوى الطبقات، لذلك يلزم توفير مساحة كافية في مجلد التخزين المؤقت.
الحقائق الأساسية
يشغّل AirLLM نموذجًا بحجم ٧٠ مليار معامل على بطاقة رسوميات واحدة بذاكرة ٤ غيغابايت.
«AirLLM dramatically reduces inference memory usage, letting 70B large language models run on a single 4GB GPU card — without quantization, distillation, or pruning.»
عرض المصدر ←يتيح المشروع تشغيل Llama 3.1 بحجم ٤٠٥ مليارات معامل على ٨ غيغابايت، وDeepSeek-V3 بحجم ٦٧١ مليارًا على نحو ١٢ غيغابايت.
«You can even run 405B Llama 3.1 on 8GB, DeepSeek-V3 (671B) on ~12GB, and Kimi K3 (2.8T) — the largest open-source model released to date — on under 4GB, because sparse MoE models stream one expert at a time rather than a whole layer.»
عرض المصدر ←يحفظ AirLLM النموذج بعد تفكيكه إلى طبقات أثناء الاستدلال، ما يتطلب مساحة كافية في مجلد التخزين المؤقت.
«Note: During inference, the original model will first be decomposed and saved layer-wise. Please ensure there is sufficient disk space in the huggingface cache directory.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر