تشغيل نموذج Gemma 4 26B على معالجات قديمة دون الحاجة لمعالج رسومي

نجح مطوّر في تشغيل نموذج «جيما 4» من جوجل (بـ26 مليار معامل) على خادم عمره 13 عامًا بمعالجات Xeon قديمة وبدون أي كرت شاشة، محققًا سرعة قراءة تبلغ نحو خمسة رموز في الثانية. واجهت المحاولة عائقًا تقنيًا لأن المعالجات القديمة تفتقر لمجموعات تعليمات AVX2 التي يعتمد عليها محرك التشغيل، فاستعان المطور بوكيل ذكاء اصطناعي لتحليل المشكلة وإعادة كتابة مسارات الكود الحرجة لتتوافق مع البنية القديمة. النتيجة هي قدرة أجهزة الشركات القديمة على تشغيل نماذج لغوية حديثة محليًا كبديل مجاني عند تعطل الخدمات المدفوعة أو لمعالجة المهام البطيئة بتكلفة شبه معدومة.
الحقائق الأساسية
تم تشغيل نموذج Gemma 4 (26 مليار معامل) على خادم عمره 13 عامًا بمعالجات Xeon Ivy Bridge وبدون كرت شاشة، بسرعة 5 رموز في الثانية
«It’s a repurposed HP StoreVirtual storage box, roughly thirteen years old, two Ivy Bridge Xeons, no GPU. It was built to hold disks, not do math. As of this week it runs Google’s Gemma 4, a 26-billion-parameter open-weights mixture-of-experts model, at about five tokens per second.»
عرض المصدر ←العائق التقني كان غياب مجموعات تعليمات AVX2 وFMA3 في معالجات Ivy Bridge القديمة، ما منع تشغيل المسارات المحسّنة في محرك ik_llama.cpp
«The fast kernels in that fork assume AVX2 and FMA3, instruction sets that didn’t ship until Haswell, the “v3” generation, in 2014. My CPUs are older than the instructions the code was written against.»
عرض المصدر ←تم نشر التصحيح كطلب دمج مفتوح على مستودع ik_llama.cpp ليتيح لأي شخص يمتلك أجهزة قديمة تشغيل النموذج محليًا
«The patch is up as ikawrakow/ik_llama.cpp#2138 if you want the exact diff — still open and awaiting maintainer review as I write this, so run it from the branch for now.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر