تشغيل نموذج Kimi K3 محليًا باستهلاك 29 جيجابايت من الذاكرة

أصبح بالإمكان تشغيل نموذج Kimi K3، الذي يضم 2.78 تريليون مَعلمة، على حاسوب محمول استهلاكي بذاكرة 64 جيجابايت عبر محرك WASTE. الفكرة أن المحرك يُبقي الجزء الأساسي من النموذج في الذاكرة، ويبث الخبراء المطلوبين من القرص عند الحاجة، بدل تحميل النموذج كاملًا. الأداء ما يزال بطيئًا عند نحو نصف رمز في الثانية، لكن التجربة تفتح باب تشغيل نماذج ضخمة محليًا بلا اتصال شبكي أو إرسال البيانات إلى خدمة سحابية. ويتطلب النموذج قرابة تيرابايت من التخزين، فيما يُعد جهاز 64 جيجابايت الحد العملي لتشغيله.
الحقائق الأساسية
النموذج المستخدم هو Kimi K3 بحجم 2.78 تريليون مَعلمة، ويعمل على حاسوب MacBook Pro بذاكرة 64 جيجابايت.
«Its current proof point is the complete open-weights Kimi K3 model: 2.78 trillion parameters, converted into a 982 GiB container and running on a 64 GB MacBook Pro at 0.49–0.54 tokens per second.»
عرض المصدر ←يعتمد WASTE على إبقاء الجزء الأساسي في الذاكرة، مع بث الخبراء من القرص واستخدام الذاكرة المتبقية كذاكرة تخزين مؤقتة محدودة.
«It keeps the model trunk in memory, streams selected experts directly from disk, and uses the remaining RAM as a bounded expert cache.»
عرض المصدر ←الأداء المقاس يقارب نصف رمز في الثانية، ويستغرق توليد الجملة التجريبية نحو ثلاثين ثانية.
«It is also slow — half a token per second, thirty seconds for the sentence above.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر