تيم ديتميرز ينشر دليلاً لتشغيل نماذج الذكاء الاصطناعي محلياً
ينشر تيم ديتمرز ومختبره خلال «أسبوع المصادر المفتوحة» أدوات تجعل تشغيل نماذج ذكاء اصطناعي كبيرة محليًا أسهل وأقل اعتمادًا على الخوادم البعيدة. ويتيح الإطار تشغيل Qwen 3.8 Flash Next، ذي ١٢٥ مليار معامل، على بطاقة رسومات واحدة بذاكرة ٢٤ غيغابايت، بينما يمكن تشغيل DeepSeek V4.1، ذي ٥٥٠ مليار معامل، على حاسوب MacBook بذاكرة ١٢٨ غيغابايت أو أجهزة محددة أخرى. كما شغّل الإطار نموذج Qwen 3.6 35B-A3B بسرعة ٤٥٠ رمزًا في الثانية، مع ضغط يصل إلى ١٫٥ بت لكل وزن، ما يخفض احتياج الذاكرة إلى نحو عُشره. ويقول ديتمرز إن المشروع يضم أيضًا وكيلًا يواصل تحسين الشيفرة تلقائيًا، مع إدارة آلية للسياق والضغط أثناء الاستدلال.
الحقائق الأساسية
شغّل الإطار نموذج Qwen 3.6 35B-A3B بسرعة ٤٥٠ رمزًا في الثانية وباستخدام ١٫٥ بت لكل وزن.
«What came back was quantized inference of a Qwen 3.6 35B-A3B model at 450 tokens per second, with high-quality output at 1.5 bits per weight.»
عرض المصدر ←يمكن تشغيل Qwen 3.8 Flash Next على بطاقة رسومات واحدة بذاكرة ٢٤ غيغابايت، وDeepSeek V4.1 على MacBook بذاكرة ١٢٨ غيغابايت.
«Our framework lets you run its larger sibling, Qwen 3.8 Flash Next at 125 billion parameters, on a single 24 GB GPU — the card in a normal desktop machine. With AMD Strix, an NVIDIA DGX Spark, or a MacBook with 128 GB of memory, you can run DeepSeek V4.1 — a 550B model.»
عرض المصدر ←يعمل الوكيل على تحسين الشيفرة من تلقاء نفسه، مع ضغط وإدارة تلقائيين للسياق.
«No feedback will be provided along the way, so the agent has to figure things out on its own whenever it is unclear or unsure.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر