مطورون يشغلون نموذج Kimi K3 على أجهزة ماك بوك
شغّل مشروع Deltafin نموذج Kimi K3 الكامل على جهاز MacBook Pro بمعالج M5 Max وذاكرة ١٢٨ غيغابايت، مع بث أوزان الخبراء من أربعة أقراص SSD. حقق التشغيل سرعة ثابتة بلغت نحو ١ توكن في الثانية لإجابة من ٥١٢ توكنًا، فيما هبطت سرعة ظهور أول توكن بعد مطالبة بالطول نفسه إلى قرابة ٦.٣ دقائق. ويضم النموذج ٢.٨ تريليون معامل، لكن التجربة ما زالت تعتمد على تشغيل بارد واحد لكل قياس، مع إصلاح لبطء مرحلة التمهيد مخطط له ولم يُنفّذ بعد.
الحقائق الأساسية
تحتاج مطالبة من ٥١٢ توكنًا إلى نحو ٦.٣ دقائق قبل ظهور أول توكن، بسبب إعادة قراءة خبراء كل طبقة ٨ مرات.
«The honest limit: a 512-token prompt takes ~6.3 minutes to its first token. Cause found (prefill re-reads each layer's experts 8×), fix planned, not built.»
عرض المصدر ←بلغت سرعة الإجابة ١.١٣ توكن في الثانية مع إجابة من ١٢٨ توكنًا، و٠.٩٦ توكن في الثانية مع المطالبة العامة ذات ١٧ توكنًا.
«1.00 tok/s steady decode over a 512-token answer; 1.13 over 128; 0.96 on the public 17-token prompt (upstream reported 0.68).»
عرض المصدر ←يحتوي Kimi K3 على ٢.٨ تريليون معامل و١.٤٥ تيرابايت من أوزان الخبراء، وتُبث هذه الأوزان من أربعة أقراص SSD.
«Kimi K3 (2.8T-parameter MoE, 1.45 TB of expert weights) running on one M5 Max MacBook Pro with 128 GB, experts streamed from four SSDs.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر