تشغيل نموذج لغوي ضخم على متحكم دقيق بتكلفة 8 دولارات

نجح مطوّر في تشغيل نموذج لغوي يضم 28.9 مليون معامل على متحكم دقيق من نوع ESP32-S3 لا تتجاوز تكلفته ثمانية دولارات، بسرعة تقارب تسعة رموز في الثانية وبمعالجة محلية بالكامل دون اتصال بأي خادم. ويتجاوز هذا الإنجز حدود الأجهزة الصغيرة عبر تقنية «التضمين الطبقي» المستوحاة من نماذج جوجل جيما، حيث تُخزَّن الغالبية العظمى من المعاملات في الذاكرة البطيئة وتُسحب منها فقط الأجزاء الضرورية عند الحاجة. ورغم أن النموذج المدرّب على بيانات TinyStories يقتصر على كتابة قصص قصيرة بسيطة ولا يصلح للمهام المعقدة، فإن الفكرة تكسر حاجز الذاكرة الذي كان يحصر الأجهزة المماثلة في نماذج لا تتجاوز 260 ألف معامل.
الحقائق الأساسية
النموذج يضم 28.9 مليون معامل ويعمل على متحكم ESP32-S3 بتكلفة نحو ثمانية دولارات وبسرعة تسعة رموز في الثانية
«This is a 28.9 million parameter language model that generates text on an ESP32-S3, a microcontroller that costs about $8. It runs on the chip itself, with nothing sent to a server, and it writes each word to a small screen wired to the chip at roughly 9 tokens per second.»
عرض المصدر ←النموذج السابق الذي شُغّل على هذا النوع من الرقائق كان يضم 260 ألف معامل فقط، أي إن الجديد أكبر بنحو مئة ضعف
«The last language model people ran on a chip like this had 260 thousand parameters, so this one holds about a hundred times more.»
عرض المصدر ←الحيلة التقنية تعتمد على تخزين جدول المعاملات الضخم في الذاكرة البطيئة وسحب نحو 450 بايت فقط لكل رمز، مستندة إلى تقنية Per-Layer Embeddings من نماذج جوجل جيما
«So you can leave that 25 million row table in slow flash and pull only the few rows each token needs, about 450 bytes, while the small part that does the actual work stays in fast memory.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر