الذكاء الاصطناعي٧ أكتوبر ٢٠٢٦
بحث من فيرجينيا تك يطوّر تقنية لزيادة سعة معالجة النماذج

تعرض ورقة جديدة من فيرجينيا تك طريقةً لتقليل الذاكرة التي تحتاجها النماذج عند معالجة النصوص، عبر حفظ الرموز الأقدم في متجهات مضغوطة تقرؤها آلية الانتباه مباشرة. وتقول إن النموذج يستطيع بهذه الطريقة معالجة طلبات أكثر من ٤٫٠ إلى ٨٫٨ مرات لكل وحدة معالجة رسومية، مع خسارة طفيفة في الدقة. ويشير المنشور إلى أن النماذج الحلقية تمرّر كل رمز عبر الطبقات نفسها مرات عدة، بحسب منشور @rohanpaul_ai على إكس.
الحقائق الأساسية
تتيح الطريقة للنموذج معالجة ما بين ٤٫٠ و٨٫٨ مرات من الطلبات لكل وحدة معالجة رسومية، مع أثر طفيف على الدقة.
«and a looped LLM fits 4.0 to 8.8 times as many requests per GPU at little accuracy cost.»
عرض المصدر ←تعتمد الطريقة على حفظ الرموز الأقدم في متجهات موجزة تقرؤها آلية الانتباه مباشرة.
«cache older tokens as compact vectors that attention reads directly»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر