الذكاء الاصطناعي١٠ أكتوبر ٢٠٢٦
باحثون في تسينغوا يطورون نظام TokenRouter لتسريع معالجة النماذج

قدّمت ورقة من تسينغوا TokenRouter، وهو نظام لتوجيه كل رمز إلى نموذج صغير أو كبير أثناء تشغيل الخدمة. وتقول الورقة إن النظام يحقق إنتاجية تصل إلى ٦٤٫١٥ ضعف الأنظمة القائمة. أما أطر التشغيل الشائعة مثل vLLM وSGLang فتستخدم نموذجًا واحدًا لكل طلب.
الحقائق الأساسية
يصل معدل المعالجة في TokenRouter إلى ٦٤٫١٥ ضعف الأنظمة القائمة.
«at upto 64.15X the throughput of existing setups.»
عرض المصدر ←تستخدم أطر تشغيل شائعة نموذجًا واحدًا لكل طلب.
«Current popular serving frameworks (like vLLM and SGLang) run one model per request»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر