الذكاء الاصطناعي٥ أكتوبر ٢٠٢٦
تحسين أداء نموذج Qwen3-Omni على بطاقات RTX 5090

حسّن @fractalyze_io أداء Qwen3-Omni على بطاقة RTX 5090 واحدة، وخفّض زمن بدء إخراج الصوت في اختبارات محددة. واستخدمت الاختبارات AWQ بضغط ٤ بت، ودفعةً واحدة من مطالبات النص، مقارنةً بإعداد vLLM-Omni القياسي؛ فتراجع الزمن من ٢١٣ مللي ثانية إلى ٢٣. ويرغب مشروع vLLM في دمج هذه التحسينات في vLLM-Omni كي يستفيد منها مزيد من المستخدمين، بحسب منشوره على إكس.
الحقائق الأساسية
في اختبارات مطالبة نصية واحدة وAWQ بضغط ٤ بت، انخفض زمن بدء الصوت على RTX 5090 من ٢١٣ إلى ٢٣ مللي ثانية مقارنةً بإعداد vLLM-Omni القياسي.
«Their AWQ-4bit, batch-1 text-prompt tests cut time to first audio from 213ms to 23ms vs. stock vLLM-Omni.»
عرض المصدر ←يرغب مشروع vLLM في إدخال التحسينات إلى vLLM-Omni لتصل إلى مزيد من المستخدمين.
«We’d love to see these optimizations contributed upstream to vLLM-Omni so more users»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر