إنفيديا تطلق نموذج Magpie TTS لبناء وكلاء صوتيين متعددي اللغات

قدّمت إنفيديا الإصدار الأحدث من Magpie TTS، وهو نموذج مفتوح الأوزان لتحويل النص إلى كلام وبناء وكلاء صوتيين متعددَي اللغات داخل البنية التحتية الخاصة بالمطور. يدعم النموذج ١٢ لغة، بينها العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية التي أضيفت حديثًا، مع أصوات لمتحدثين وُجدت لكل لغة بصيغتين: ذكورية وأنثوية. ويضم النموذج ٣٦٤ مليون معامل، كما يتيح تبديل اللغات داخل الكلام ودعم القواميس المخصصة للنطق. وتقول إنفيديا إن زمن وصول أول صوت يتراوح بين ٣٢ و٧٩ مللي ثانية عبر بطاقات رسومية مختلفة، بينما يصل إلى ٢٣٩ مللي ثانية عند تشغيل ٦٤ تدفقًا متزامنًا على B200، مع تشغيله على أجهزة يملكها المطور ويتحكم فيها.
الحقائق الأساسية
Magpie TTS Multilingual نموذج مفتوح الأوزان يضم ٣٦٤ مليون معامل ويدعم ١٢ لغة، بينها العربية الفصحى الحديثة والكورية والبرتغالية البرازيلية.
«Magpie TTS Multilingual is a 364M-parameter open-weights model supporting:»
عرض المصدر ←يتراوح زمن وصول أول صوت بين ٣٢ و٧٩ مللي ثانية على بطاقات NVIDIA GPU عند تشغيل تدفق واحد، ويبلغ ٢٣٩ مللي ثانية مع ٦٤ تدفقًا متزامنًا على B200.
«Across NVIDIA GPUs, Magpie delivers first audio in 32–79ms on a single stream. At 64 concurrent streams, B200 reaches 239ms TTFA while delivering throughput at 320× real time — generating audio more than 300 times faster than it plays back, even under concurrent load.»
عرض المصدر ←يعتمد النموذج على تقنيتين لتسريع التوليد: توقّع إطارين صوتيين في كل خطوة، ومحوّل محلي يستعيد جودة الصوت.
«Magpie introduces two complementary architectural improvements that reduce inference time while maintaining speech quality.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر