الذكاء الاصطناعي١٥ سبتمبر ٢٠٢٦
إطلاق عائلة نماذج StepAudio 3 للصوت والذكاء الاصطناعي
أعلن حساب StepFun_ai على إكس عائلة StepAudio 3، وتضم خمسة نماذج للصوت والذكاء الاصطناعي مخصصة للتحدث اللحظي والتعرف على الكلام وتوليده، إلى جانب إنشاء الصوت والموسيقى. ويحتل نموذج التحدث اللحظي المركز الأول على Artificial Analysis في ديناميكية الحوار بنسبة ٩٨.٩٪، وفي استدلال الكلام بنسبة ٩٩.٧٪. كما يسجل نموذج التعرف على الكلام معدل خطأ كلمات يبلغ ١.٧٪، فيما يصف الإعلان العائلة بأنها تغطي وظائف صوتية متعددة.
الحقائق الأساسية
تضم العائلة خمسة نماذج تغطي التحدث اللحظي والتعرف على الكلام وتوليده وإنشاء الصوت والموسيقى.
«Introducing StepAudio 3, our new family of 5 audio models for real-time voice, speech recognition, speech generation, audio generation and music.»
عرض المصدر ←حصل نموذج التحدث اللحظي على المركز الأول في مؤشري ديناميكية الحوار واستدلال الكلام، بينما بلغ معدل خطأ الكلمات في التعرف على الكلام ١.٧٪.
«Realtime ranks #1 on Artificial Analysis for both Conversational Dynamics (98.9%) and Speech Reasoning (99.7%). ASR reaches 1.7% WER,»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر