الذكاء الاصطناعي١ سبتمبر ٢٠٢٦
ميتا تطلق نموذج Muse Voice Transcribe للتحويل الصوتي
أطلقت ميتا نموذج «Muse Voice Transcribe» للتعرّف الفوري إلى الكلام، وتصفه بأنه أول نموذج لإدراك الصوت الآني تطوّره مختبراتها للذكاء الفائق. يسجّل النموذج معدل خطأ قدره ٣٫١٪ في دقة التفريغ النهائي، مع تأخير يبلغ ٠٫١٦ ثانية بعد انتهاء الكلام، محتلًا المركز الأول في اختبار AA-WER Streaming. كما يدعم التفريغ الصوتي المتدفق، وفصل المتحدثين في محادثات تضم أكثر من ٢٠ متحدثًا، والتبديل السلس بين اللغات.
الحقائق الأساسية
بلغ معدل خطأ الكلمات في التفريغ النهائي ٣٫١٪، مع تأخير قدره ٠٫١٦ ثانية بعد انتهاء الكلام.
«taking the #1 spot for Final Transcript accuracy on AA-WER Streaming with 3.1% WER at 0.16s after end of speech»
عرض المصدر ←يشمل النموذج فصل المتحدثين عندما تضم المحادثة أكثر من ٢٠ متحدثًا، إلى جانب التبديل السلس بين اللغات.
«diarization with 20+ speakers, and endpointing. It’s multilingual with seamless code-switching»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر