← كل الأخبار
الذكاء الاصطناعي٢٣ سبتمبر ٢٠٢٦

إنفيديا تطلق نموذج Nemotron 3 لتمييز المتحدثين في الوقت الفعلي

شارك

قدمت إنفيديا نموذج Nemotron 3 Diarization المفتوح الأوزان لتمييز المتحدثين في المحادثات المباشرة والمسجلة، مع تحديد توقيت كلام كل شخص حتى عند تداخل الأصوات. يضم النموذج ١٠٠ مليون معامل، ويدعم ما يصل إلى ٨ متحدثين، وحقق المركز الأول في نتائج Diarization-Bench الأولية من Voice Arena بمعدل خطأ بلغ ١٤٫٧٢٪. وتظل القنوات أسماءً مجهّلة مثل speaker_2، لذلك تحتاج التطبيقات إلى بيانات الاجتماع أو ملفات المستخدمين لربطها بأشخاص محددين.

الحقائق الأساسية

  • يعالج النموذج محادثات يصل عدد المتحدثين فيها إلى ٨، مع دعم الكلام المتداخل والمعالجة على دفعات.

    «Supporting up to eight speakers across live and recorded conversations, it handles overlapping speech, chunked processing for flexible recording lengths, and customizable streaming latency.»
    عرض المصدر ←
  • سجّل النموذج معدل خطأ في تمييز المتحدثين قدره ١٤٫٧٢٪، مع تصدّره لوحة Diarization-Bench.

    «NVIDIA Nemotron 3 Diarization is an open-weight, 100M-parameter model that ranks #1 on Voice Arena's Diarization-Bench leaderboard with a 14.72% Diarization Error Rate (DER).»
    عرض المصدر ←
  • لا يحدد النموذج هوية الشخص الحقيقية خلف كل قناة صوتية، بل يترك ربطها بالهويات لتطبيقات أخرى.

    «These are anonymous labels, not real-world identities: the model can report that speaker_2 spoke from one timestamp to another, but it does not determine that speaker_2 is a particular person.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر