الذكاء الاصطناعي٢٠ سبتمبر ٢٠٢٦
إكس إيه آي تطلق نموذج Grok Voice Transcribe 2.0 للنسخ الصوتي
أتاحت xAI نموذج Grok Voice Transcribe 2.0 للنسخ الصوتي عبر واجهة Grok Voice API، مع إعلان دقة أعلى بمرتين بالسعر نفسه. يدعم النموذج المعالجة الدفعية والبث المباشر، ويتيح تمييز المتحدثين بلا تكلفة إضافية، بينما انخفض معدل الخطأ متعدد اللغات من ٢٠٫٦٪ إلى ٦٫٨٪. وتبلغ كلفته ٠٫١٠ دولار للساعة في المعالجة الدفعية و٠٫٢٠ دولار للساعة في البث، كما تصدّر ترتيب الدقة بين ٣٢ نموذجًا للبث.
الحقائق الأساسية
انخفض معدل الخطأ متعدد اللغات من ٢٠٫٦٪ إلى ٦٫٨٪.
«▪️ Multilingual error rate: 20.6% → 6.8%»
عرض المصدر ←تبلغ التكلفة ٠٫١٠ دولار للساعة للمعالجة الدفعية و٠٫٢٠ دولار للساعة للبث المباشر، مع تمييز المتحدثين دون رسوم إضافية.
«▪️ $0.10/hr batch, $0.20/hr streaming ▪️ Speaker diarization at no extra cost»
عرض المصدر ←احتل النموذج المرتبة الأولى في الدقة بين ٣٢ نموذجًا للبث.
«▪️ Ranks #1 of 32 streaming models»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر