ميتا تطلق نموذجًا صوتيًا فوريًا لمساعدات الذكاء الاصطناعي
أطلقت ميتا نموذج Muse Voice Transcribe للصوت الفوري، الذي يفرّغ الكلام ويميّز المتحدثين ويرصد حدود الجمل أثناء المحادثة الحية. يقسّم النموذج الصوت إلى مقاطع مدتها ٨٠ ميلي ثانية، ويوازن تلقائيًا بين سرعة إخراج الكلمات ودقتها بحسب صعوبة كل كلمة. ويدعم أكثر من ٧٠ لغة، مع قدرة على التعامل مع تبديل اللغة داخل الجملة، كما يميّز أكثر من ٢٠ متحدثًا في الوقت نفسه. يتاح النموذج الآن داخل Meta AI وعبر Meta Model API، بسعر ٠٫١٨ دولار للساعة أو ٣ دولارات لكل ١٬٠٠٠ دقيقة صوتية.
الحقائق الأساسية
يستطيع النموذج التمييز بين أكثر من ٢٠ متحدثًا في وقت واحد، ومعالجة تسجيلات تتجاوز ساعة دون معالجة لاحقة.
«The model can tell more than 20 speakers apart at once and handle recordings over an hour long without post-processing.»
عرض المصدر ←دُرّب النموذج على أكثر من ٧٠ لغة، واختُبرت ٢٥ لغة منها بعمق.
«Meta says Muse Voice Transcribe was trained on more than 70 languages, with 25 tested in depth.»
عرض المصدر ←تسعّر ميتا النموذج عند ٠٫١٨ دولار للساعة، أو ٣ دولارات لكل ١٬٠٠٠ دقيقة صوتية.
«At $0.18 per hour, or $3 per 1,000 audio minutes, it costs less than Cartesia Ink-2 at $4 and ElevenLabs Scribe v2 Realtime and Deepgram Flux at $6.50 each.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر