جوجل تطلق نموذج Gemini 3.8 لتحويل النص إلى صوت
أطلقت جوجل نموذجَي Gemini 3.8 Flash TTS وFlash-Lite TTS لتحويل النص إلى كلام، مع دعم أكثر من ١٠٠ لغة. يتيح الإصدار الأول ابتكار صوت من وصف مكتوب أو استنساخه من عينة مدتها ٣٠ ثانية، بينما يركز الثاني على توليد الصوت منخفض التكلفة بكميات كبيرة. ويدعم النموذجان حوارات بصوتين، وتوجيهات لأداء كل جملة، وأصواتًا غير لفظية مثل الضحك والتنهد، وقد بدأ طرحهما عبر Gemini API وGoogle AI Studio. وتقول جوجل إن ساعة الصوت الناتج تكلف حتى نهاية ٢٠٢٦ نحو ٠٫٨١ دولار مع Flash TTS و٠٫٥٤ دولار مع Flash-Lite TTS، مع احتساب النص المُدخل separately.
الحقائق الأساسية
يمكن لـFlash TTS إنشاء صوت جديد من وصف نصي، كما توفر جوجل أكثر من ٢٬٠٠٠ صوت جاهز.
«Flash TTS can create new voices from text descriptions, and a voice cloning feature builds voice profiles from 30-second audio samples.»
عرض المصدر ←تتطلب ميزة استنساخ الصوت تسجيل موافقة منطوقة من صاحب الصوت، ويُضاف إلى كل مقطع مولد من نماذج الصوت وسم SynthID غير مسموع.
«To use it, the person whose voice is being cloned has to record a spoken statement of consent, and the voice in that recording must match the sample.»
عرض المصدر ←حلّ Gemini 3.8 Flash TTS أولًا في معيار متانة النطق لدى Artificial Analysis بنتيجة ٨٩٫٥٪.
«Gemini 3.8 Flash TTS takes the #1 spot on the Artificial Analysis Pronunciation Robustness benchmark at 89.5%, ahead of Gemini 3.1 Flash TTS at 88.2%, SpaceXAI TTS at 87.6%, and Gemini 3.8 Flash-Lite TTS at 87.4%.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر