توليد الصور والفيديو٢ سبتمبر ٢٠٢٦
إنوورلد تطلق نماذج تحويل النص إلى كلام Realtime TTS-2
أطلقت إنوورلد نموذجَي Realtime TTS-2 وTTS-2 Flash لتحويل النص إلى كلام، بحسب منشور @testingcatalog على إكس. يركّز الأول على وضوح الصوت، بينما صُمم الثاني للاستجابة السريعة والتعامل مع أحجام استخدام كبيرة. ويستطيع Realtime TTS-2 إنشاء نسخة صوتية واقعية انطلاقًا من تسجيل مدته بين ٥ و١٥ ثانية، في حين أن استنساخ الأصوات الاحترافي ما زال تجريبيًا ويتطلب تسجيلًا مدته ١٠ دقائق.
الحقائق الأساسية
ينشئ Realtime TTS-2 نسخة صوتية واقعية من مقطع يتراوح طوله بين ٥ و١٥ ثانية.
«Inworld Realtime TTS-2 can create a realistic voice clone based on a 5- to 15-second clip.»
عرض المصدر ←يركّز TTS-2 Flash على خفض زمن الاستجابة ودعم الاستخدام واسع النطاق.
«Inworld has released Realtime TTS-2, focused on clarity, and TTS-2 Flash, built for low latency and high volume.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر