← كل الأخبار
الذكاء الاصطناعي٢٧ أغسطس ٢٠٢٦

جوجل تطلق نموذج Gemini 3.5 Transcribe للتحويل الصوتي

شارك

أطلقت جوجل نموذج Gemini 3.5 Transcribe لتحويل الكلام إلى نص لحظيًا، مع دعم أكثر من ٨٥ لغة. يحذف النموذج كلمات التردد مثل «um»، ويصحح زلات اللسان، وينسّق النص تلقائيًا، بينما تبلغ نسبة خطأ الكلمات ٤٪ في البث المباشر و٢٫٦٪ في التسجيلات. ويتوافر عبر واجهتي Live API للصوت المتدفق وInteractions API للتسجيلات مع تمييز المتحدثين والطوابع الزمنية. النموذج متاح الآن في Google AI Studio ومنصة Gemini Enterprise Agent Platform، ومضمّن في Gboard على أندرويد وتطبيق Gemini على macOS، مع دعم Chrome قريبًا.

الحقائق الأساسية

  • خفضت جوجل زمن الاستجابة بنسبة ٧٠٪ مقارنةً بنموذج Chirp 3 السابق.

    «with 70 percent lower latency than its predecessor, Chirp 3.»
    عرض المصدر ←
  • تستطيع ميزة «استدعاء الوظائف» إحالة مهام مثل إنشاء الصور والبحث على الويب إلى نماذج Gemini أخرى.

    «Through "function calling," the model can hand off tasks like image generation or web searches to other Gemini models.»
    عرض المصدر ←
  • تتعامل Interactions API مع الصوت المسجل، وتضيف تحديد المتحدثين والطوابع الزمنية.

    «while the Interactions API processes recorded audio with speaker attribution and timestamps»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر
جوجل تطلق نموذج Gemini 3.5 Transcribe للتحويل الصوتي — رادار