← كل الأخبار
تقنية وعالم٢٦ سبتمبر ٢٠٢٦

مطور يبتكر نسخة رقمية تفاعلية من نفسه

شارك

أنشأت Synthesia نسخة رقمية تفاعلية من صحفي، بعدما صوّرته وسجّلت صوتَه لتقديم إجابات عن قصة صحفية محددة. وتستند النسخة إلى مجموعة من نماذج تحويل الكلام إلى نص، وفهم اللغة، وتحويل النص إلى صوت، وتحريك الفيديو، بحيث تستمع للسؤال وترد بصوت وصورة الصحفي. صُنعت له أربعة نماذج: اثنان شخصيان يقرآن النصوص، واثنان تفاعليان يستمعان ويردان، مع نظارتين ومن دونهما. لكن النسخة التفاعلية مقيدة بالمادة التي دُرّبت عليها، فتُعيد المستخدم إلى قصة احتيال الشركات الناشئة بدل الإجابة عن أسئلة شخصية.

الحقائق الأساسية

  • استغرق إعداد النسخ الرقمية بضعة أيام.

    «It took the Synthesia team a couple of days to make my avatars.»
    عرض المصدر ←
  • تتكون المنظومة من نماذج لتحويل الكلام إلى نص، وفهمه واتخاذ إجراءات بناءً عليه، ثم تحويل الرد إلى صوت وتحريك الصورة.

    «The voice-to-text model turns what people say into text, the agentic language model makes sense of text and can take actions based on it, the text-to-voice model turns a response into audio, and finally a video model (built by Synthesia) animates the avatar as it talks.»
    عرض المصدر ←
  • النسخة التفاعلية لا تجيب إلا ضمن القصة التي دُرّبت عليها.

    «Then I showed them my interactive one, which is deterministic, meaning it will only say what it was trained to respond to.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر