← كل الأخبار

إطلاق نموذج Flux 3 X Mimic للتحكم في حركة الفيديو

شارك
إطلاق نموذج Flux 3 X Mimic للتحكم في حركة الفيديو

كشفت Black Forest Labs عن نموذج FLUX 3 متعدد الأنماط الذي يولّد الصور والفيديو والصوت بشكل مشترك، ويمتد ليشمل التحكم في الأفعال الحركية للروبوتات. وبناءً عليه طوّرت الشركة بالتعاون مع mimic نموذج FLUX-mimic كنموذج فيديو-حركي يُشغّل روبوتات جرى اختبارها ونشرها فعليًا في خطوط إنتاج Audi. يكمن المغزى في أن التدريب على توليد الفيديو الواقعي يُجبر النموذج على تعلّم قوانين العالم المادي مثل التلامس والحركة والسببية، وبالتالي يصبح التنبؤ بالأفعال امتدادًا طبيعيًا لنفس الفهم بدلًا من بناء نموذج منفصل. وقد أثبتت التجارب أن إضافة التنبؤ بالأفعال تسببت في انخفاض مؤقت بنسبة تصل إلى 10% في جودة الفيديو، قبل أن يستعيد النموذج كامل أدائه بعد 3500 خطوة تدريب.

الحقائق الأساسية

  • نموذج FLUX-mimic مبني على عمود FLUX 3 ويُشغّل روبوتات تم اختبارها ونشرها في Audi

    «running robots that have been tested and deployed at Audi»
    عرض المصدر ←
  • تدريب الفيديو يستحوذ على أكثر من 95% من إجمالي تكلفة الحوسبة، بينما يمثل الصوت أقل من 0.5% من الرموز في فيديو 720p

    «accounting for over 95% of the total compute costs - is video prediction»
    عرض المصدر ←
  • بعد إضافة التنبؤ بالأفعال انخفضت جودة الفيديو مؤقتًا بنسبة تصل إلى 10% ثم استعاد النموذج أداءه الكامل بعد 3500 خطوة

    «Human ratings on text-to-video and image-to-video initially fell by up to 10% as the model started to incorporate the new action modality. After 3500 steps, the model had regained its full previous quality on video generation tasks while now also predicting actions.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر