الذكاء الاصطناعي٢٥ أغسطس ٢٠٢٦
بحث من جوجل ديب مايند يقترح تحسين تدفق المعلومات بين طبقات المحولات

توضح ورقة من Google DeepMind أن الطبقات السطحية في المحوّل لا ترى ما أنجزته الطبقات الأعمق عن السياق. وتقترح إعادة تمرير قدر محدود من هذه المعلومات إلى الطبقات الأدنى أثناء الاستدلال، لاستعادة جزء مما فُقد. وقد يفيد ذلك النماذج التي تفقد حالتها عند التعامل مع مدخلات طويلة.
الحقائق الأساسية
الطبقات السطحية لا تطّلع على ما توصلت إليه الطبقات الأعمق بشأن السياق.
«a transformer's shallow layers never see what its deeper layers have already worked out about the context.»
عرض المصدر ←إعادة تمرير جزء من المعلومات إلى الطبقات الأدنى أثناء الاستدلال تستعيد بعض ما فُقد.
«Leaking a little of it back down during inference recovers part of what was lost.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر