دراسة: روبوتات الدردشة الطبية قد تقدم تشخيصات خاطئة بثقة مفرطة

كشف إصدار جديد من اختبار «RadLE 2.0» المخصّص لتقييم أنظمة الذكاء الاصطناعي في الأشعة أن نماذج كثيرة تقدّم تشخيصات خاطئة بثقة مفرطة، ما يجعلها خطيرة على رعاية المرضى. الاختبار، الذي طوّره مختبر CRASH في جامعة أشوكا الهندية، يكافئ النماذج على الاعتراف بعدم المعرفة ويعاقبها على الجزم الخاطئ، ومع ذلك اختارت نماذج عديدة الإجابة على كل الحالات بثقة عالية. سجّل الأطباء البشريون 988.7 نقطة من أصل ألفَين، بينما لم تتجاوز أفضل نتيجة لنموذج ذكاء اصطناعي 758 نقطة، رغم أن دقّقة الخام تتحسّن بسرعة. ويرى الباحثون أن ادّعاءات تفوّق الذكاء الاصطناعي على الأطباء مبالغٌ فيها، وأن قدرة هذه الأنظمة على إنتاج تشخيصات خاطئة بثقة تُبقي الإنسان لا غنى عنه.
الحقائق الأساسية
طوّر مختبر CRASH في جامعة أشوكا الهندية الإصدار الثاني من اختبار RadLE، الذي يقيس دقّة التشخيص وثقة النموذج وقدرته على الاعتراف بعدم المعرفة عبر 200 حالة و16 نموذجًا.
«RadLE 2.0, short for "Radiology's Last Exam," was developed by the CRASH Lab at Ashoka University in India.»
عرض المصدر ←سجّل أطباء الأشعة 988.7 نقطة من أصل 2000، فيما بلغ أفضل نموذج ذكاء اصطناعي 758 نقطة فقط.
«Human experts scored 988.7 out of a possible 2,000 points. The best AI model hit 758.»
عرض المصدر ←تفوّق نموذج Claude Fable 5 من Anthropic في الإجابات الموثوقة الآمنة، بينما حقّق Gemini 3 Pro من Google أعلى دقّة خام، وكان Muse Spark 1.1 من Meta الأفضل في معرفة متى يحيل الحالة إلى بشري.
«Anthropic's Claude Fable 5 performed best on reliable and safe answers, leading the primary metric. Google's Gemini 3 Pro had the highest raw accuracy.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر