← كل الأخبار
الذكاء الاصطناعي٣٠ أغسطس ٢٠٢٦

باحثون: وكلاء الذكاء الاصطناعي يفتقرون إلى إدراك الوقت

شارك

اختبر باحثان مستقلان مساعدَي البرمجة Claude Code من Anthropic وCodex من OpenAI، ووجدا أنهما لا يقدّران مدة المهام أو الوقت المنقضي عليها بدقة. ففي اختبار شمل ٢٠٠ مهمة من ProgramBench و١٨ معيارًا إضافيًا، بالغ المساعدان غالبًا في تقدير الزمن؛ إذ أخطأ Claude في الجولة الثانية بمقدار ثلاثة أضعاف، بينما تراوح خطأ Codex بين ستة وعشرة أضعاف. كما اختلف زمن العمل باختلاف البرنامج المحيط بالنموذج، فاستمر Claude Code مدة وسطية تقارب ٩٠ دقيقة، في حين توقف Codex بعد نحو نصف ساعة. ويشير الاختبار إلى أن تزويد الوكلاء بأداة تعرض الوقت المنقضي جعل تقديراتهم صحيحة في معظم المرات، ما قد يحسّن التحكم في المهام الطويلة.

الحقائق الأساسية

  • اعتمد الاختبار على ٢٠٠ مهمة من مجموعة ProgramBench، إلى جانب ١٨ معيارًا أعدّها الباحثان.

    «The test material came from 200 tasks in a collection called ProgramBench, plus the researchers' own suite of 18 benchmarks.»
    عرض المصدر ←
  • استمر Claude Code مدة وسطية تقارب ٩٠ دقيقة، بينما توقف Codex بعد نحو نصف ساعة، بصرف النظر تقريبًا عن صعوبة المهمة.

    «Claude Code keeps working until it thinks the task is done, a median of about 90 minutes. Codex, on the other hand, stops after roughly half an hour, almost regardless of the task.»
    عرض المصدر ←
  • عندما حصل الوكلاء على أداة تخبرهم بالوقت المنقضي، أصابوا التقدير تقريبًا في كل مرة.

    «When the agents got access to a tool that reports elapsed time, they got it right almost every time.»
    عرض المصدر ←

المصادر

شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح

صحّح هذا الخبر