
كشفت تجربة بحثية حديثة أن نماذج الذكاء الاصطناعي لا تزال تواجه صعوبات جوهرية في تجاوز قدرات العقل البشري، وتحديداً في مجال الرياضيات المعقدة. وأظهر الاختبار، الذي يعد الأول من نوعه، تفوق كبار علماء الرياضيات على أنظمة الذكاء الاصطناعي في حل مسائل بحثية غير مسبوقة وغير مدرجة ضمن بيانات التدريب الخاصة بتلك النماذج.
اعتمد الباحثون في هذا الاختبار على عشر مسائل رياضية مستمدة من أعمال علمية غير منشورة، مما ضمن عدم وجود حلول جاهزة لها في قواعد البيانات الضخمة التي تغذي أنظمة الذكاء الاصطناعي. وقد خضعت الحلول المقدمة لتقييم دقيق من قبل لجنة من الخبراء المتخصصين.
وأظهرت النتائج أن الأنظمة الحالية، بما فيها النماذج الرائدة مثل ChatGPT 5.5 Pro وGemini 3.1 Pro، تعاني من فجوات معرفية ومنطقية، أبرزها:
في محاولة لتعزيز الأداء، طورت فرق بحثية من جامعة كاليفورنيا والمعهد الفيدرالي السويسري للتكنولوجيا في زيورخ ما يُعرف بـ الأنظمة الوسيطة. تعتمد هذه التقنية على تفعيل عدة روبوتات دردشة لتعمل كفريق؛ حيث يتولى أحدها طرح الحل، بينما يقوم الآخر بمراجعته وتدقيقه في دورات متكررة.
ترتيب الأداء في الاختبار:
على الرغم من التطور التقني، لم يتمكن أي من الفرق المشاركة من حل ثلاث مسائل من أصل عشر، كما رُصدت حالات قامت فيها النماذج بنسخ مقالات ومصادر منشورة دون الإشارة إليها. ويؤكد الباحثون أن هذه المسائل ستشكل مستقبلاً معياراً قياسياً لاختبار قدرات الذكاء الاصطناعي وتقييم تطور التفكير المنطقي لديه في مواجهة التحديات العلمية الصعبة.