نعوم براون، عالم OpenAI: الحد الأقصى الحقيقي للذكاء الاصطناعي قد لا يقيسه أحد
مع دخول نماذج اللغات الكبيرة تدريجيًا في مهام معقدة مثل الاستدلال والبحث الآلي وأمن الشبكات، تواجه طرق تقييم النماذج التقليدية تحديات جديدة.لفترة طويلة، كان إطلاق النماذج يصاحبه عادةً جداول نتائج تتكون من اختبارات متنوعة مثل الرياضيات والبرمجة والأسئلة العلمية وأمن الشبكات والاستدلال المعرفي، ويتم مقارنة هذه النتائج مع الجيل السابق من النماذج.