• نعوم براون، عالم OpenAI: الحد الأقصى الحقيقي للذكاء الاصطناعي قد لا يقيسه أحد

    مع دخول نماذج اللغات الكبيرة تدريجيًا في مهام معقدة مثل الاستدلال والبحث الآلي وأمن الشبكات، تواجه طرق تقييم النماذج التقليدية تحديات جديدة.لفترة طويلة، كان إطلاق النماذج يصاحبه عادةً جداول نتائج تتكون من اختبارات متنوعة مثل الرياضيات والبرمجة والأسئلة العلمية وأمن الشبكات والاستدلال المعرفي، ويتم مقارنة هذه النتائج مع الجيل السابق من النماذج.

    نعوم براون، عالم OpenAI: الحد الأقصى الحقيقي للذكاء الاصطناعي قد لا يقيسه أحد
  • كلود يصبح غبيًا خفيفًا أثناء إجراء أبحاث الذكاء الاصطناعي ، وتحاصر أنثروبي من قبل مجتمع الأبحاث

    Claude Fable 5 هو النقطة الساخنة الرئيسية في مجال الذكاء الاصطناعي اليوم، حيث يتمتع هذا النموذج “الأسطوري” بأداء ممتاز، مما جذب انتباهًا هائلاً.أندريه كارباثي وصف التحسين بأنه «مثير للغاية» ويمثل «تقدماً نوعياً يستحق ترقية كبيرة»، ويقارن بالتحسينات التي تمت مع إصدار Claude 4.5 في نوفمبر من العام الماضي. في اختبارات برمجة SWE-bench Pro، حقق Fable 5 نتيجة بلغت 80.3%، متفوقاً على Opus 4.8 بنقاط 11%. وبما أن مكتبة الكود الخاصة بـ Fable 5 تحتوي على 50 مليون سطر من الكود، فقد تمكن من إكمال عملية نقل كامل المكتبة في يوم واحد، بينما سيستغرق الأمر أكثر من شهرين لفريق بشري لإكمال نفس المهمة.

    كلود يصبح غبيًا خفيفًا أثناء إجراء أبحاث الذكاء الاصطناعي ، وتحاصر أنثروبي من قبل مجتمع الأبحاث
  • GPT-5.6 هي أول اختبار!قناصة دقيقة Mythos

    للتو، أطلقت شركة Anthropic القاتل الكبير الذي كان مخفيًا لمدة شهرين…Claude Fable 5وMythos 5كما لو أنك ألقيت قنبلة.الآن نضغط مباشرة على OpenAI.

    GPT-5.6 هي أول اختبار!قناصة دقيقة Mythos

لا يوجد المزيد