• OpenAI科学家Noam Brown:AI的真正上限,可能根本没人测得起

    随着大语言模型逐渐进入复杂的推理、自动化研究和网络安全等困难任务,传统的模型评价方法正面临着新的挑战。长期以来,模型发布往往伴随着由数学、编程、科学问答、网络安全、知识推理等多种基准测试组成的结果表,并与上一代模型进行水平比较。...

    OpenAI科学家Noam Brown:AI的真正上限,可能根本没人测得起
  • 做AI研究时Claude会偷偷变笨,Anthropic被研究界围攻

    Claude Fable 5 是今天 AI 该领域的核心热点,这个「神话级」模型性能非常出色,吸引了无数的关注。Andrej Karpathy 称其「非常令人兴奋」,是「配得上大版本升级的跃迁式进步」,与去年 11 月 Claude 4.5 所带来的提升属于同一水平。SWE-bench Pro 编程基准,Fable 5 拿到了 80.3% 得分,超越 Opus 4.8 整整 11 一个百分点。拥有一个 5000 万行代码的 Ruby 在代码库中,它在一天内完成了全库迁移,如果将同样的工作量交给人类团队,需要两个多月的时间。...

    做AI研究时Claude会偷偷变笨,Anthropic被研究界围攻
  • GPT-5.6首批实测来了!精准狙击Mythos

    刚才,Anthropic发布了藏了两个月的大杀手——Claude Fable 5和Mythos 5,就像扔下一枚炸弹。现在直接给OpenAI施加压力。...

    GPT-5.6首批实测来了!精准狙击Mythos

没有更多了