OpenAI科学家Noam Brown:AI的真正上限,可能根本没人测得起
随着大语言模型逐渐进入复杂的推理、自动化研究和网络安全等困难任务,传统的模型评价方法正面临着新的挑战。长期以来,模型发布往往伴随着由数学、编程、科学问答、网络安全、知识推理等多种基准测试组成的结果表,并与上一代模型进行水平比较。...
随着大语言模型逐渐进入复杂的推理、自动化研究和网络安全等困难任务,传统的模型评价方法正面临着新的挑战。长期以来,模型发布往往伴随着由数学、编程、科学问答、网络安全、知识推理等多种基准测试组成的结果表,并与上一代模型进行水平比较。...
Claude Fable 5 是今天 AI 该领域的核心热点,这个「神话级」模型性能非常出色,吸引了无数的关注。Andrej Karpathy 称其「非常令人兴奋」,是「配得上大版本升级的跃迁式进步」,与去年 11 月 Claude 4.5 所带来的提升属于同一水平。SWE-bench Pro 编程基准,Fable 5 拿到了 80.3% 得分,超越 Opus 4.8 整整 11 一个百分点。拥有一个 5000 万行代码的 Ruby 在代码库中,它在一天内完成了全库迁移,如果将同样的工作量交给人类团队,需要两个多月的时间。...
刚才,Anthropic发布了藏了两个月的大杀手——Claude Fable 5和Mythos 5,就像扔下一枚炸弹。现在直接给OpenAI施加压力。...
Fable 5 刚上线,系统提示词就泄露了:看完这个提示词,有几点比较关键:第一,Fable 给 Artifact 增加了持久存储 API(window.storage)。Artifact 就是 Claude 代码生成的独特内容,如 HTML 页面、React 组件等。以前 Artifact 数据无法保存,更像是一次性 demo。现在数据可以跨会话保存,可以支持“有记忆”的小工具,如排行榜、打卡器、日记等。...
Voice AI,是通用大模型之外的另一条故事线。 当所有人都在盯着通用大模型时,Voice AI 这条相对安静的赛道里,也开始出现一些值得注意的新模型。 键盘正在失去它的「统治地位」。 过去两年,OpenAI 推出了 Realtime API,Google 做出了 Gemini Live,国内的大模型公司也几乎都开始布局 Voice AI。越来越多的人开始相信,当 Agent 真正进入工作流之后,语音会成为比键盘更自然的上下文入口。 如果 Agent 想真正进入工作流,它首先要学会听懂这些声音。而这背后对应的第一层能力,就是 ASR(自动语音识别)。 衡量 ASR 水平,业内最常引用的是 Hugging Face 的 Open ASR Leaderboard,核心指标是词错误率(WER),数字越低,识别越准。...
没有更多了