菜单

GPT-5.6首批实测来了!精准狙击Mythos

刚才,Anthropic发布了藏了两个月的大杀手——Claude Fable 5和Mythos 5,就像扔下一枚炸弹。


现在直接给OpenAI施加压力。


GPT-5.6首批实测来了!精准狙击Mythos 第1张


同一时间,GPT-5.6也泄露了。


OpenAI从上周开始测试内部代码kepler和kindle两个新的检查点。kindle-alpha曝光已被选为发布候选人。


GPT-5.6首批实测来了!精准狙击Mythos 第2张


GPT-5.6的内部测试版本开始在海外开发者和泄漏圈中疯狂测量。代码、候选版本、跑步体感都被翻了出来。


GPT-5.6首批实测来了!精准狙击Mythos 第3张


无论是争夺IPO,还是旗舰模型撞车,两家公司「我也递表你的表」「你发新模型,我也发新模型。」。


纯洁就是打得不可开交。


但问题是,GPT-5.6真的能打过Mythos吗??


GPT-5.6首批实测来了!精准狙击Mythos 第4张


GPT-5.6浮出水面


到目前为止,OpenAI已经对抗了GPT-5.6仍然是零官方公告,尚未正式发布。


然而,许多海外网民还没有公开「内部检查点」探针测试已经完成。


所谓检查点(checkpoint),是模型在训练过程中某个时间点存储的参数快照。


OpenAI内部会有很多份,横向比较,然后从里面挑一个「足够好,可以拿去发」这个版本叫发布候选版(RC)。


从上周开始,OpenAI内部正在测试两个新的检查点,代号是kindle和kepler。其中kindle-alpha候选版被选中发布。


GPT-5.6首批实测来了!精准狙击Mythos 第5张


从流出的体感来看,GPT-5.6这次最反复提到的升级是生成前端/UI。


网友Pankaj Kumar的说法是,kindle-大大提高了alpha的前端生成能力,可以直接输出更强的界面输出,而不需要复杂的提示词或额外的技能。


GPT-5.6首批实测来了!精准狙击Mythos 第6张


此外,它的视觉能力它也很好,在图像理解和图像引用任务方面表现良好,在推理、编码和UI生成方面有了显著的改进。


这是网友Chris测量kindle的效果,使用medium档位:


GPT-5.6首批实测来了!精准狙击Mythos 第7张


这是另一位网友之前在非推理版Joule上测量的效果:


GPT-5.6首批实测来了!精准狙击Mythos 第8张


可见前者精致多了。


但是网友Leo拿了同样的prompt、kepler和kindle分别在xhigh档位测量。


与kepler相比,发现kindle还在退步。


GPT-5.6首批实测来了!精准狙击Mythos 第9张


嗯..这种效果真的很难评价。


他甚至判断OpenAI很可能会继续打磨,不排除最终弃用kindle作为候选版。


最新消息是,kindle已经被移出Arena,出现了一个新模型Levi。


有网友猜测Levi也可能是GPT-5.6内部版本的代号,并将其与GPT-5.5的前端能力进行了比较:


GPT-5.6首批实测来了!精准狙击Mythos 第10张


由此可见,Levi的前端也相当不错,风格清新简约,富有高级感,细节处理也很到位。


但有网友发现,Levi可能来自Meta,而不是GPT-5.6。


GPT-5.6首批实测来了!精准狙击Mythos 第11张


那么,GPT-5.6到底能打过Mythos吗?


网友mark_k声称,GPT-5.6「多个agentic 击败Mythoss的coding基准」。


GPT-5.6首批实测来了!精准狙击Mythos 第12张


但目前更有说服力的是前面展示的网友Leo的实测。他认为GPT-5.6的情况并不乐观:


与kepler相比,kindle是退步。以其目前的形式,很容易被Mythos击败。


六月,御三家上演「速度与激情」


六月,夏天来了,大模型圈也热了起来。


海外AI御三家模型的发布时间都撞在了一起:Fable 5、Gemini 3.5 Pro、GPT-5.6,上演了一出「生死时速」。


而且玩的是同一批能力-推理、智能体、编码、前端生成。


有趣的是,虽然三家公司在6月份都把节点压在了上面,但是到目前为止,真正交卷子的只有A社一家。


Gemini 3.5 Pro出现在5月19日的谷歌I/O大会上,专注于200万token上下文和Deep Think推理。


但是还没有正式上线,官方定于6月正式可用。


GPT-5.6,消息传出是本月晚些时候发布。


这也给OpenAI的情况增添了一层张力:对手已经把分数贴出来了,内部可能还在纠结应该交哪个RC版本。


但除了跑分,定价也是一个重要因素。


Fable 5.Mythos 5统一定价为Token10美元,Token50美元。


约为现有Opus的两倍。


如果GPT-5.6在能力上与Mythos持平甚至略有损失,但价格要便宜得多,那么它仍然有可能在实际利用率上拉回一个城市~


目前OpenAI还没有官方公告,真正的决斗要等GPT-5.6正式版和Fable正面跑分的那一刻。——


这个月大概率见分晓,敬请期待~


参考链接:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


作者来自“量子位” "听雨"。

有用吗?

技术支持在线客服
侧栏
返回顶部