我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了
AI资讯 2026-09-29 11:50
+7475 阅读

说好的未来几周,Anthropic只等了6天。


上周Opus 5.5发布的时候,官方顺手剧透了一嘴,Sonnet 5.5和Haiku 5.5都在后面。


刚刚,Sonnet 5.5先到了。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


而且Claude家的“中杯”,已经撵着刚发布的旗舰追了。


上周Opus 5.5发布时,Terminal-Bench 4.0的66.4%还是一个挺能打的成绩。


Sonnet 5.5一来直接干到了70.6%,上一代Sonnet 5只有10.3%……


在覆盖44种职业真实任务的GDPval-AA里,Opus 5.5拿到1846 Elo,Sonnet 5.5已经追到1844;


OSWorld 2.1测试计算机操作,两者分别拿到81.8%和80.1%。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


当然了,真碰上复杂、开放式、需要长时间判断的任务,Opus 5.5依然明显更强。


Sonnet 5.5更适合日常Coding、修Bug、做文档、PPT、表格这些边界比较明确的活。


价格也继续保持Sonnet档:


输入2美元/百万Token,输出10美元/百万Token,正好只有Opus 5.5的一半。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


中杯贴着大杯跑


而且Sonnet这次不只是更会写代码,干活方式也利索了一点。


早期测试发现,新Sonnet不太爱一个工具一个工具往下磨了,能并行处理的调用会更积极地放到一起。


最后完成同样一项Coding任务,工具调用少了大约三分之一,Shell运行次数差不多直接砍半。


Base44干脆拿118个真实App构建任务来测。


Sonnet 5.5平均跑3.6轮就能做到和Opus 5相当的结果,后者平均需要7.7轮;


同时,新Sonnet还是这组测试里工具调用失败最少的模型。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


还有人直接把它扔进大工程。


Epic Games让Sonnet 5.5去啃数万行游戏系统代码,拿它检查系统架构和数据流;


Unity的验收方式是模型改完代码之后把项目重新打开,真正跑起来才算完成。


最后Sonnet 5.5做完了他们多步骤Unity Editor和Coding测试中90%的任务。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


Anthropic祖传的宝可梦也没落下。


Sonnet 5.5成了Claude家第一款只看游戏截图就成功通关《宝可梦:红》的Sonnet。


这一代Sonnet还多了点设计感,给定幻灯片模版,就能照着原来的版式和视觉规范往下做,生成的PPT只需要少量人工调整,大大减少工作量。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


单次任务花钱更少


Sonnet 5.5这次连API单价没动。


每百万输入Token还是2美元,输出还是10美元,缓存读取也继续维持0.2美元,和Sonnet 5完全一样。


但Anthropic测下来,完成大多数任务的实际成本,最高能再降30%,速度提升30%以上。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


而且这次Anthropic还专门算起了另一笔账,同样的钱,模型到底能干多少活。


Terminal-Bench 4.0上,Sonnet 5.5只开到Medium effort,已经超过Sonnet 5能做到的最好成绩,单任务成本却不到后者的十分之一。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


CursorBench更省,Sonnet 5.5甚至只开Low effort,就能超过Sonnet 5的最高成绩,同样只花不到十分之一的钱。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


到了FrontierCode,比较对象直接换成了GPT-6 Sol。


在Claude Platform默认的High effort下,Sonnet 5.5能做到和GPT-6 Sol最佳成绩相当,而Anthropic给出的单任务成本大约只有后者的五分之一。


我去,Sonnet 5.5代码反超Opus?这下GPT-6 Sol成路边一条了


这两周Claude连续更新,Anthropic已经越来越喜欢把一个数字放在Benchmark旁边:


完成一项任务,到底花多少钱。


而Anthropic接下来还有一款模型,更是来卷这笔账的——


Haiku 5.5。


Anthropic给它的定位很明确,高吞吐量、成本敏感型。


参考链接:

[1]https://x.com/claudeai/status/2104633131760333046

[2]https://www.anthropic.com/claude-sonnet-5-5


文章来自于微信公众号 “量子位”,作者 “量子位”

添加客服微信openai178,进AITNT官方交流群