突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」
AI资讯 2026-09-23 08:27
+9044 阅读

就在刚刚,OpenAI 与 Anthropic 几乎同时推出新模型:OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna;Anthropic 则发布性能直逼 Fable 5.1 的 Claude Opus 5.5。


OpenAI 表示,GPT-6 Sol 与 GPT-6 Luna 脱胎于此前顶级的 GPT-6 Astra 底座,重点是将 Astra 的核心推理与多模态优势下放,重构出更轻量、吞吐量更高的运行版本。也就是说,GPT-6 Astra 承担的是能力探索角色,而 Sol 和 Luna 则承担能力规模化应用的任务。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


价格方面则直接「腰斩」,与 GPT-5.6 的促销价相比,Sol 与 Luna 的价格直接降低了 50%。


随后,Sam Altman 在社交平台发文,强调这是 OpenAI 推动「智能普及化」的必经之路 —— 让开发者不再受制于昂贵的算力账单。


「尤其是按照单任务成本(per-task pricing)来比较 —— 而这才是我们认为真正应该关注的指标 —— 我认为目前市场上没有任何产品具备真正的竞争力。


我们希望人们能够大量使用 AI,因为这对于探索眼前这场新的「文艺复兴」非常重要。只有让更多人能够广泛使用 AI,才能真正释放这一轮技术变革带来的可能性。」


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


而 Anthropic 拿出的则是 Claude Opus 5.5。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


作为 Claude 系列中的高性能模型,Opus 5.5 延续了 Anthropic 在复杂任务、代码生成和企业工作流领域的重点布局。


Anthropic 表示,相比 Opus 5,Opus 5.5 在典型任务中的成本降低约 40%,输出速度提升超过 30%。


下面具体来看一下。


OpenAI 发布 GPT-6 Sol、Luna:


将 Astra 能力推向规模化应用、价格「腰斩」


OpenAI 表示,本月早些时候推出了 GPT-6 Astra,这是全球最智能、对齐程度最高的模型,但考虑现实中的工作存在不同规模、不同节奏以及不同预算需求。因此推出 GPT-6 Sol 和 GPT-6 Luna。


如果说,GPT-6 Astra 开启了新一代智能模型,而这两个模型则通过提升成本效率,让更多人能够获得这种智能能力。


OpenAI 认为,模型能力提升固然重要,但单位任务成本同样成为企业部署 AI 时的重要考量。因此此次重点优化了缓存机制和推理效率,并将节省的成本反馈给用户。


  • 博客链接:https://openai.com/index/introducing-gpt-6-sol-and-luna/


相较于 GPT-5.6,GPT-6 Sol 和 Luna 的 API 价格降低了 50%。


  • GPT-6 Sol:输入价格从每百万 token 4 美元降低到 2 美元;输出价格从每百万 token 20 美元降低到 10 美元。
  • GPT-6 Luna:输入价格从每百万 token 0.20 美元降低到 0.10 美元;输出价格从每百万 token 1.20 美元降低到 0.50 美元。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


价格下来了,但性能依旧能打。


在 AutomationBench 测试中(该测试评估跨应用的企业工作流),GPT-6 Sol 在最高推理强度(xhigh effort)下超过了 Claude Opus 5 的最高强度表现,而每个任务成本仅为 Opus 5 的 9%。


而在高推理强度下,GPT-6 Luna 相比上一代模型提升了 5.4 个百分点,同时每个任务成本降低 58%。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


同时,GPT-6 Sol 也以更低成本超过 Claude Fable 5.1,同时甚至超过了低推理强度下的 GPT-6 Astra。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


而在内部事实准确性测试中,该测试基于经过匿名处理的真实用户对话(用户曾标记模型错误),GPT-6 Sol 的错误数量约为上一代模型的一半,接近 Astra 级别的可靠性,同时成本更低。


GPT-6 Luna 也取得明显提升:在更高推理强度下,它能够以约百分之一的成本达到 GPT-5.6 Sol 的水平。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


另一个重要变化则出现在软件开发领域,随着 Coding Agent 开始承担越来越复杂的任务,持续运行成本成为开发团队的重要考量。


编程能力上,OpenAI 表示 GPT-6 Sol 和 Luna 在保持强大代码能力的同时,通过更低 API 价格,让开发者拥有更多试验空间,也让团队能够更加大胆地使用 Codex 执行复杂任务。


在 FrontierCode 测试中,GPT-6 Sol 相比 GPT-5.6 Sol 有明显提升,并以更低成本达到 Claude Fable 5.1 xhigh 的水平。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


在 DeepSWE v1.1 测试中:GPT-6 Sol 在最高推理强度下获得 68.8% 分数,仅比 Claude Fable 5 的最高成绩 69.9% 低 1.1 个百分点。但 GPT-6 Sol 每个任务成本降低约 80%。GPT-6 Luna 在最高推理强度下获得 66.6%,接近 Claude Opus 5 和 Fable 5 的中等推理强度表现。


在这些比较中:Luna 相比 Opus 5,每任务成本降低 93%;相比 Fable 5,每任务成本降低 96%。


这或许是在说明 OpenAI 的目标并不是简单制造一个更强模型,而是在寻找单位智能成本最低的模型。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


计算机操作能力上,GPT-6 Sol 和 Luna 相比上一代模型提供了更高成本效率。


在 OSWorld 2.0 offline 测试中,GPT-6 Sol 在最高推理强度下达到与 Claude Opus 5 中等推理强度相近的成绩:


  • GPT-6 Sol:60.5% 
  • Claude Opus 5:60.3% 


但 GPT-6 Sol 每任务成本降低约 80%,GPT-6 Luna(max)则能够超过 GPT-5.6 Sol(medium),同时成本仅为其十分之一。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


而除了模型价格下降,OpenAI 还针对 Agent 长任务场景优化了缓存机制,改进了 GPT-6 的 Prompt Caching,使默认缓存命中率更高,从而帮助 Agent 复用更多上下文、更快响应、对缓存输入 token 读取享受 90% 折扣。


这意味着,未来模型竞争不仅是模型本身的能力竞争,也包括整个推理基础设施效率竞争。


Anthropic:Opus 5.5 来了,Fable 级能力


OpenAI 发布的另一边,Anthropic 这次同样非常强调「效率」。


Claude Opus 5.5 是 Claude 5.5 系列的第一款模型。Anthropic 给它的定位非常直接:大多数任务达到 Claude Fable 5.1 的水平,但相比 Opus 5,典型任务运行成本降低约 40%,输出速度则提高超过 30%。


  • 博客链接:https://www.anthropic.com/claude-opus-5-5/


先看能力。


在 Anthropic 公布的 headline comparison table 中,Opus 5.5 在列出的项目上全部高于 Fable 5.1。


Terminal-Bench 4.0 上,Opus 5.5 达到 66.4%,Fable 5.1 为 55.8%;FrontierCode v1.1 Main 为 54.4% 对 50.3%;面向真实知识工作的 GDPval-AA v2.1,则是 1846 对 1735。


Agentic coding、知识工作、计算机操作,基本都是这代 Opus 主要的能力提升方向。Anthropic 官方发布也将其称为相比 Opus 5 的一次明显升级。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


这当然不意味着「Opus 5.5 已经全面超过 Fable 5.1」。不同 benchmark 使用的 harness、工具和推理强度并不完全一致;就在 Anthropic 自己的表格中,GPT-6 Astra 也仍然在 AutomationBench 和 Terminal-Bench-Science 等项目保持更高成绩。


但能明显看到,Opus 和 Fable 之间原本清晰的能力差距,正在迅速缩小。


而从 API 定价来看就更明白 Anthropic 的意思了。


Opus 5.5 每百万输入、输出 Token 分别为 4 美元和 20 美元,而 Fable 5.1 为 10 美元和 50 美元,后者正好是前者的 2.5 倍。两者都拥有 100 万 Token 上下文窗口和最高 128K 的常规输出能力。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


所以这次 Anthropic 没有把 Opus 5.5 描述成一次简单的「性能升级」,而一直在强调单位任务成本。


不再让 Opus「拼命想」


还有一个设置挺有意思。Opus 5.5 的 Adaptive Thinking 永远开启,开发者可以调节推理强度,默认设为 medium;相比之下,Fable 5.1 默认是 high。


这和 Anthropic 公布的一组数据正好对应:在 FrontierCode v1.1 Main 上,Opus 5.5 medium 得分约 54.6%,单任务成本约 0.8 美元;到了 max,成本升至约 6.19 美元,得分反而只有 54.4%。


也就是说,多花近 7.7 倍的钱,并没有换来更高分数。


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


原因之一在于 FrontierCode 会惩罚超出任务范围的修改,即使这些改动本身有益。推理预算提高后,模型反而可能多做一些无用功,因此更多 test-time compute 并不一定带来更好的任务结果。


第三方的实际测试验证了这个说法。CodeRabbit 在自己的多步骤 Code Review 工作流中发现,Opus 5.5 medium 已经可以达到或超过 Opus 5 high 的表现,同时只使用大约一半的 Token。


Token 只便宜 20%,为什么任务能便宜 40%?


Anthropic 给出的解释是,单个 Token 的价格并不能直接代表最终任务成本。


Opus 5.5 相比 Opus 5,普通输入、输出 Token 价格只下降约 20%,但 Cache Read 从每百万 Token 0.50 美元降到 0.20 美元,降幅达到 60%。对于 Claude Code 这类需要反复读取代码和历史上下文的长任务,缓存降价会被持续放大。


再加上 Opus 5.5 完成同一任务所需的 Token 和步骤更少,Anthropic 测得默认设置下,典型任务的总成本最终可降低约 40%。


「每百万 Token 多少钱」不适合单独计算,更合理的方式是放到实际任务中,看看真正做完要花多少钱。


这和 OpenAI 这轮发布的思路,惊人地一致。


能力之外,价格当然很重要


把两家放在一起看,这轮发布好像都很在意一个问题,那就是用户到底愿意为提升的那部分智能付多少钱。


OpenAI 在 7 月底发布过一篇博客,《Building abundant intelligence》。文中提到,客户真正购买的并不是 Token,而是「任务被完成」。因此更合理的衡量方式,应该是一次成功结果的总成本,其中还要算上重试、人工监督、时间和错误带来的代价。


  • 博客链接:https://openai.com/index/building-abundant-intelligence


换句话说,就是「最后事情做完花多少钱」比 Token 计费更贴近用户心理。


Anthropic 这边,其实已经从企业用户那里收到过一次很直接的价格反馈。


Fable 5 发布后,Ramp 对企业模型支出的追踪显示,这款 Anthropic 当时最贵、能力最强的模型,只占 Anthropic 企业 Token 使用量约 6%。Ramp 将其视为一个价格上限信号,企业并不会因为模型更强,就无限接受更高价格。


随后 Fable 5.1 就做了一些调整。Anthropic 在发布时明确说,新版本是在回应客户对价格、数据留存和安全措施的反馈;虽然输入和输出标价没有下降,但 Cache Read 直接降了 75%,使典型工作负载成本下降约 25%,高度 Agentic 任务最高可降约 45%。


更有意思的是,Anthropic 自己的开发者文档甚至建议:大多数任务先从 Opus 5 开始,只有高 effort 的 Opus 仍然不够时,再考虑 Fable 5.1。 


连官方都承认,旗舰模型已经不再是默认选项,而更像是专门留给高难度、长周期任务的昂贵资源。


市场已经开始告诉厂商,仅仅把最强模型继续做强,并不足以让企业持续升级。


当日常任务用 Opus 就已经够好,企业为什么还要支付 Fable 的价格?当 Luna 已经能覆盖越来越多正式工作,为什么每一步都要调用 Astra?


这可能也是两家公司现在共同面对的问题,前沿能力当然还要继续往上发展,但真正想扩大企业使用规模,还是要结合价格来看。


就在 Opus 5.5 发布前三天,路透报道称,Anthropic 正考虑推出新模型,应对 GPT-6 Astra 在企业市场快速获得份额。


OpenAI 和 Anthropic 的这场竞争,恐怕还远没有到休息的时候。


这次两边的发布公告只相差一个小时,甚至有消息称,Fable 5.5 将在 OpenAI 的 DevDay 当天亮相。


而 OpenAI 和 Anthropic 此次的相似操作,似乎也是释放出一个共同信号:AI 正从能力突破阶段进入规模化应用阶段,未来,真正决定 AI 普及速度的,不只是模型 IQ,而是单位任务成本。下一阶段的大模型战争,或许不再只是争夺最高智能峰值,而是谁能够让智能,以最低成本持续创造价值。


对此,广大网友们也是喜闻乐见大家「打起来」。


「我希望它们彼此竞争,最终把智能的价格打到低得离谱。」


突发!GPT-6 Sol与Claude Opus 5.5同日开打,谁是「性价比之王」


那么你呢,如何看待?欢迎在评论区留言、交流!


参考链接:


https://x.com/OpenAI/status/2102460975790137662


https://x.com/i/trending/2102466579913138274


https://x.com/sama/status/2102465143997440308


https://www.anthropic.com/claude-opus-5-5


https://x.com/claudeai/status/2102435511222890900


https://x.com/theojaffee/status/2102454423041818786


https://x.com/FanShifu/status/2102441095066165440


文章来自于微信公众号 “机器之心”,作者 “机器之心”

1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群