AI工具导航

Cognition's SWE-2

Cognition 的编码模型,比 Fable 5.1 便宜 64%

Cognition's SWE-2 是什么?

SWE-2 是 Cognition 推出的新一代编程模型,基于 Kimi K3 通过强化学习后训练而来,在成本与能力之间取得了出色平衡。它在 FrontierCode 1.1 Main 上取得 50.0% 的成绩,接近 Fable 5.1 但价格低 64%,同时以四分之一的成本逼近 GPT-6 Astra 的水准;相比前代 SWE-1.7,对话轮次减少 58%、成本下降 81%,得分却更高。目前已可在 Devin Desktop 和 CLI 中直接使用。

产品详细介绍

Cognition 的编码模型,比 Fable 5.1 便宜 64%

SWE-2 是 Cognition 推出的新一代编程模型,基于 Kimi K3 通过强化学习后训练而来,在成本与能力之间取得了出色平衡。它在 FrontierCode 1.1 Main 上取得 50.0% 的成绩,接近 Fable 5.1 但价格低 64%,同时以四分之一的成本逼近 GPT-6 Astra 的水准;相比前代 SWE-1.7,对话轮次减少 58%、成本下降 81%,得分却更高。目前已可在 Devin Desktop 和 CLI 中直接使用。

定价方案

需要付费
官网查看
定制方案
  • 暂未采集到具体套餐,价格以官网为准

创始人评论

M
Maker创始人

SWE-2 是 Cognition 的新一代编程模型,旨在接近前沿水平而不收取前沿价格。

问题所在:编程智能体越智能就越昂贵,往往伴随着大量 token 消耗。他们自家的 SWE-1.7 就存在这个问题——用户反馈它在简单任务上过度探索。

他们的做法:使用强化学习对 Kimi K3 进行后训练,将单次运行的实际美元成本纳入训练奖励中,并一次性训练所有三个投入级别(中、高、Max),而非拼接多个独立模型。因此,整条成本-性能曲线整体上移,而不仅仅是顶端提升。

数据表现:

• 在 FrontierCode 1.1 Main 上达到 50.0%,与 Fable 5.1 相差仅一个百分点,成本却低 64%

• 以四分之一的价格,在性能上仅落后 GPT-6 Astra 几分

• 在 Terminal-Bench 2.1 上达到 92.8%,在其对比表中位列榜首

• 对比 SWE-1.7:交互轮次减少 58%,成本降低 81%,得分却更高。首次代码编辑从 48 步提前到 18 步

同样值得关注的是:端到端测试编写能力更强,并且在你提出反驳时会重新推导结论,而不是一味附和。

如果你在大规模运行编程智能体,且单任务成本是一项实际支出项,那么它会是不错的选择。现已在 Devin Desktop 和 CLI 中可用,并正在向 Web 和 Fusion 逐步推出。

试用链接:SWE-2 详细文章

附言:我专注于追踪科技、SaaS 和 AI 领域的最新发布,欢迎关注以便获取通知 → @rohanrecommends