做 Devin 的公司 Cognition 在 9 月 10 日发布了新的编码模型 SWE-2,同时把它接入 Devin Desktop、Devin CLI、Devin Web 与 Devin Fusion。官方给这次更新的定位很直接:接近前沿的能力,只要一部分价钱。
分数差一点,价格差一大截
在 Cognition 自己的 FrontierCode 1.1 Main 基准上——这套基准考察的是 AI 写的拉取请求是否真会被人类维护者合并——SWE-2 拿到 50.0%。同一测试中,Anthropic 的 Fable 5.1 为 50.9%,OpenAI 的 GPT-6 Astra 为 53.3%,xAI 的 Grok 4.6 为 48.0%,而 Cognition 的上一代 SWE-1.7 为 42.0%。
也就是说,SWE-2 与 Fable 5.1 只差 0.9 分。Cognition 称,达到这个分数的计算成本比 Fable 5.1 低 64%,部分媒体把多个基准上的节省概括为”最多 70%”。
值得注意的是,SWE-2 是在月之暗面的开源模型 Kimi K3 基础上后训练而来,Kimi K3 的参数规模为 2.8 万亿。Cognition 同时表示,这是首次把强化学习扩展到数万亿参数规模。
便宜的原因:少走弯路
SWE-2 是 Cognition 首个支持”投入档位”的模型,提供 medium、high、max 三档,让使用者按任务难度在成本与智能之间取舍,且三档是在同一次强化学习训练中端到端训出来的,而不是分别训练再拼装。
效率上的变化相当明显。在 FrontierCode 1.1 Main 上,SWE-2 的 medium 档得分高于 SWE-1.7,同时平均少用 58% 的轮次、成本低 81%。更直观的一个数字是:SWE-2 medium 在中位数 18 步之后就做出第一次实质性代码修改,而 SWE-1.7 需要 48 步。
原因并不神秘。SWE-1.7 习惯先把代码库翻个底朝天再动手,这在难题上是优势,在简单任务上就成了过度探索。SWE-2 判断力更强,能更早分辨哪部分代码与当前任务真正相关,于是更快进入实现阶段。按官方说法,最大的效率提升来自”聚焦式探索”。
Cognition 还列出了几条内部测试中观察到的行为差异:SWE-2 更擅长写端到端覆盖的测试,更能抓到回归和边界情况;在常规路径被堵住时更愿意换一条路走,比如某次所需的 MCP 集成不可用,它转而从已获得的 Slack 频道记录里重建了数据;在被质疑时倾向于重新推导结论而不是重复原来的说法。三档之间的风格也有区别,medium 上手快、适合中低难度任务,high 和 max 在复杂任务上规划更多、验证更充分。
但硬骨头上还是被拉开
如果只看上面这些数字,SWE-2 像是一次全面胜利。但 Cognition 在自己的发布里也放出了不利的一面:在难度更高的智能体基准 Terminal-Bench 4 上,SWE-2 只拿到 27.3%,而 Fable 5.1 为 55.8%,GPT-6 Astra 为 57.9%。这不是四舍五入能抹平的差距,它说明 SWE-2 的成本优势在日常编码任务上成立,在最难的智能体任务上还撑不住。
怎么用、多少钱
Cognition 这次没有单独开放 API,也没有公布价格表或模型权重,而是把 SWE-2 直接并入了 Devin 现有的订阅:Pro 及以上档位可以无限使用,起步价每月 20 美元。现有的 Pro、Max 与 Teams 订阅用户有一个月的窗口期,其间 SWE-2 的用量完全不计入配额。
还有一点需要说明:上述所有分数与成本对比都由 Cognition 自行报告,FrontierCode 也是该公司自己的基准,”首次将强化学习扩展到数万亿参数”同样是未经独立验证的说法。对正在 Cursor、GitHub Copilot 与各类编码智能体之间做选择的团队来说,判断依据最终还是要看它在真实代码库里交出来的东西需不需要重写。
图片来源:Cognition 官方博客







