Cognition推出SWE-2编程模型:性能逼近顶尖,成本直降64%

Cognition发布SWE-2编程模型,基于Kimi K3后训练,以四分之一成本实现接近顶尖的编程能力。
Cognition推出新一代编程模型SWE-2,核心策略是在保持接近顶尖性能的同时大幅压低成本。该模型基于Kimi K3进行后训练,采用强化学习同时优化能力与经济性两个维度。在FrontierCode 1.1基准测试中,SWE-2得分50.0%,与Fable 5.1相差不足一个百分点,但成本低64%;相比GPT-6 Astra,成本仅为其四分之一。与前代SWE-1.7相比,完成相同任务所需交互轮次减少58%、成本降低81%,得分反而更高。SWE-2已集成至Devin Desktop和CLI,代表了AI编程赛道从追求跑分转向追求效率与性价比的新趋势。
AI编程模型的竞争已经从单纯的能力比拼,转向了性能与成本的双重博弈。Cognition最新发布的SWE-2编程模型,正是这一趋势的典型代表——它没有一味追求跑分登顶,而是在保持接近顶尖水平的同时,把成本压到了竞品的三分之一乃至更低。

SWE-2 是什么
SWE-2 是 Cognition 推出的新一代编程模型,其技术路线值得关注:它基于 Kimi K3 进行后训练(post-trained),并采用了强化学习(RL)方法,同时对成本与能力两个维度进行优化。
这种"双目标优化"的思路,与过去很多模型只盯着基准测试分数的做法不同。在实际的软件工程场景中,开发者不仅关心模型能不能解决问题,更在意每次调用消耗多少 token、需要多少轮交互才能完成任务。SWE-2 从训练阶段就把这些经济性指标纳入了优化目标,这是它区别于纯粹"性能怪兽"的核心设计理念。
目前 SWE-2 已经集成到 Devin Desktop 和 CLI 中,用户可以直接使用。作为以 AI 软件工程师 Devin 而闻名的公司,Cognition 将自研模型与自家产品深度绑定,形成了从底层模型到上层应用的完整闭环。
性能与成本:核心数据拆解
从官方公布的数据来看,SWE-2 的定位相当清晰——用可接受的性能折损,换取显著的成本优势。
在 FrontierCode 1.1 Main 基准测试上,SWE-2 取得了 50.0% 的成绩。这个分数与竞品 Fable 5.1 相差不到一个百分点,但成本却低了 64%。换句话说,你几乎能拿到同等的编程能力,却只需要支付三分之一多一点的费用。
与更强的 GPT-6 Astra 相比,SWE-2 的得分落后几个百分点,但成本仅为对方的四分之一。对于大多数日常编程任务而言,这几个百分点的差距往往不足以抵消四倍的成本差异——尤其是在需要大规模、高频率调用模型的工程实践中。
相比前代的进步
SWE-2 最能说明问题的对比,其实是它与自家前代 SWE-1.7 的差距。
根据官方数据,完成相同任务时,SWE-2 所需的交互轮次减少了 58%,成本降低了 81%,同时得分还更高。这组数字揭示了一个关键信息:模型的进步不再只体现在"能力上限",更体现在"效率"上。
更少的交互轮次意味着模型能更快理解需求、更精准地一次性给出可用结果,减少了反复澄清和试错的开销。对于依赖 Agent 工作流的编程场景,轮次的减少直接转化为响应速度的提升和成本的下降。这也解释了为什么 Cognition 要在训练中同时优化成本——在 Agent 时代,一个任务往往要经过多轮调用,任何单轮效率的提升都会被成倍放大。
为什么"性价比"路线值得关注
SWE-2 在 Product Hunt 上获得了 119 个投票,排名当日第三,位列人工智能分类。这样的关注度,某种程度上反映了市场对高性价比编程模型的真实需求。
过去一段时间,AI 编程工具的竞争往往陷入"跑分军备竞赛",各家都在争夺基准测试的第一名。但对于真正的商业落地来说,跑分领先几个点的意义有限,而成本能否控制在可持续范围内,才决定了这类工具能否被规模化采用。
SWE-2 选择的正是一条更务实的路线:不追求绝对性能第一,而是在"足够好"的性能区间内,把成本优势做到极致。当一个模型能以四分之一的成本达到接近顶尖的表现时,它对企业和个人开发者的吸引力可能远超那些榜首但昂贵的选项。
结语
SWE-2 的发布,是 AI 编程赛道从"比能力"走向"比效率"的一个信号。基于 Kimi K3 后训练、用强化学习同时优化成本与能力的技术路线,加上与 Devin 产品的深度整合,让它在拥挤的编程模型市场中找到了差异化定位。对于关心投入产出比的开发者和团队而言,这类高性价比模型或许比追逐榜首更有实际价值。当然,官方公布的基准数据仍需在真实开发场景中进一步验证,其实际表现有待更多用户反馈来检验。
相关推荐

Perplexity混合计算:云端研究,本地Mac保护隐私
Perplexity在Mac应用上推出Hybrid Compute混合计算功能,将AI任务拆分:云端负责研究推理,本地Mac处理私密文件保护隐私。支持Apple Silicon、24GB内存,面向Pro/Max/Enterprise用户开放。

Resurf:把个人信息喂给AI的上下文管理神器
Resurf 是一款个人上下文应用,可保存笔记、链接、图片和PDF,并通过 MCP 和 CLI 将个人资料交给 AI 使用。原生支持 Mac/iPhone/iPad,本地存储加 iCloud 同步保障隐私。

ScreenCursor:让屏幕录制自动生成缩放特效的工具
ScreenCursor 是一款带自动缩放特效的屏幕录制工具,能把每次点击、拖拽和按键自动转化为镜头运动,无需剪辑且全程本地处理。本文解析其核心功能、隐私优势与竞争定位。