SWE-2
Cognition发布的新一代代码智能模型,专门针对软件工程任务优化,旨在实现理解需求、定位bug、修改代码库并通过测试等端到端软件工程能力
Timeline (last 90 days)
SWE-2是由Cognition基于月之暗面的Kimi K2模型构建的编程模型,于9月10日发布,主打成本优势
Devin的定价页面显示SWE-2在其桌面应用和命令行中免费使用至10月16日
Cognition表示SWE-2在其自有编程测试中的得分与Anthropic的Claude模型仅相差一分,成本却低64%
Cognition推出了新一代编程模型SWE-2
SWE-2基于Kimi K3进行后训练(post-trained),并采用强化学习(RL)方法,同时对成本与能力两个维度进行优化
SWE-2已集成到Devin Desktop和CLI中,用户可直接使用
SWE-2在FrontierCode 1.1 Main基准测试上取得了50.0%的成绩
SWE-2的基准得分与竞品Fable 5.1相差不到一个百分点,但成本低了64%
与GPT-6 Astra相比,SWE-2得分落后几个百分点,但成本仅为对方的四分之一
完成相同任务时,SWE-2所需的交互轮次比前代SWE-1.7减少了58%,成本降低了81%,同时得分更高
14 more timeline events
All Facts (20)
Cognition表示SWE-2在其自有编程测试中的得分与Anthropic的Claude模型仅相差一分,成本却低64%
50%UnverifiedDevin的定价页面显示SWE-2在其桌面应用和命令行中免费使用至10月16日
50%UnverifiedSWE-2基于Kimi K3进行后训练(post-trained),并采用强化学习(RL)方法,同时对成本与能力两个维度进行优化
50%UnverifiedSWE-2已集成到Devin Desktop和CLI中,用户可直接使用
50%UnverifiedSWE-2在FrontierCode 1.1 Main基准测试上取得了50.0%的成绩
50%UnverifiedSWE-2的基准得分与竞品Fable 5.1相差不到一个百分点,但成本低了64%
50%Unverified与GPT-6 Astra相比,SWE-2得分落后几个百分点,但成本仅为对方的四分之一
50%Unverified完成相同任务时,SWE-2所需的交互轮次比前代SWE-1.7减少了58%,成本降低了81%,同时得分更高
50%UnverifiedSWE-2采取在足够好的性能区间内把成本优势做到极致的务实路线,而非追求绝对性能第一
50%UnverifiedSWE-2的命名指向软件工程(Software Engineering)方向的能力升级
50%UnverifiedSWE-2 是 Cognition 全新推出的编码模型,是 Devin 引擎的迭代版本,专门针对软件工程场景进行训练和调优
50%UnverifiedDevin Voice 的能力由 GPT-Live 和 SWE-2 两套核心技术支撑,分别负责语音理解和代码生成
50%UnverifiedSWE-2代表自主智能体(Agent)路线,即接收任务目标后独立规划、执行、验证,人类主要负责下达任务和审核最终结果
50%UnverifiedSWE-2很可能是专门针对软件工程任务优化的模型,而非通用大语言模型的简单变体
50%UnverifiedCognition官方宣称SWE-2性能足以与Fable 5.1、GPT-Astra等顶尖模型正面竞争
50%UnverifiedSWE-2是由Cognition基于月之暗面的Kimi K2模型构建的编程模型,于9月10日发布,主打成本优势
50%UnverifiedCognition推出了新一代编程模型SWE-2
50%UnverifiedCognition团队发布了SWE-2
50%UnverifiedCognition发布了新一代软件工程智能体SWE-2
50%UnverifiedCognition推出了新一代代码智能模型SWE-2
50%