待验证50% 置信基准精确时间
Cognition表示SWE-2在其自有编程测试中的得分与Anthropic的Claude模型仅相差一分,成本却低64%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/8
首次发现
有效期至:2027/1/6
来源
涉及实体
相关事实
待验证Cognition发布编码模型Sway 2,在Frontier Code基准上取得50.0%,据称与更强模型差距在1分以内且成本低64%76% 相似待验证对于两个被测试的模型,开启最大推理能力后深度谜题上的让步率从19.2%和12.5%直接降到了0%70% 相似待验证研究版Claude自主攻关约一天半时间,将黎曼Zeta函数零点下界从41.6%提升到67.2%,并给出可形式化验证的结果69% 相似待验证完成相同任务时,SWE-2所需的交互轮次比前代SWE-1.7减少了58%,成本降低了81%,同时得分更高68% 相似待验证在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/989082API
curl https://kongchang.com/api/v1/knowledge/claims/989082MCP
get_claim(id=989082)