基准SWE-bench
SWE-Atlas
面向真实软件工程任务的编程能力基准,聚焦于在真实GitHub仓库中定位并修复issue的端到端能力,是衡量编程Agent实际可用性的重要指标,为SWE-bench的后续演进版本
时间轴 (近 90 天)
9月16日
官方声称 Weave Router 2.0 在 Terminal-Bench 4.0 和 SWE-Atlas 基准上表现可匹敌 GPT-6 Astra,但成本只有一半、速度快一倍
待验证50%
9月16日
Terminal-Bench 侧重在终端环境中完成多步骤命令行任务的能力,SWE-Atlas(及其前身 SWE-bench)聚焦于在真实 GitHub 仓库中定位并修复 issue 的端到端能力
待验证50%