BenchmarkSWE-bench
SWE-Atlas
面向真实软件工程任务的编程能力基准,聚焦于在真实GitHub仓库中定位并修复issue的端到端能力,是衡量编程Agent实际可用性的重要指标,为SWE-bench的后续演进版本
Timeline (last 90 days)
Sep 16
官方声称 Weave Router 2.0 在 Terminal-Bench 4.0 和 SWE-Atlas 基准上表现可匹敌 GPT-6 Astra,但成本只有一半、速度快一倍
Unverified50%
Sep 16
Terminal-Bench 侧重在终端环境中完成多步骤命令行任务的能力,SWE-Atlas(及其前身 SWE-bench)聚焦于在真实 GitHub 仓库中定位并修复 issue 的端到端能力
Unverified50%