[控场AI]
基准SWE-bench

SWE-Atlas

面向真实软件工程任务的编程能力基准,聚焦于在真实GitHub仓库中定位并修复issue的端到端能力,是衡量编程Agent实际可用性的重要指标,为SWE-bench的后续演进版本

时间轴 (近 90 天)

9月16日

官方声称 Weave Router 2.0 在 Terminal-Bench 4.0 和 SWE-Atlas 基准上表现可匹敌 GPT-6 Astra,但成本只有一半、速度快一倍

待验证50%
9月16日

Terminal-Bench 侧重在终端环境中完成多步骤命令行任务的能力,SWE-Atlas(及其前身 SWE-bench)聚焦于在真实 GitHub 仓库中定位并修复 issue 的端到端能力

待验证50%

全部知识事实 (2)

来源文章