SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。
2024年初SWE-Bench最好的系统得分仅在30%左右
Antigravity搭载的Gemini 3 Pro模型在SWE-Bench测试中得分76.2%
Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上
Anthropic的Claude系列模型在SWE-bench等权威评测中持续领先
截至2025年初,SWE-bench上最优方案的通过率约在60%左右
Claude 3.5 Sonnet在SWE-bench等代码基准测试中长期领先
SWE-bench由普林斯顿大学研究团队于2023年发布,从12个知名Python开源项目中收集了2,294个真实的GitHub Issue及其对应的Pull Request修复方案
目前顶尖AI Agent(如Devin、SWE-agent)在SWE-bench上的解决率约为40-55%
SWE-Bench Verified是经人工验证的500道高质量子集,SWE-Bench Lite是300道较简单的子集
Sonnet 4.6单独执行在SWE-Bench上得分72.1,成本$1.09;而Sonnet 4.6执行加Opus顾问得分74.8,成本$0.96
还有 40 条时间轴事件