[控场AI]
基准SWE-bench

SWE-Bench

SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。

时间轴 (近 90 天)

6月3日

Antigravity搭载的Gemini 3 Pro模型在SWE-Bench测试中得分76.2%

待验证80%
6月3日

2024年初SWE-Bench最好的系统得分仅在30%左右

待验证70%
6月2日

Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上

待验证60%

全部知识事实 (3)

来源文章