SWE-Bench
SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。
核心事实
时间轴 (近 90 天)
SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁
全部知识事实 (12)
SWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁
90%已验证SWE-bench由普林斯顿大学研究团队于2023年发布,从12个知名Python开源项目中收集了2,294个真实的GitHub Issue及其对应的Pull Request修复方案
80%已验证SWE-bench由普林斯顿大学提出,包含来自真实GitHub仓库的2294个软件工程问题
80%已验证SWE-bench是由普林斯顿大学研究团队于2023年推出的软件工程能力评测基准
75%已验证SWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标
75%已验证评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
75%已验证SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁
65%已验证专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化
65%已验证Devin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现
65%待验证2024年初SWE-Bench最好的系统得分仅在30%左右
70%部分验证SWE-bench收集的项目包括Django、scikit-learn、sympy等知名Python开源项目
65%待验证Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上
60%