[控场AI]
基准SWE-bench

SWE-Bench

SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。

核心事实

时间轴 (近 90 天)

7月13日

SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁

已验证65%

全部知识事实 (12)

已验证

SWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁

90%
已验证

SWE-bench由普林斯顿大学研究团队于2023年发布,从12个知名Python开源项目中收集了2,294个真实的GitHub Issue及其对应的Pull Request修复方案

80%
已验证

SWE-bench由普林斯顿大学提出,包含来自真实GitHub仓库的2294个软件工程问题

80%
已验证

SWE-bench是由普林斯顿大学研究团队于2023年推出的软件工程能力评测基准

75%
已验证

SWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标

75%
已验证

评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench

75%
已验证

SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁

65%
已验证

专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化

65%
已验证

Devin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现

65%
待验证

2024年初SWE-Bench最好的系统得分仅在30%左右

70%
部分验证

SWE-bench收集的项目包括Django、scikit-learn、sympy等知名Python开源项目

65%
待验证

Composer的基准测试数据是内部闭源基准,未与Claude、GPT-5或Gemini直接对比,也未出现在LM Arena或SWE-Bench等外部基准上

60%

来源文章