[KongchangAI]
BenchmarkSWE-bench

SWE-Bench

SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。

Core Facts

Timeline (last 90 days)

Sep 16

现有主流智能体评测基准(如Web Arena、SWE-Bench、Gaia、TerminalBench)大多假设一个静态环境,在评测过程中环境不变

Unverified50%
Sep 15

Agent 评估当前主流方案分为三类:基于确定性断言的任务完成率、LLM-as-Judge、端到端基准测试集(如 SWE-Bench、WebArena)

Unverified50%
Jul 13

SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁

Verified80%

All Facts (20)

Verified

SWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁

90%
Verified

SWE-Bench由普林斯顿大学研究团队于2023年发布

90%
Verified

SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁

80%
Verified

SWE-bench由普林斯顿大学研究团队于2023年发布,从12个知名Python开源项目中收集了2,294个真实的GitHub Issue及其对应的Pull Request修复方案

80%
Verified

SWE-Bench从GitHub上12个主流Python开源项目中收集了2294个真实的Issue-Pull Request对

80%
Verified

SWE-bench是由普林斯顿大学研究团队于2023年推出的软件工程能力评测基准

80%
Verified

SWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标

80%
Verified

评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench

80%
Verified

SWE-Bench由普林斯顿大学于2023年推出,从GitHub真实开源项目中抽取数千个已解决的Issue来评测AI编程能力

80%
Verified

SWE-bench由普林斯顿大学提出,包含来自真实GitHub仓库的2294个软件工程问题

80%
Verified

2024年初时,最强AI模型在SWE-Bench上的得分仅在10%-20%区间

65%
Verified

专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化

65%
Verified

Devin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现

65%
Verified

SWE-Bench由普林斯顿大学研究团队发布,从GitHub上收集真实的Issue报告和对应的Pull Request修复补丁

65%
Partially Verified

SWE-Bench测试集包含来自12个主流Python开源项目的2294个真实Bug修复任务

80%
Unverified

o3-mini-high在SWE-Bench上修复了39%的错误,允许调用内部工具后成功率飙升到61%

80%
Unverified

2024年初SWE-Bench最好的系统得分仅在30%左右

70%
Unverified

在SWE-Bench等真实软件工程基准中,顶尖模型往往需要平均30-50次工具调用才能完成一个Issue修复

70%
Partially Verified

SWE-bench收集的项目包括Django、scikit-learn、sympy等知名Python开源项目

65%
Unverified

现有主流智能体评测基准(如Web Arena、SWE-Bench、Gaia、TerminalBench)大多假设一个静态环境,在评测过程中环境不变

50%

Source Articles