SWE-Bench
SWE-Bench是一个用于评估AI系统软件工程能力的基准测试集,由学术研究者构建。它从真实开源代码仓库中收集GitHub issue及对应的代码修复任务,要求模型根据问题描述自动生成能够通过测试用例的代码补丁,以此衡量AI在真实软件工程场景中的问题定位、代码理解与修复能力。
Core Facts
Timeline (last 90 days)
现有主流智能体评测基准(如Web Arena、SWE-Bench、Gaia、TerminalBench)大多假设一个静态环境,在评测过程中环境不变
Agent 评估当前主流方案分为三类:基于确定性断言的任务完成率、LLM-as-Judge、端到端基准测试集(如 SWE-Bench、WebArena)
SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁
All Facts (20)
SWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁
90%VerifiedSWE-Bench由普林斯顿大学研究团队于2023年发布
90%VerifiedSWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁
80%VerifiedSWE-bench由普林斯顿大学研究团队于2023年发布,从12个知名Python开源项目中收集了2,294个真实的GitHub Issue及其对应的Pull Request修复方案
80%VerifiedSWE-Bench从GitHub上12个主流Python开源项目中收集了2294个真实的Issue-Pull Request对
80%VerifiedSWE-bench是由普林斯顿大学研究团队于2023年推出的软件工程能力评测基准
80%VerifiedSWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标
80%Verified评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
80%VerifiedSWE-Bench由普林斯顿大学于2023年推出,从GitHub真实开源项目中抽取数千个已解决的Issue来评测AI编程能力
80%VerifiedSWE-bench由普林斯顿大学提出,包含来自真实GitHub仓库的2294个软件工程问题
80%Verified2024年初时,最强AI模型在SWE-Bench上的得分仅在10%-20%区间
65%Verified专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化
65%VerifiedDevin在SWE-bench测试中解决了13.86%的真实GitHub Issues,高于Claude 2的表现
65%VerifiedSWE-Bench由普林斯顿大学研究团队发布,从GitHub上收集真实的Issue报告和对应的Pull Request修复补丁
65%Partially VerifiedSWE-Bench测试集包含来自12个主流Python开源项目的2294个真实Bug修复任务
80%Unverifiedo3-mini-high在SWE-Bench上修复了39%的错误,允许调用内部工具后成功率飙升到61%
80%Unverified2024年初SWE-Bench最好的系统得分仅在30%左右
70%Unverified在SWE-Bench等真实软件工程基准中,顶尖模型往往需要平均30-50次工具调用才能完成一个Issue修复
70%Partially VerifiedSWE-bench收集的项目包括Django、scikit-learn、sympy等知名Python开源项目
65%Unverified现有主流智能体评测基准(如Web Arena、SWE-Bench、Gaia、TerminalBench)大多假设一个静态环境,在评测过程中环境不变
50%