Unverified50% confidenceBenchmarkExact time
SWE-bench要求模型修复GitHub上真实Issue,SWE-bench Verified版本于2024年兴起并成为衡量AI Agent编程能力的黄金标准
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/24/2026
First Seen
Valid until: 10/22/2026
Sources
Related Claims
UnverifiedSWE-bench Verified由普林斯顿大学于2023年推出,衡量AI在真实GitHub Issue上的自动化软件工程能力,其Verified子集经过人工审核81% similarUnverifiedSWE-bench于2024年将评测对象从函数扩展到真实GitHub Issue的修复80% similarVerifiedSWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue78% similarVerifiedSWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁77% similarVerifiedSWE-Bench由普林斯顿大学于2023年推出,从GitHub真实开源项目中抽取数千个已解决的Issue来评测AI编程能力75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/602782API
curl https://kongchang.com/api/v1/knowledge/claims/602782MCP
get_claim(id=602782)