Verified65% confidenceBenchmarkExact time
SWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue
3
Sources
65%
Confidence
Long-term
Relevance
7/18/2026
First Seen
Sources
Related Claims
VerifiedSWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁84% similarVerifiedSWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug84% similarUnverifiedSWE-bench要求模型修复真实GitHub仓库中的Issue,HumanEval/MBPP是函数级代码生成基准80% similarUnverifiedSWE-bench要求模型修复GitHub上真实Issue,SWE-bench Verified版本于2024年兴起并成为衡量AI Agent编程能力的黄金标准78% similarUnverifiedSWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/556488API
curl https://kongchang.com/api/v1/knowledge/claims/556488MCP
get_claim(id=556488)