Unverified50% confidenceBenchmarkExact time
SWE-bench要求模型解决GitHub上的真实issue,其通过率即便对最强模型也不超过50%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/14/2026
First Seen
Valid until: 10/12/2026
Sources
Related Claims
UnverifiedSWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标80% similarUnverifiedSWE-bench要求模型在真实GitHub代码仓库中定位并修复bug,通过率从最初的不到2%逐步提升到20%以上79% similarUnverified2024年多项针对SWE-bench的评估显示,最先进的AI代理在真实GitHub Issue的解决率上仅在20%~50%区间77% similarUnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准77% similarUnverifiedSWE-bench基于12个真实开源项目的2,294个GitHub issue,目前最高通过率的系统仅在50%左右75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/509006API
curl https://kongchang.com/api/v1/knowledge/claims/509006MCP
get_claim(id=509006)