Unverified50% confidenceBenchmarkExact time
SWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
UnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准81% similarVerifiedSWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug81% similarUnverifiedSWE-bench要求模型解决GitHub上的真实issue,其通过率即便对最强模型也不超过50%80% similarUnverifiedSWE-bench要求模型从真实GitHub Issue出发自主完成代码修改并通过测试用例,比HumanEval更接近真实工程场景77% similarVerifiedSWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/558663API
curl https://kongchang.com/api/v1/knowledge/claims/558663MCP
get_claim(id=558663)