Unverified50% confidenceBenchmarkExact time
SWE-bench从真实GitHub Issues中提取任务,要求模型修复主流开源项目的真实Bug,被视为衡量实际解决工程问题能力的黄金标准
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
VerifiedSWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁84% similarUnverifiedSWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准82% similarPartially VerifiedSWE-Bench was developed by a Princeton University team and extracts tasks from real GitHub issues, requiring models to locate problems within complete codebases and generate fix patches80% similarVerifiedSWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/562695API
curl https://kongchang.com/api/v1/knowledge/claims/562695MCP
get_claim(id=562695)