待验证50% 置信基准精确时间
SWE-bench从真实GitHub Issues中提取任务,要求模型修复主流开源项目的真实Bug,被视为衡量实际解决工程问题能力的黄金标准
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
已验证SWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁84% 相似待验证SWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准82% 相似部分验证SWE-Bench was developed by a Princeton University team and extracts tasks from real GitHub issues, requiring models to locate problems within complete codebases and generate fix patches80% 相似已验证SWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug78% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/562695API
curl https://kongchang.com/api/v1/knowledge/claims/562695MCP
get_claim(id=562695)