已验证85% 置信事实时间未知
SWE-bench直接从GitHub真实开源项目中提取issue和对应的pull request,要求AI系统理解问题描述、定位代码缺陷并生成正确的修复补丁
5
来源数
85%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
SWE-bench官方博客上线:AI编程评测标准进入新阶段
twitterSWEbench
涉及实体
相关事实
待验证SWE-bench从真实GitHub Issues中提取任务,要求模型修复主流开源项目的真实Bug,被视为衡量实际解决工程问题能力的黄金标准84% 相似部分验证SWE-Bench was developed by a Princeton University team and extracts tasks from real GitHub issues, requiring models to locate problems within complete codebases and generate fix patches80% 相似待验证SWE-bench从主流Python开源项目提取真实GitHub Issue,要求模型生成能通过官方测试套件的代码补丁80% 相似已验证SWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug80% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/26919API
curl https://kongchang.com/api/v1/knowledge/claims/26919MCP
get_claim(id=26919)