待验证50% 置信基准精确时间
SWE-bench要求模型修复GitHub上真实Issue,SWE-bench Verified版本于2024年兴起并成为衡量AI Agent编程能力的黄金标准
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/24
首次发现
有效期至:2026/10/22
来源
相关事实
待验证SWE-bench Verified由普林斯顿大学于2023年推出,衡量AI在真实GitHub Issue上的自动化软件工程能力,其Verified子集经过人工审核81% 相似待验证SWE-bench于2024年将评测对象从函数扩展到真实GitHub Issue的修复80% 相似已验证SWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue78% 相似已验证SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁77% 相似已验证SWE-Bench由普林斯顿大学于2023年推出,从GitHub真实开源项目中抽取数千个已解决的Issue来评测AI编程能力75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/602782API
curl https://kongchang.com/api/v1/knowledge/claims/602782MCP
get_claim(id=602782)