已验证65% 置信基准精确时间
SWE-bench要求模型在真实GitHub仓库中定位并修复实际Issue
3
来源数
65%
置信度
长期有效
时效性
2026/7/18
首次发现
来源
相关事实
已验证SWE-bench由普林斯顿大学团队开发,Pro版本要求模型在真实GitHub代码仓库中定位Bug并生成修复补丁84% 相似已验证SWE-bench直接使用真实的GitHub Issue作为测试题目,要求模型在完整代码仓库中定位并修复Bug84% 相似待验证SWE-bench要求模型修复真实GitHub仓库中的Issue,HumanEval/MBPP是函数级代码生成基准80% 相似待验证SWE-bench要求模型修复GitHub上真实Issue,SWE-bench Verified版本于2024年兴起并成为衡量AI Agent编程能力的黄金标准78% 相似待验证SWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/556488API
curl https://kongchang.com/api/v1/knowledge/claims/556488MCP
get_claim(id=556488)