待验证50% 置信基准精确时间
SWE-bench要求模型解决GitHub上的真实issue,其通过率即便对最强模型也不超过50%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/14
首次发现
有效期至:2026/10/12
来源
相关事实
待验证SWE-bench要求模型在真实GitHub仓库中定位问题并生成可通过CI测试的补丁,以Resolve Rate作为核心指标80% 相似待验证SWE-bench要求模型在真实GitHub代码仓库中定位并修复bug,通过率从最初的不到2%逐步提升到20%以上79% 相似待验证2024年多项针对SWE-bench的评估显示,最先进的AI代理在真实GitHub Issue的解决率上仅在20%~50%区间77% 相似待验证SWE-bench要求模型解决GitHub上真实的软件缺陷,是评估Agent级编程能力的权威基准77% 相似待验证SWE-bench基于12个真实开源项目的2,294个GitHub issue,目前最高通过率的系统仅在50%左右75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/509006API
curl https://kongchang.com/api/v1/knowledge/claims/509006MCP
get_claim(id=509006)