待验证50% 置信基准精确时间
2024年多项针对SWE-bench的评估显示,最先进的AI代理在真实GitHub Issue的解决率上仅在20%~50%区间
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/7
首次发现
有效期至:2026/10/5
来源
短绳法:AI编程中保持掌控感的实用方法论
hackernewshackernews2026/7/2
相关事实
待验证SWE-bench要求模型解决GitHub上的真实issue,其通过率即便对最强模型也不超过50%77% 相似待验证2023年普林斯顿大学的SWE-bench基准测试显示,当时最先进的AI编程工具在真实GitHub Issue修复任务中的成功率仅约13%77% 相似待验证SWE-bench要求模型在真实GitHub代码仓库中定位并修复bug,通过率从最初的不到2%逐步提升到20%以上75% 相似已验证GitHub的研究数据显示,2024年平台上AI辅助生成的代码提交占比已超过30%72% 相似待验证SWE-bench基于12个真实开源项目的2,294个GitHub issue,目前最高通过率的系统仅在50%左右71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/196717API
curl https://kongchang.com/api/v1/knowledge/claims/196717MCP
get_claim(id=196717)