待验证50% 置信基准精确时间
2023年普林斯顿大学的SWE-bench基准测试显示,当时最先进的AI编程工具在真实GitHub Issue修复任务中的成功率仅约13%
1
来源数
50%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
待验证在 SWE-bench 真实 GitHub Issue 修复任务中,不同厂商模型的修复成功率差异可达15-30个百分点78% 相似待验证2024年多项针对SWE-bench的评估显示,最先进的AI代理在真实GitHub Issue的解决率上仅在20%~50%区间77% 相似待验证GitHub无障碍智能体测试中已审查3535个PR,问题解决率达到68%75% 相似已验证SWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标75% 相似待验证GitHub Copilot的成功并非因为其底层模型(最初基于Codex)最聪明,而是因为将AI嵌入IDE、采用低打扰内联建议模式并让用户保有接受或拒绝的控制权74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/594049API
curl https://kongchang.com/api/v1/knowledge/claims/594049MCP
get_claim(id=594049)