Unverified50% confidenceBenchmarkExact time
2023年普林斯顿大学的SWE-bench基准测试显示,当时最先进的AI编程工具在真实GitHub Issue修复任务中的成功率仅约13%
1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
Unverified在 SWE-bench 真实 GitHub Issue 修复任务中,不同厂商模型的修复成功率差异可达15-30个百分点78% similarUnverified2024年多项针对SWE-bench的评估显示,最先进的AI代理在真实GitHub Issue的解决率上仅在20%~50%区间77% similarUnverifiedGitHub无障碍智能体测试中已审查3535个PR,问题解决率达到68%75% similarVerifiedSWE-bench(真实GitHub Issue修复率)被业界视为衡量编程Agent能力最具参考价值的指标75% similarUnverifiedGitHub Copilot的成功并非因为其底层模型(最初基于Codex)最聪明,而是因为将AI嵌入IDE、采用低打扰内联建议模式并让用户保有接受或拒绝的控制权74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/594049API
curl https://kongchang.com/api/v1/knowledge/claims/594049MCP
get_claim(id=594049)