Unverified50% confidenceBenchmarkExact time
SWE-bench 是衡量模型在真实 GitHub Issue 上自主修复能力的基准,早期模型解决率不足 5%,2025 年主流产品已突破 50%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/11/2026
First Seen
Valid until: 10/9/2026
Sources
云端Coding Agent深度拆解:国内用户如何理性选择
bilibili小行星AI观测站7/9/2026
Related Claims
Unverified在 SWE-bench 上早期模型解决率不足 5%,2025 年主流产品已突破 50%78% similarUnverified新一代模型在SWE-bench等真实软件工程任务上的通过率首次突破50%大关71% similarUnverifiedSWE-bench 发布初期顶级模型通过率不足 2%,当前领先系统通过率已突破 50%71% similarVerified目前顶尖模型在SWE-bench Verified子集上的解决率已突破50%71% similarUnverifiedSWE-bench基准上最优系统的解决率已从最初的不到5%提升至超过40%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/474396API
curl https://kongchang.com/api/v1/knowledge/claims/474396MCP
get_claim(id=474396)