Unverified60% confidenceBenchmarkExact time
在 SWE-bench 上早期模型解决率不足 5%,2025 年主流产品已突破 50%
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/11/2026
First Seen
Valid until: 10/9/2026
Sources
云端Coding Agent深度拆解:国内用户如何理性选择
bilibili小行星AI观测站7/9/2026
Related Claims
Unverified2023年初主流模型的SWE-bench得分普遍低于5%,到2025年中顶级模型已突破70%80% similarUnverifiedSWE-bench 是衡量模型在真实 GitHub Issue 上自主修复能力的基准,早期模型解决率不足 5%,2025 年主流产品已突破 50%78% similarUnverifiedSWE-bench 发布初期顶级模型通过率不足 2%,当前领先系统通过率已突破 50%78% similarVerified目前顶尖模型在SWE-bench Verified子集上的解决率已突破50%77% similarUnverifiedSWE-bench Verified子集的通过率从2024年初不足5%跃升至49%73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/482795API
curl https://kongchang.com/api/v1/knowledge/claims/482795MCP
get_claim(id=482795)