Verified90% confidenceFactTime unknown
2024年顶级模型在SWEbench-Verified上的通过率约为50-70%
7
Sources
90%
Confidence
Long-term
Relevance
6/2/2026
First Seen
Sources
Cursor 2.0深度解析:自研模型、多Agent并行等五大新功能实测
bilibili鱼C-小甲鱼
Related Entities
Related Claims
Unverified2023年初主流模型的SWE-bench得分普遍低于5%,到2025年中顶级模型已突破70%82% similarUnverified2024年部分模型在SWE-bench上的成功率提升至30%-50%区间76% similarVerified目前顶尖模型在SWE-bench Verified子集上的解决率已突破50%76% similarUnverifiedSWE-bench Verified上的AI通过率在一年前还不到40%,截至2025年中已超过72%73% similarUnverifiedSWE-bench Verified子集的通过率从2024年初不足5%跃升至49%73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/36995API
curl https://kongchang.com/api/v1/knowledge/claims/36995MCP
get_claim(id=36995)