Unverified50% confidenceBenchmarkExact time
2024年以前主流模型在SWE-bench上的通过率普遍低于5%,Claude 3.5系列发布后跃升至49%(SWE-bench Verified子集)
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
Spotify AI实践:3000名工程师如何用Agent重塑研发体系
bilibiliGelai_AI7/3/2026
Related Claims
Unverified早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%73% similarUnverifiedClaude Opus 4.6在SWE-Bench Pro测试中得分为53.4%70% similarVerified2024年Claude 3.5 Sonnet等模型在SWE-bench Verified子集上已超过50%69% similarUnverifiedOpus 4在SWE-bench Verified上的通过率超过72%,显著领先于其他竞争模型65% similarUnverified在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/112968API
curl https://kongchang.com/api/v1/knowledge/claims/112968MCP
get_claim(id=112968)