待验证50% 置信基准精确时间
2024年以前主流模型在SWE-bench上的通过率普遍低于5%,Claude 3.5系列发布后跃升至49%(SWE-bench Verified子集)
1
来源数
50%
置信度
长期有效
时效性
2026/7/6
首次发现
来源
Spotify AI实践:3000名工程师如何用Agent重塑研发体系
bilibiliGelai_AI2026/7/3
相关事实
待验证早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%73% 相似待验证Claude Opus 4.6在SWE-Bench Pro测试中得分为53.4%70% 相似已验证2024年Claude 3.5 Sonnet等模型在SWE-bench Verified子集上已超过50%69% 相似待验证Opus 4在SWE-bench Verified上的通过率超过72%,显著领先于其他竞争模型65% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112968API
curl https://kongchang.com/api/v1/knowledge/claims/112968MCP
get_claim(id=112968)