Unverified60% confidenceBenchmarkExact time
在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/16/2026
First Seen
Valid until: 10/14/2026
Sources
Related Claims
UnverifiedClaude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点83% similarUnverified使用更强回答LLM(Claude Sonnet 4)替换GPT-4 Mini后,仅缺失任务略有提升,级联任务无明显改善77% similarUnverified早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%77% similarUnverified在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%75% similarUnverifiedClaude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/530699API
curl https://kongchang.com/api/v1/knowledge/claims/530699MCP
get_claim(id=530699)