Unverified50% confidenceBenchmarkExact time
早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%
1
Sources
50%
Confidence
Long-term
Relevance
7/8/2026
First Seen
Sources
Claude Sonnet 5接入Devin:编程性能升级,配额消耗降低30%
rss6/30/2026
Related Claims
UnverifiedOpus 4.7每次解题的中位输出token数为60,000,而GPT 5.5仅需16,00079% similarUnverified在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%77% similarPartially VerifiedClaude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%77% similarUnverified在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%76% similarUnverifiedOpus 4.7在长上下文(50万-100万token)检索方面表现明显退步,远不如DeepSeek和GPT 5.574% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/212301API
curl https://kongchang.com/api/v1/knowledge/claims/212301MCP
get_claim(id=212301)