Unverified50% confidenceFactExact time
Claude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Claude 4.6 vs GPT-5.1 vs DeepSeek-R1编程能力实测对比
bilibiliEA同学6/7/2026
Related Claims
Unverified在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%83% similarUnverifiedClaude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率74% similarVerifiedClaude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点73% similarUnverifiedClaude Sonnet 4.5在SWE-Bench上的得分为77.2分73% similarUnverifiedClaude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/48554API
curl https://kongchang.com/api/v1/knowledge/claims/48554MCP
get_claim(id=48554)