待验证50% 置信事实精确时间
Claude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Claude 4.6 vs GPT-5.1 vs DeepSeek-R1编程能力实测对比
bilibiliEA同学2026/6/7
相关事实
待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%83% 相似待验证Claude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率74% 相似已验证Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点73% 相似待验证Claude Sonnet 4.5在SWE-Bench上的得分为77.2分73% 相似待验证Claude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/48554API
curl https://kongchang.com/api/v1/knowledge/claims/48554MCP
get_claim(id=48554)