待验证60% 置信基准精确时间
在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/16
首次发现
有效期至:2026/10/14
来源
相关事实
待验证Claude Sonnet 4.6与GPT-5.1 Codex在SWE-Bench Verified上的解决率差距仅为3.3个百分点83% 相似待验证使用更强回答LLM(Claude Sonnet 4)替换GPT-4 Mini后,仅缺失任务略有提升,级联任务无明显改善77% 相似待验证早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%77% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%75% 相似待验证Claude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/530699API
curl https://kongchang.com/api/v1/knowledge/claims/530699MCP
get_claim(id=530699)