待验证50% 置信基准精确时间
早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
Claude Sonnet 5接入Devin:编程性能升级,配额消耗降低30%
rss2026/6/30
相关事实
待验证Opus 4.7每次解题的中位输出token数为60,000,而GPT 5.5仅需16,00079% 相似待验证在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%77% 相似部分验证Claude Opus 4.8在SWE-bench基准测试中得分69.2%,GPT 5.5为58.6%,Google Gemini为54.2%77% 相似待验证在SWE-bench最初公开结果中GPT-4的解决率仅约1.7%,Devin宣称达到13.86%,SWE-agent达到12.5%76% 相似待验证Opus 4.7在长上下文(50万-100万token)检索方面表现明显退步,远不如DeepSeek和GPT 5.574% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/212301API
curl https://kongchang.com/api/v1/knowledge/claims/212301MCP
get_claim(id=212301)