Unverified85% confidenceFactTime unknown
早期GPT-4在SWE-bench上的解决率不足2%,而近期顶尖模型已突破50%
1
Sources
85%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Gemini 3实测:AI Studio Vibe Coding让人人都能做网站、漫画和游戏
bilibili认真的笨笨
Related Entities
Related Claims
Unverified早期GPT-4在原始SWE-Bench上的通过率仅约1.7%82% similarUnverifiedGPT-5.6在SWE-bench评测中以不到竞品一半的成本实现更优效果和更高解决率79% similarUnverifiedGPT-4 发布时在 MATH 数据集上的正确率为 42.5%76% similarUnverifiedGPT系列模型在维基百科文本上的困惑度从GPT-2的约29降至GPT-4的更低水平76% similarVerifiedGPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/14582API
curl https://kongchang.com/api/v1/knowledge/claims/14582MCP
get_claim(id=14582)