Unverified50% confidenceBenchmarkExact time
2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上
1
Sources
50%
Confidence
Long-term
Relevance
8/23/2026
First Seen
Sources
Related Entities
Related Claims
Verified2024年Claude 3.5 Sonnet等模型在SWE-bench Verified子集上已超过50%75% similarUnverifiedClaude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%74% similarUnverified在 SWE-bench 测试中,早期 GPT-4 解决率不足 2%,而 Claude 3.5 Sonnet 突破 49%73% similarUnverifiedClaude Sonnet 4.6在OS World(智能体计算机使用)测试中从61.4%提升至72.5%70% similarUnverified在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/789977API
curl https://kongchang.com/api/v1/knowledge/claims/789977MCP
get_claim(id=789977)