Unverified50% confidenceBenchmarkExact time
Claude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
VerifiedClaude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率79% similarVerifiedClaude 3.7 Sonnet在SWE-bench Verified基准测试中得分超过60%77% similarUnverifiedClaude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率72% similarUnverifiedClaude Sonnet 4.6在GDPVal AA基准测试中得分超过了Opus 4.672% similarVerifiedClaude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/503708API
curl https://kongchang.com/api/v1/knowledge/claims/503708MCP
get_claim(id=503708)