待验证50% 置信基准精确时间
Claude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
已验证Claude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率79% 相似已验证Claude 3.7 Sonnet在SWE-bench Verified基准测试中得分超过60%77% 相似待验证Claude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率72% 相似待验证Claude Sonnet 4.6在GDPVal AA基准测试中得分超过了Opus 4.672% 相似已验证Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503708API
curl https://kongchang.com/api/v1/knowledge/claims/503708MCP
get_claim(id=503708)