Unverified50% confidenceBenchmarkExact time
代码大语言模型在HumanEval基准测试上的通过率从2022年OpenAI Codex的约47%提升到2024年顶级模型(GPT-4o、Claude 3.5 Sonnet)超过90%
1
Sources
50%
Confidence
Long-term
Relevance
8/25/2026
First Seen
Sources
Related Entities
Related Claims
Unverified2024-2025年间,Claude 3.5 Sonnet、GPT-4o、Gemini 2.0等模型在HumanEval、SWE-bench等编程基准测试的通过率从不足50%提升至90%以上70% similarUnverifiedClaude 3.5 Sonnet在HumanEval基准测试上的得分超过90%,而2021年最初的Codex模型得分仅为28.8%70% similarUnverified早期Codex在HumanEval基准测试中以37%的准确率独立解决编程题,达到当时最高水平65% similarUnverifiedCodex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%65% similarVerifiedClaude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/798861API
curl https://kongchang.com/api/v1/knowledge/claims/798861MCP
get_claim(id=798861)