Verified65% confidenceFactTime unknown
代码生成模型在HumanEval等基准测试中的通过率从60%跃升至90%以上(2024-2025年间)
3
Sources
65%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified基准过拟合是当前大模型评估的核心问题,部分模型在HumanEval上达到90%以上通过率但在真实代码库中表现远不如预期77% similarUnverified2025年的顶尖模型在HumanEval基准测试中的通过率已突破90%76% similarUnverified斯坦福HAI研究所2023年报告显示,最新LLM在HumanEval等代码基准测试中正确率已超过85%,远超2021年的不足50%74% similarUnverified自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上74% similarUnverified在HumanEval等代码能力基准测试中,顶级大语言模型的通过率已超过90%71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/32594API
curl https://kongchang.com/api/v1/knowledge/claims/32594MCP
get_claim(id=32594)