Unverified50% confidenceBenchmarkExact time
斯坦福HAI研究所2023年报告显示,最新LLM在HumanEval等代码基准测试中正确率已超过85%,远超2021年的不足50%
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Verified代码生成模型在HumanEval等基准测试中的通过率从60%跃升至90%以上(2024-2025年间)74% similarUnverified2024年的多项研究表明,LLM裁判与人类专家的一致率通常在70%-85%之间73% similarUnverified自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上73% similarUnverified斯坦福大学2023年的研究表明,主流AI检测工具误判率可高达20%以上72% similarUnverified2025年的顶尖模型在HumanEval基准测试中的通过率已突破90%71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/541184API
curl https://kongchang.com/api/v1/knowledge/claims/541184MCP
get_claim(id=541184)