Unverified50% confidenceBenchmarkExact time
在HumanEval等专业代码基准测试中,顶尖模型的表现已接近甚至超越人类平均水平
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/18/2026
First Seen
Valid until: 10/16/2026
Sources
Related Claims
UnverifiedGLM5.1等国产模型在HumanEval、MBPP等标准编程基准测试上的得分已接近甚至超越部分国际竞品72% similarVerified代码生成模型在HumanEval等基准测试中的通过率从60%跃升至90%以上(2024-2025年间)69% similarUnverified模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距68% similarUnverified基准过拟合是当前大模型评估的核心问题,部分模型在HumanEval上达到90%以上通过率但在真实代码库中表现远不如预期68% similarUnverified工作样本测试在工业组织心理学中被证明具有最高的预测效度,相关系数r=0.5466% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/549438API
curl https://kongchang.com/api/v1/knowledge/claims/549438MCP
get_claim(id=549438)