Unverified50% confidenceFactExact time
传统基准如MMLU、HumanEval因训练数据污染出现基准饱和,GPT-4发布时MMLU得分约86%,如今多个开源模型已突破90%
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
GPT-5.6三款模型深度实测:Soul、Tara、Luna实力几何?
bilibiliAI-seeker7/9/2026
Related Claims
Unverified基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸73% similarUnverified到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降70% similarUnverified自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上70% similarUnverifiedScale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中69% similarUnverified当多个模型在MMLU、HumanEval等测试中均达到90%以上的正确率时,用户关注点转向推理延迟、服务可用性和总体拥有成本等实操指标69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/461658API
curl https://kongchang.com/api/v1/knowledge/claims/461658MCP
get_claim(id=461658)