待验证50% 置信事实精确时间
传统基准如MMLU、HumanEval因训练数据污染出现基准饱和,GPT-4发布时MMLU得分约86%,如今多个开源模型已突破90%
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
GPT-5.6三款模型深度实测:Soul、Tara、Luna实力几何?
bilibiliAI-seeker2026/7/9
相关事实
待验证基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸73% 相似待验证到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降70% 相似待验证自2023年GPT-4发布以来,AI在HumanEval等主流编程基准测试上的通过率从不足50%跃升至90%以上70% 相似待验证Scale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中69% 相似待验证当多个模型在MMLU、HumanEval等测试中均达到90%以上的正确率时,用户关注点转向推理延迟、服务可用性和总体拥有成本等实操指标69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/461658API
curl https://kongchang.com/api/v1/knowledge/claims/461658MCP
get_claim(id=461658)