待验证50% 置信事实精确时间
Scale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中
1
来源数
50%
置信度
长期有效
时效性
2026/8/5
首次发现
来源
相关事实
待验证2024年研究表明即使AI生成内容仅占训练数据的10-20%,在多代训练后也足以引发可测量的质量退化78% 相似待验证自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄76% 相似待验证到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降73% 相似待验证AI benchmark suites like MMLU, HumanEval, and MATH may produce inflated scores due to benchmark contamination, where models have indirectly encountered test data during training.72% 相似待验证2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/688242API
curl https://kongchang.com/api/v1/knowledge/claims/688242MCP
get_claim(id=688242)