[控场AI]
概念测试集污染 / data contamination / 数据污染

benchmark contamination

指AI模型训练语料中包含评测基准的题目,导致模型在该基准测试上得分虚高、无法真实反映泛化能力的现象,是大语言模型评测领域的核心可信度挑战

核心事实

时间轴 (近 90 天)

9月9日

由于现代LLM的训练语料通常来自互联网大规模爬取,而许多benchmark测试题目早已公开发布在网上,benchmark数据泄漏几乎不可避免

待验证50%
9月8日

透明可复现的科学要求与透明本身会破坏测量有效性之间存在根本张力

待验证50%
9月8日

近期研究表明部分模型在已知被污染的基准子集上的表现比未污染子集高出10-15个百分点

待验证50%
9月8日

科学要求透明可复现,但基准透明本身会破坏测量的有效性,两者之间存在根本张力

待验证50%
8月31日

部分厂商存在针对评测集过度优化(刷榜/benchmark contamination)的倾向,导致分数膨胀但泛化能力不足

待验证50%
8月26日

当测试题目可能已出现在训练数据中时,高分并不能真正代表泛化能力,这被称为基准污染

待验证50%
8月26日

基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力

已验证85%
8月25日

使用模型训练过程中未接触过的unseen样本可以有效避免评测污染(benchmark contamination),提高测试可信度

待验证50%

全部知识事实 (9)

来源文章