benchmark contamination
指AI模型训练语料中包含评测基准的题目,导致模型在该基准测试上得分虚高、无法真实反映泛化能力的现象,是大语言模型评测领域的核心可信度挑战
核心事实
时间轴 (近 90 天)
由于现代LLM的训练语料通常来自互联网大规模爬取,而许多benchmark测试题目早已公开发布在网上,benchmark数据泄漏几乎不可避免
透明可复现的科学要求与透明本身会破坏测量有效性之间存在根本张力
近期研究表明部分模型在已知被污染的基准子集上的表现比未污染子集高出10-15个百分点
科学要求透明可复现,但基准透明本身会破坏测量的有效性,两者之间存在根本张力
部分厂商存在针对评测集过度优化(刷榜/benchmark contamination)的倾向,导致分数膨胀但泛化能力不足
当测试题目可能已出现在训练数据中时,高分并不能真正代表泛化能力,这被称为基准污染
基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力
使用模型训练过程中未接触过的unseen样本可以有效避免评测污染(benchmark contamination),提高测试可信度
全部知识事实 (9)
基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力
85%已验证基准污染(Benchmark Contamination)是当前大模型评估领域面临的重要挑战,模型训练数据中可能已包含公开的测试题目导致评估结果失真
75%待验证由于现代LLM的训练语料通常来自互联网大规模爬取,而许多benchmark测试题目早已公开发布在网上,benchmark数据泄漏几乎不可避免
50%待验证透明可复现的科学要求与透明本身会破坏测量有效性之间存在根本张力
50%待验证近期研究表明部分模型在已知被污染的基准子集上的表现比未污染子集高出10-15个百分点
50%待验证科学要求透明可复现,但基准透明本身会破坏测量的有效性,两者之间存在根本张力
50%待验证部分厂商存在针对评测集过度优化(刷榜/benchmark contamination)的倾向,导致分数膨胀但泛化能力不足
50%待验证当测试题目可能已出现在训练数据中时,高分并不能真正代表泛化能力,这被称为基准污染
50%待验证使用模型训练过程中未接触过的unseen样本可以有效避免评测污染(benchmark contamination),提高测试可信度
50%