[KongchangAI]
ConceptData Contamination / 数据污染问题

数据污染

大语言模型预训练阶段将基准测试数据纳入训练语料,导致模型在评测时「回忆答案」而非真正理解问题,造成跑分虚高的现象

Timeline (last 90 days)

Sep 14

使用尚未发表的论文可以降低模型在训练数据中见过答案的数据污染风险

Unverified50%
Sep 12

基于开源代码库的评测存在数据污染问题,因为这些代码库可能已被纳入大模型的训练数据

Unverified50%
Sep 12

数据污染的危害程度与模型的记忆容量正相关,容量受限的小模型即使接触污染数据也无从受益

Unverified50%
Sep 11

数据污染问题指模型可能在训练阶段已见过研究者尚未正式发表的思路或部分证明

Unverified50%
Sep 11

大型语言模型的训练语料可能包含未正式发表的学术预印本、研究笔记等,引发数据污染问题

Unverified50%
Aug 31

如果模型在预训练时记住了污染基准的答案,压缩上下文中的信息损失不会影响性能,使得报告的'无损压缩'结论失去意义

Unverified50%
Aug 30

数据污染(data contamination)指模型在训练过程中已经见过测试集中的数据,导致评测成绩虚高

Unverified50%
Jul 16

数据泄漏分为目标泄漏和训练-测试污染两类,会导致模型性能被系统性高估

Unverified50%
Jul 13

当模型训练数据包含评测集题目或高度相似内容时,模型可能通过记忆而非真正理解获得高分

Unverified50%
Jul 12

训练集污染是当前AI基准评测领域的核心争议,模型可能通过记忆而非推理答题导致结果虚高

Unverified50%

All Facts (10)

Source Articles