数据污染
大语言模型预训练阶段将基准测试数据纳入训练语料,导致模型在评测时「回忆答案」而非真正理解问题,造成跑分虚高的现象
时间轴 (近 90 天)
使用尚未发表的论文可以降低模型在训练数据中见过答案的数据污染风险
基于开源代码库的评测存在数据污染问题,因为这些代码库可能已被纳入大模型的训练数据
数据污染的危害程度与模型的记忆容量正相关,容量受限的小模型即使接触污染数据也无从受益
数据污染问题指模型可能在训练阶段已见过研究者尚未正式发表的思路或部分证明
大型语言模型的训练语料可能包含未正式发表的学术预印本、研究笔记等,引发数据污染问题
如果模型在预训练时记住了污染基准的答案,压缩上下文中的信息损失不会影响性能,使得报告的'无损压缩'结论失去意义
数据污染(data contamination)指模型在训练过程中已经见过测试集中的数据,导致评测成绩虚高
数据泄漏分为目标泄漏和训练-测试污染两类,会导致模型性能被系统性高估
当模型训练数据包含评测集题目或高度相似内容时,模型可能通过记忆而非真正理解获得高分
训练集污染是当前AI基准评测领域的核心争议,模型可能通过记忆而非推理答题导致结果虚高
全部知识事实 (10)
使用尚未发表的论文可以降低模型在训练数据中见过答案的数据污染风险
50%待验证基于开源代码库的评测存在数据污染问题,因为这些代码库可能已被纳入大模型的训练数据
50%待验证数据污染的危害程度与模型的记忆容量正相关,容量受限的小模型即使接触污染数据也无从受益
50%待验证数据污染问题指模型可能在训练阶段已见过研究者尚未正式发表的思路或部分证明
50%待验证大型语言模型的训练语料可能包含未正式发表的学术预印本、研究笔记等,引发数据污染问题
50%待验证如果模型在预训练时记住了污染基准的答案,压缩上下文中的信息损失不会影响性能,使得报告的'无损压缩'结论失去意义
50%待验证数据污染(data contamination)指模型在训练过程中已经见过测试集中的数据,导致评测成绩虚高
50%待验证数据泄漏分为目标泄漏和训练-测试污染两类,会导致模型性能被系统性高估
50%待验证当模型训练数据包含评测集题目或高度相似内容时,模型可能通过记忆而非真正理解获得高分
50%待验证训练集污染是当前AI基准评测领域的核心争议,模型可能通过记忆而非推理答题导致结果虚高
50%