已验证65% 置信注意事项精确时间
在划分数据集之前对全量数据做标准化会导致数据泄漏,将测试集信息泄露给训练集
3
来源数
65%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
从零训练机器学习模型:新手完整入门指南
redditr/learnmachinelearning2026/7/11
相关事实
待验证数据泄漏是指测试集信息在训练阶段被模型间接看到,导致评估指标虚高,是机器学习研究中最常见也最隐蔽的方法论缺陷之一,在医疗预测领域尤为危险82% 相似待验证数据泄漏是因意外引入测试集信息而导致模型评估虚高的陷阱,常见形式包括在划分数据集之前就对全量数据做标准化或使用时间上因果倒置的特征81% 相似待验证在特征标准化、归一化或PCA降维时使用整个数据集(包括测试集)的统计量而非仅用训练集,会造成特征构造泄露79% 相似待验证数据泄露指本不应出现在训练数据中的未来信息或目标相关信息意外流入特征集,常见于时间序列误用未来特征或归一化在划分前执行78% 相似待验证基准过拟合和数据污染会导致模型通过记忆而非真正理解获得高分,使公开基准分数可信度存疑69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/490462API
curl https://kongchang.com/api/v1/knowledge/claims/490462MCP
get_claim(id=490462)