待验证50% 置信事实精确时间
该案例中的问题根源是数据划分存在数据泄漏,随机分配把近乎重复的表单模板同时放到了训练集和回归测试集两侧
1
来源数
50%
置信度
长期有效
时效性
2026/10/2
首次发现
来源
涉及实体
相关事实
待验证样本级泄露指多个增强样本来自同一原始样本时,若未按原始个体划分而是随机切分,同一实体信息会同时出现在训练集和验证集中80% 相似待验证在 train/test split 之前对整个数据集做 StandardScaler 归一化会导致测试集的均值和方差信息渗透进训练集,构成数据泄露79% 相似待验证冻结基准可能因数据泄露被纳入模型训练数据而随时间失去区分力,这是一个权衡77% 相似待验证在稠密检索中,批内负样本训练要求批次包含有信息量的负样本,随机采样会导致训练损失快速收敛但泛化性能差75% 相似待验证预处理泄漏在小数据集上尤为显著,当训练集仅有数百张图像时加入测试集样本会明显改变均值和标准差估计75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/968365API
curl https://kongchang.com/api/v1/knowledge/claims/968365MCP
get_claim(id=968365)