数据泄露
机器学习中的数据泄露问题,指训练数据中包含了测试时不应可见的信息,导致模型在测试集上的表现虚高,是ML工程中需要重点防范的常见错误
核心事实
时间轴 (近 90 天)
规避数据增强场景下样本级泄露的方法是按原始个体划分数据集,属于同一原始样本的所有增强图片要么全在训练集要么全在验证集
样本级泄露指多个增强样本来自同一原始样本时,若未按原始个体划分而是随机切分,同一实体信息会同时出现在训练集和验证集中
真正的数据泄露往往伴随可验证的样本数据或攻击路径描述
在AutoML测试中,模型自主发现并剔除了博主刻意埋入的数据泄露特征陷阱
许多重大数据泄露事件的根源并非零日漏洞,而是配置错误、权限管理松散或供应链薄弱等基础性问题
潜伏式、持续性的入侵比单次数据泄露更难被安全团队察觉,受害范围随时间推移不断扩大
数据泄露指模型在预测某个时间点时实际上偷看了该时间点之后才会产生的数据
AQuA论文附录B记录了一个案例:某早期特征的解释通过了审查,但在计算全天成交量作为分母时使用了未来的信息,属于数据泄露
归一化参数必须只从训练集计算,然后套用到验证集和测试集,以避免数据泄漏
数据泄露分为目标泄露和训练集泄露两类,会导致模型在测试中表现好但上线后失效
还有 1 条时间轴事件
全部知识事实 (11)
在划分数据集之前对全量数据做标准化会导致数据泄漏,将测试集信息泄露给训练集
90%已验证归一化参数必须只从训练集计算,然后套用到验证集和测试集,以避免数据泄漏
65%待验证在AutoML测试中,模型自主发现并剔除了博主刻意埋入的数据泄露特征陷阱
60%待验证规避数据增强场景下样本级泄露的方法是按原始个体划分数据集,属于同一原始样本的所有增强图片要么全在训练集要么全在验证集
50%待验证样本级泄露指多个增强样本来自同一原始样本时,若未按原始个体划分而是随机切分,同一实体信息会同时出现在训练集和验证集中
50%待验证真正的数据泄露往往伴随可验证的样本数据或攻击路径描述
50%待验证许多重大数据泄露事件的根源并非零日漏洞,而是配置错误、权限管理松散或供应链薄弱等基础性问题
50%待验证潜伏式、持续性的入侵比单次数据泄露更难被安全团队察觉,受害范围随时间推移不断扩大
50%待验证AQuA论文附录B记录了一个案例:某早期特征的解释通过了审查,但在计算全天成交量作为分母时使用了未来的信息,属于数据泄露
50%待验证数据泄露指模型在预测某个时间点时实际上偷看了该时间点之后才会产生的数据
50%待验证数据泄露分为目标泄露和训练集泄露两类,会导致模型在测试中表现好但上线后失效
50%