Unverified50% confidenceCautionExact time
数据泄露分为目标泄露和训练集泄露两类,会导致模型在测试中表现好但上线后失效
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
工程师转型机器学习:从数据合规到落地的实战路线图
redditr/learnmachinelearning7/11/2026
Related Claims
Unverified数据泄漏分为目标泄漏和训练-测试污染两类,会导致模型性能被系统性高估84% similarVerified过拟合是指模型在训练数据上表现优异,但在未见过的测试数据上性能大幅下降的现象74% similarUnverified仅用成功轨迹训练的模型往往存在分布外泛化的严重缺陷,遇到工具返回错误时便丧失纠偏能力72% similarUnverified模型错误可归因于知识缺失、推理能力不足或指令跟随偏差,分别对应补充预训练数据、引入思维链训练数据和优化SFT数据分布等修复路径72% similarUnverified预处理泄漏在小数据集上尤为显著,当训练集仅有数百张图像时加入测试集样本会明显改变均值和标准差估计72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/491155API
curl https://kongchang.com/api/v1/knowledge/claims/491155MCP
get_claim(id=491155)