待验证50% 置信决策规则精确时间
当比较两个具体训练模型的预测行为差异时应固定种子使用同一测试集运行McNemar检验,当评估方法整体优越性时应用多种子重复实验配合配对t检验或非参数检验
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
McNemar检验对比机器学习模型:随机种子下的正确用法
redditr/learnmachinelearning2026/7/11
相关事实
待验证多种子实验中检验对象从单样本预测分歧变为多次运行的准确率序列时,通常已不再适用McNemar检验77% 相似待验证建立私有金丝雀测试集,在每次模型版本切换时系统性运行对比测试,比通用基准测试更能捕捉影响生产的退化信号76% 相似待验证McNemar 检验要求两个模型在完全相同的测试集上评估,任何测试集的不一致都会使检验失效76% 相似待验证Agent的回归测试需要在相同测试集上多次运行新旧版本,比较行为分布的差异而非单次结果对比75% 相似待验证作者建议的组合策略是用至少5个随机种子分别训练基线和提出方法,报告准确率均值和标准差配合配对检验,并对代表性种子额外运行 McNemar 检验展示样本级预测分歧74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/502765API
curl https://kongchang.com/api/v1/knowledge/claims/502765MCP
get_claim(id=502765)