待验证50% 置信权衡取舍精确时间
多种子实验中检验对象从单样本预测分歧变为多次运行的准确率序列时,通常已不再适用McNemar检验
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
McNemar检验对比机器学习模型:随机种子下的正确用法
redditr/learnmachinelearning2026/7/11
相关事实
待验证McNemar 检验要求两个模型在完全相同的测试集上评估,任何测试集的不一致都会使检验失效79% 相似待验证多种子重复实验中可使用配对t检验或Wilcoxon符号秩检验比较两组准确率分布,其中Wilcoxon检验因不依赖正态性假设更适合小样本77% 相似待验证当比较两个具体训练模型的预测行为差异时应固定种子使用同一测试集运行McNemar检验,当评估方法整体优越性时应用多种子重复实验配合配对t检验或非参数检验77% 相似待验证McNemar检验是一种专门用于配对二分类数据的非参数检验方法76% 相似待验证通过打乱测试执行顺序并多次运行,若某测试仅在特定顺序下失败,可推断其与其他测试存在状态污染或隐性依赖75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503212API
curl https://kongchang.com/api/v1/knowledge/claims/503212MCP
get_claim(id=503212)