待验证50% 置信解决方案精确时间
在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
McNemar检验对比机器学习模型:随机种子下的正确用法
redditr/learnmachinelearning2026/7/11
相关事实
待验证AI测试用例不能只执行一次就判定,业界通常建议同一测试用例至少执行5-10次以统计输出的稳定性和质量分布76% 相似待验证置换检验通过大量随机置换(通常1000到10000次)构建零假设下的经验分布来估计p值,无需参数假设但计算成本相对较高73% 相似待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力71% 相似待验证该测试样本规模相对有限(5个模型、13个代码库),结论有待更大规模验证71% 相似待验证多重比较问题指同时测试多个模型变体时,即使每个单独检验显著性水平设为0.05,整体假阳性率也会急剧膨胀71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/502212API
curl https://kongchang.com/api/v1/knowledge/claims/502212MCP
get_claim(id=502212)