Unverified50% confidenceSolutionExact time
在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择
1
Sources
50%
Confidence
Long-term
Relevance
7/13/2026
First Seen
Sources
McNemar检验对比机器学习模型:随机种子下的正确用法
redditr/learnmachinelearning7/11/2026
Related Claims
UnverifiedAI测试用例不能只执行一次就判定,业界通常建议同一测试用例至少执行5-10次以统计输出的稳定性和质量分布76% similarUnverified置换检验通过大量随机置换(通常1000到10000次)构建零假设下的经验分布来估计p值,无需参数假设但计算成本相对较高73% similarUnverified2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力71% similarUnverified该测试样本规模相对有限(5个模型、13个代码库),结论有待更大规模验证71% similarUnverified多重比较问题指同时测试多个模型变体时,即使每个单独检验显著性水平设为0.05,整体假阳性率也会急剧膨胀71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/502212API
curl https://kongchang.com/api/v1/knowledge/claims/502212MCP
get_claim(id=502212)