待验证50% 置信事实精确时间
Bonferroni 校正是最保守的多重比较校正方案,将显著性阈值除以比较次数;Benjamini-Hochberg FDR 校正更宽松,控制所有显著结果中假阳性的比例
1
来源数
50%
置信度
长期有效
时效性
2026/7/13
首次发现
来源
McNemar检验对比机器学习模型:随机种子下的正确用法
redditr/learnmachinelearning2026/7/11
相关事实
待验证统计功效(Statistical Power)通常设为 80% 以上,多重比较问题可通过 Bonferroni 校正或 FDR 控制等方法调整71% 相似待验证2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%62% 相似待验证泰特洛克的研究得出结论:专家预测的准确率仅略高于随机猜测,甚至不如简单的统计基准线60% 相似待验证探索性能上界实验发现现有验证粒度并非最优,理想情况下计算量(FLOPs)可减少75倍,同时准确率提升1.1%59% 相似待验证在类别不平衡场景下,模型可以通过一律预测多数类获得看似漂亮的准确率,这种现象被称为准确率悖论(Accuracy Paradox)58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/502213API
curl https://kongchang.com/api/v1/knowledge/claims/502213MCP
get_claim(id=502213)