待验证50% 置信事实精确时间
多重比较问题指同时测试多个模型变体时,即使每个单独检验显著性水平设为0.05,整体假阳性率也会急剧膨胀
1
来源数
50%
置信度
长期有效
时效性
2026/7/24
首次发现
来源
MLE vs SWE职业选择:机器学习工程师如何精准定位自身价值
redditr/deeplearning2026/7/12
相关事实
待验证对同一测试用例执行多次调用统计成功比例得到通过率,比二元的通过/失败判断更能反映模型真实表现78% 相似待验证困惑度是测试集上每个token平均负对数似然的指数,值越低代表模型对语料的预测越准确76% 相似待验证基准测试面临饱和(Saturation)和数据污染(Data Contamination)两个系统性挑战,当多个主流模型得分超过95%时测试集失去区分能力72% 相似待验证在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择71% 相似待验证对比学习中的推远操作只要求负样本相似度低于正样本,并不要求达到-1的极端值70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/611131API
curl https://kongchang.com/api/v1/knowledge/claims/611131MCP
get_claim(id=611131)