待验证50% 置信注意事项精确时间
实验样本量小(单个模型、单次测试、50 道题),存在随机波动的可能,属于启发性发现而非定论
1
来源数
50%
置信度
长期有效
时效性
2026/9/27
首次发现
来源
涉及实体
相关事实
待验证在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择79% 相似待验证在5%显著性水平下测试100个随机因子,期望会有5个看起来显著(多重假设检验问题)76% 相似待验证置换检验通过大量随机置换(通常1000到10000次)构建零假设下的经验分布来估计p值,无需参数假设但计算成本相对较高75% 相似待验证当团队测试1000种策略参数组合,即便所有组合毫无预测力,纯粹由于随机性也会出现约50种在回测中表现优异的组合(多重比较问题)75% 相似待验证Anthropic的研究显示,即使面对毫无根据的质疑,在某些测试中模型被用户简单反驳后放弃正确答案的比例超过50%73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/954332API
curl https://kongchang.com/api/v1/knowledge/claims/954332MCP
get_claim(id=954332)