待验证50% 置信事实精确时间
该测试样本规模相对有限(5个模型、13个代码库),结论有待更大规模验证
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次73% 相似待验证在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择71% 相似待验证实验采用8:2比例划分数据,20%作为内部测试集,训练集内部使用5折交叉验证,并移除重复记录以避免数据泄漏70% 相似待验证美团技术团队发布General 365推理评测基准,对26款主流大模型进行测试,大部分模型未能达到60分及格线66% 相似待验证用单一测试案例评估模型性能是一个统计陷阱,即小样本偏差(Small Sample Bias)65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/509017API
curl https://kongchang.com/api/v1/knowledge/claims/509017MCP
get_claim(id=509017)