Unverified50% confidenceFactExact time
该测试样本规模相对有限(5个模型、13个代码库),结论有待更大规模验证
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverified运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次73% similarUnverified在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择71% similarUnverified实验采用8:2比例划分数据,20%作为内部测试集,训练集内部使用5折交叉验证,并移除重复记录以避免数据泄漏70% similarUnverified美团技术团队发布General 365推理评测基准,对26款主流大模型进行测试,大部分模型未能达到60分及格线66% similarUnverified用单一测试案例评估模型性能是一个统计陷阱,即小样本偏差(Small Sample Bias)65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/509017API
curl https://kongchang.com/api/v1/knowledge/claims/509017MCP
get_claim(id=509017)