Unverified50% confidenceSolutionExact time
对同一测试用例执行多次调用统计成功比例得到通过率,比二元的通过/失败判断更能反映模型真实表现
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Unverified多重比较问题指同时测试多个模型变体时,即使每个单独检验显著性水平设为0.05,整体假阳性率也会急剧膨胀78% similarPartially Verified研究表明,同一模型在不同提示词下的输出质量可能相差数倍76% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)74% similarUnverified综合多个独立来源的评测结果比单一自报基准分数更能反映模型的实际水平72% similarUnverified早期研究发现同一问题用不同表述方式提问,模型性能差异可高达数十个百分点71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/536677API
curl https://kongchang.com/api/v1/knowledge/claims/536677MCP
get_claim(id=536677)