Unverified50% confidenceOpinionExact time
大模型测试存在偶然性,任何榜单都只代表特定提示词下的特定结果
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
华为盘古2.0 Flash高考实测:613分成绩与稳定性深度解析
bilibiliwycode_cn7/7/2026
Related Claims
Unverified通过打乱测试执行顺序并多次运行,若某测试仅在特定顺序下失败,可推断其与其他测试存在状态污染或隐性依赖73% similarUnverified多种子实验中检验对象从单样本预测分歧变为多次运行的准确率序列时,通常已不再适用McNemar检验71% similarUnverified过拟合小样本测试可用于排查代码bug:若模型连几十个样本都无法完美记住,几乎可断定是代码、标签或模型结构存在bug71% similarUnverified选择和使用不同模型档位时不能仅凭版本号判断,基于真实场景的多轮测试才是评估模型能力的可靠依据69% similarUnverifiedMcNemar 检验要求两个模型在完全相同的测试集上评估,任何测试集的不一致都会使检验失效69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/330514API
curl https://kongchang.com/api/v1/knowledge/claims/330514MCP
get_claim(id=330514)