Unverified50% confidenceFactExact time
每个模型配置以HIGH和XH(Extra High)两种推理强度进行测试,每种配置独立运行10次
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/20/2026
First Seen
Valid until: 10/18/2026
Sources
Related Claims
Verified评估大模型能力时多轮测试的稳定性比单次答对更能反映真实能力65% similarUnverified当比较两个具体训练模型的预测行为差异时应固定种子使用同一测试集运行McNemar检验,当评估方法整体优越性时应用多种子重复实验配合配对t检验或非参数检验64% similarUnverifiedOSWorld 2.0每个任务标注了10种能力测试维度,涵盖跨源推理、隐式状态推断、冲突消解、动态环境应对等64% similarUnverified多种子实验中检验对象从单样本预测分歧变为多次运行的准确率序列时,通常已不再适用McNemar检验64% similarUnverified微软的Phi系列通过精心筛选高质量教科书级训练数据,证明了1-3B参数量的模型在特定任务上可以媲美甚至超越十倍以上参数量的模型64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/573185API
curl https://kongchang.com/api/v1/knowledge/claims/573185MCP
get_claim(id=573185)