待验证50% 置信事实精确时间
每个模型配置以HIGH和XH(Extra High)两种推理强度进行测试,每种配置独立运行10次
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/20
首次发现
有效期至:2026/10/18
来源
相关事实
已验证评估大模型能力时多轮测试的稳定性比单次答对更能反映真实能力65% 相似待验证当比较两个具体训练模型的预测行为差异时应固定种子使用同一测试集运行McNemar检验,当评估方法整体优越性时应用多种子重复实验配合配对t检验或非参数检验64% 相似待验证OSWorld 2.0每个任务标注了10种能力测试维度,涵盖跨源推理、隐式状态推断、冲突消解、动态环境应对等64% 相似待验证多种子实验中检验对象从单样本预测分歧变为多次运行的准确率序列时,通常已不再适用McNemar检验64% 相似待验证微软的Phi系列通过精心筛选高质量教科书级训练数据,证明了1-3B参数量的模型在特定任务上可以媲美甚至超越十倍以上参数量的模型64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/573185API
curl https://kongchang.com/api/v1/knowledge/claims/573185MCP
get_claim(id=573185)