待验证50% 置信事实精确时间
第五题实际不存在,考验模型的元认知能力,两个模型都未察觉只回答了四题并接受了五分制评分
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/8/19
首次发现
有效期至:2026/9/2
来源
相关事实
待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力68% 相似待验证对比学习中的推远操作只要求负样本相似度低于正样本,并不要求达到-1的极端值67% 相似待验证早期可解释性研究发现约5%的训练片段中存在未表达的与评分相关的推理66% 相似待验证演示中使用Claude 4.7最高思考模型进行测试,模型能正常响应且右下角额度消耗显示始终为零66% 相似待验证在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/774275API
curl https://kongchang.com/api/v1/knowledge/claims/774275MCP
get_claim(id=774275)