待验证50% 置信事实精确时间
2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分75% 相似待验证在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择71% 相似待验证研究数据表明,在数学竞赛级别问题上,启用深度推理的模型准确率可从不足30%提升至80%以上71% 相似待验证Anthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点70% 相似待验证2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/515034API
curl https://kongchang.com/api/v1/knowledge/claims/515034MCP
get_claim(id=515034)