Unverified50% confidenceFactExact time
2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分75% similarUnverified在机器学习多种子实验中重复次数通常只有5到10次,样本量极小,正态性假设难以验证,因此 Wilcoxon 检验往往是更保守稳健的选择71% similarUnverified研究数据表明,在数学竞赛级别问题上,启用深度推理的模型准确率可从不足30%提升至80%以上71% similarUnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点70% similarUnverified2023年的TruthfulQA基准测试显示,即便是当时最强的模型,在需要精确事实判断的问题上准确率也未超过60%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/515034API
curl https://kongchang.com/api/v1/knowledge/claims/515034MCP
get_claim(id=515034)