待验证50% 置信基准精确时间
在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准
1
来源数
50%
置信度
长期有效
时效性
2026/10/5
首次发现
来源
涉及实体
相关事实
待验证在代码语料比例更高的混合数据集上训练的模型,在数学推理基准(如MATH、GSM8K)上的表现显著优于纯自然语言训练的同规模模型,这一结论获斯坦福大学和MIT的多项研究证实77% 相似待验证当前流行的评估基准GSM8K和MATH与前沿研究级别的数学推理之间存在质的差距74% 相似已验证数学LLM的训练策略包括在通用预训练基础上使用大规模数学语料进行继续预训练,再通过链式推理数据监督微调,并结合过程奖励模型进行强化学习71% 相似待验证大语言模型的训练目标是最大化下一个Token的预测概率而非最大化代码安全性,这两个目标在数学上不等价68% 相似待验证MMLU、HumanEval、GSM8K等广泛引用的LLM基准均以单轮、封闭式任务为主,模型在固定输入下产生输出后即评分结束68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975478API
curl https://kongchang.com/api/v1/knowledge/claims/975478MCP
get_claim(id=975478)