待验证50% 置信事实精确时间
数学LLM的训练策略包括在通用预训练基础上使用大规模数学语料进行继续预训练,再通过链式推理数据监督微调,并结合过程奖励模型进行强化学习
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证在代码数据上训练的LLM不仅提升了编程能力,还显著增强了模型的逻辑推理能力,代码训练和逻辑推理能力之间存在正向迁移效应78% 相似待验证数学LLM通常指经过数学推理数据强化训练的模型,如DeepSeek-Math、Qwen-Math,以及经过工具增强的GPT系列76% 相似待验证代码大模型的训练范式通常包含三个阶段:在海量代码语料上进行预训练、通过指令微调让模型理解编程任务、通过RLHF优化输出质量76% 相似待验证现代大型模型通过学习逐步分解问题并在训练中验证中间步骤(Chain-of-Thought推理机制),显著提升复杂数学问题的表现75% 相似已验证微调是在通用预训练模型基础上用特定领域数据进行二次训练,使模型能将领域知识内化为参数,推理时无需额外检索步骤,延迟更低74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/509872API
curl https://kongchang.com/api/v1/knowledge/claims/509872MCP
get_claim(id=509872)