Unverified50% confidenceFactExact time
数学LLM的训练策略包括在通用预训练基础上使用大规模数学语料进行继续预训练,再通过链式推理数据监督微调,并结合过程奖励模型进行强化学习
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverified在代码数据上训练的LLM不仅提升了编程能力,还显著增强了模型的逻辑推理能力,代码训练和逻辑推理能力之间存在正向迁移效应78% similarUnverified数学LLM通常指经过数学推理数据强化训练的模型,如DeepSeek-Math、Qwen-Math,以及经过工具增强的GPT系列76% similarUnverified代码大模型的训练范式通常包含三个阶段:在海量代码语料上进行预训练、通过指令微调让模型理解编程任务、通过RLHF优化输出质量76% similarUnverified现代大型模型通过学习逐步分解问题并在训练中验证中间步骤(Chain-of-Thought推理机制),显著提升复杂数学问题的表现75% similarVerified微调是在通用预训练模型基础上用特定领域数据进行二次训练,使模型能将领域知识内化为参数,推理时无需额外检索步骤,延迟更低74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/509872API
curl https://kongchang.com/api/v1/knowledge/claims/509872MCP
get_claim(id=509872)