预训练与RL的Scaling Law:国际象棋实验揭示后训练算力分配规律

在大模型的训练流程中,预训练、SFT(监督微调)与RL(强化学习)三个阶段如何分配算力,一直是一个缺乏明确答案的开放问题。预训练时代,我们有Chinchilla定律作为指引——大致按每个参数分配20倍token的比例来安排算力。Chinchilla定律源自DeepMind在2022年发表的研究,其核心发现是:在固定计算预算下,模型参数量与训练数据量应当等比例扩展。这一发现颠覆了此前GPT-3时代"越大越好"的思路——当时业界倾向于训练尽可能大的模型,即使数据量不足。Chinchilla定律表明,一个70B参数的模型如果只用300B token训练,其效果可能不如一个更小但训练数据充足的模型。然而,这一规律仅覆盖了预训练阶段。当训练进入RL阶段,我们应该投入多少算力、这些投入会带来怎样的回报,业界始终没有清晰的规律可循。
Hugging Face Journal Club最新讨论的这篇论文,正是试图回答这个问题。它巧妙地选择国际象棋作为实验平台,系统性地研究了预训练算力分配如何影响后训练(post-training)阶段的下游任务表现。
用国际象棋搭建三阶段实验框架
论文的实验设计相当精巧,它用国际象棋作为"试验台"(harness)完整复现了预训练、SFT、RL三个阶段。
预训练阶段:研究者收集了大量人类对弈的棋局数据。一局棋本质上就是一连串走法(如E2、E4、G5等)的序列,模型对这些序列做自回归训练,这与语言模型的预训练逻辑完全一致。自回归训练是当前主流大语言模型的核心训练范式,其本质是让模型学习预测序列中的下一个token。GPT系列、LLaMA、Claude等模型都采用这种方式。国际象棋棋局天然适合这种范式——每一步走法都可以编码为一个token,一整局棋就是一个有序的token序列。这种类比的精妙之处在于,棋局序列具有严格的因果结构(前面的走法决定后面的合法走法),与自然语言中上下文决定后续内容的逻辑完全一致,使得实验结论具有向语言任务迁移的潜力。
SFT阶段:这一步的设计颇具新意。研究者用预训练模型从某个棋局位置S0出发,采样K条轨迹。由于这些轨迹会共享一些前缀走法,它们自然形成一棵树状结构。随后研究者将这棵树"线性化"为思维链(Chain-of-Thought)数据来训练模型。思维链是一种让大模型在给出最终答案前,先展示中间推理步骤的技术,2022年由Google研究者提出后已成为提升模型推理能力的标准方法。
说个细节,这种思维链构造方式与DeepSeek-R1等LLM任务中的做法并不完全相同。DeepSeek-R1的思维链更接近自由形式的内部独白,而此处的思维链是结构化的——模型显式地探索多个候选走法序列,然后从中选择最优的一条。这种设计让模型学会了"先探索后决策"的模式,类似于蒙特卡洛树搜索(MCTS)的思路,但以序列化的方式内嵌到了Transformer的生成过程中。

RL阶段:这一步在奖励设计上也有独特之处。模型从某个棋局状态出发进行推理,输出下一步走法。奖励机制是——如果模型走的不是当前状态下的最优步,就得零分;如果是最优步,则进入下一个状态继续。只有当整条轨迹每一步都走出最优解时,模型才能获得满分1分。这里的"最优步"由Stockfish等国际象棋引擎实时判定。Stockfish是世界上最强的开源国际象棋引擎之一,其Elo评分超过3500(远超人类世界冠军的约2850分),基于alpha-beta搜索算法和NNUE(高效更新的神经网络评估函数),能在极短时间内给出任意局面的最优走法。
这种过程级监督(process-level supervision)与传统RL只对最终轨迹打分的方式有本质区别。它逐步、逐招地提供奖励信号,避免了整局棋作为单一轨迹时奖励过于稀疏的问题。这与OpenAI在数学推理中使用过程奖励模型(Process Reward Model, PRM)的思路一致——对每个推理步骤单独评估,而非只看最终答案是否正确,从而大幅提高了学习效率。
核心发现:预训练算力越多,下游表现越强
论文最重要的几个结论集中在下游任务表现与算力分配的关系上。
首先,分配给预训练的算力越多,下游任务的pass@1奖励就越高。预训练损失越低,模型的泛化能力就越强,在后续RL中获得的收益也越大。这一点在直觉上是合理的——更好的基座模型意味着更高的性能天花板。

其次,也是最耐人寻味的发现:RL阶段能显著提升pass@1,但对pass@k几乎没有影响,无论预训练规模如何。这里需要理解这两个指标的含义:pass@1衡量模型一次生成就给出正确答案的概率,反映模型的可靠性和确定性;pass@k则衡量模型在k次独立采样中至少有一次给出正确答案的概率,反映模型的能力上界和解空间覆盖度。两者的差异揭示了模型内在能力与输出一致性之间的gap——一个pass@16很高但pass@1很低的模型,说明它"知道"正确答案但无法稳定输出。
从图表来看,实验区分了几个关键要素:RL轨迹(实线)、Step 0(预训练+SFT,圆点标记)、帕累托前沿,以及RL算力占比。帕累托前沿是多目标优化中的经典概念,指在所有可行方案中不存在另一个方案能在不损害任何目标的前提下改善某一目标的那些最优方案的集合。当固定总算力预算时:如果只是不断扩大预训练算力,pass@k会随之线性改善;但如果取其中一个点,拿出一部分算力(比如30%)投入RL,就能获得戏剧性的提升——比如从pass@k的10分跃升到30分。
换句话说,RL带来的是垂直方向的性能拉升。在pass@16指标上,Step 0的圆点已经几乎贴在帕累托前沿上,RL带来的增益有限;但在pass@1指标上,各个模型规模都能从RL中显著获益。RL对pass@1的提升而不影响pass@k,本质上是在"压缩"模型的输出分布,使其更集中在正确答案附近,即所谓的分布锐化(distribution sharpening)。
这一点意义重大。pass@1的提升意味着模型可靠性的增强——它不仅偶尔能给出正确答案,而且能更稳定地一次答对。这或许也能部分解释为什么一些模型仅通过调整后训练策略,就能获得性能上的大幅跃升。
小模型训练更久,胜过大模型
论文附录中的分析还揭示了一个与Chinchilla定律相悖的现象。研究者绘制了预训练损失关于参数量的曲线,形成一个"山谷"形状。他们发现:对于固定的算力预算,训练一个更小的模型、训练更长时间,往往比训练大模型效果更好。
具体而言,在他们探索的算力范围内,10亿参数的模型在pass@1上的表现,几乎总是不如小模型。Chinchilla定律给出的配比(图中虚线)并非最优选择。当然,讨论者也审慎地指出,这个结论可能与国际象棋任务的特殊性有关——毕竟象棋的词表只有约81个token,而自然语言的词表要大出成百上千倍(通常在32,000到100,000+的范围),其分布动态可能截然不同。在小词表环境下,模型不需要大量参数来"记忆"词嵌入,因此参数的利用效率更高,训练更长时间的边际收益可能更大。
RL是在"锐化"已有能力,还是创造新能力?
讨论中一个深刻的问题是:RL究竟给模型带来了什么?
论文的结论是"喜忧参半"的。一方面,对于基座模型已经能解决的问题,RL会放大这些能力,让模型输出更一致(这解释了pass@1的提升而pass@k不变);另一方面,在困难棋局上,RL偶尔也能让模型走出基座模型几乎无法发现的好棋。
讨论者的共识是:如果基座模型在pass@16上的成功率为0,RL几乎不可能凭空创造出新能力;但只要存在非零的成功概率,RL就能将其增强并放大。论文按问题难度做的分析也印证了这一点——简单问题上RL放大好解法,困难问题上有时能"尾部发现"(tail discovery)分布之外的好走法,但有时也只是强化模型已知的、可能错误的答案。

对实践的启示与局限
这篇论文的最大价值在于其干净、可控的实验设计,它固定了数据、只调节算力,从而得出清晰的算力-性能关系。但讨论者也坦率地指出了它对实际工作的局限性。
对于大多数从业者而言,真实场景是拿到一个开源的预训练模型(其预训练配方通常未知),然后在其上做RL或中训练(mid-training)。中训练是近年来大模型训练流程中逐渐受到重视的一个阶段,位于通用预训练和任务特定微调之间,通常指在预训练完成后、SFT/RLHF之前,用领域特定数据对模型进行继续预训练。例如,Meta的Code Llama就是在LLaMA 2基础上用大量代码数据做中训练得到的。中训练的核心价值在于高效注入领域知识——相比从头预训练,它的算力需求低一到两个数量级,但能显著提升模型在特定领域的表现。
因此关键问题变成:这套规律是否适用于中训练? 如果无法重做预训练,我们能否基于中训练损失推导出类似的曲线?
论文在数学任务上的实验(图六)恰好回应了这个疑问。研究者在一个10亿参数模型上用2000亿token的Numeratron数学与Dolma混合语料做训练,展示了中训练损失与RL性能之间的关系。这被认为是最具实践相关性的结果——因为它建立了中训练投入与下游收益的可度量联系。

讨论者进一步提出了一个悬而未决的深层问题:从随机初始化(或者说随机性能的任务)出发,RL能否"从零学会"一项能力?以生物学任务为例,多数开源模型表现接近随机(50%),而前沿模型能做对——这说明前沿模型学到了某些关键知识。那么,是应该把算力投入中训练来注入领域知识,还是直接RL去放大基座模型中已有的微弱信号?
共识倾向于:RL并不擅长从零创造能力。虽然AlphaZero证明了从随机初始化出发的RL在特定环境下可行,但其成功有特殊前提:游戏规则完全已知、状态空间虽大但有界、奖励信号明确(胜负)、环境可完美模拟因此可以无限采样。这些条件在自然语言任务中几乎都不满足——语言的"规则"是隐含的、状态空间近乎无限、正确性判定往往需要外部知识、且无法像棋类游戏那样无成本地生成无限训练数据。因此,虽然AlphaZero证明了RL从零学习的理论可行性,但将这一范式迁移到语言模型上面临根本性的样本效率挑战。RL更像是一把"锐化"能力的刻刀,而非从无到有的"雕塑家"。
结语
这篇论文虽然基于国际象棋这一受限环境,但它为理解预训练、SFT与RL之间的算力权衡提供了一个难得干净的量化框架。它明确了几个重要规律:预训练算力决定下游天花板、RL主要提升可靠性(pass@1)而非探索广度(pass@k)、以及固定算力下小模型可能更优。
但正如讨论者反复强调的,这些结论能否推广到大词表的自然语言任务、能否指导中训练的算力分配,仍需更多研究验证。对于真正从零训练模型的团队,这是一份有价值的参考配方;而对于在开源模型上做后训练的大多数从业者,最实用的或许还是那些直接研究固定基座模型下RL权衡的工作。
相关推荐

MLOps实战项目:衣物洗涤识别系统端到端构建全解析
通过一个衣物洗涤识别系统,详解MLOps端到端实战流程,涵盖自动化数据采集、模型再训练、Docker容器化、AWS云端部署以及Grafana+Prometheus监控,为MLOps初学者和求职者提供完整参考范本。

Row-Bot多智能体编排架构深度解析:父子Agent协作与并发控制
深入解析Row-Bot开源项目的多智能体编排架构,详解父子Agent分工模式、Git worktree并发安全机制、状态持久化与容错恢复设计,为AI Agent工程化落地提供可借鉴的协作范式。

Unsloth Desktop 发布:本地模型运行与训练一体化桌面应用
Unsloth Desktop 是一款开源跨平台桌面应用,集模型运行、微调训练、部署于一体,支持Mac/Windows/Linux,实现2倍训练加速与70%显存节省,零遥测保护隐私。