[控场AI]
· 4 分钟阅读· 2,455 字

Score Centering:稳定离策略强化学习的数值新解

Score Centering:稳定离策略强化学习的数值新解

Score Centering通过对分数函数去均值,从原理层面稳定LLM离策略强化学习训练。

来自Together.ai的研究者提出Score Centering方法,专门针对大语言模型离策略强化学习训练中的数值稳定性难题。LLM的RL训练因参数量巨大、序列长、奖励信号稀疏,对浮点精度与梯度尺度极度敏感,训练崩溃是常见痛点。离策略学习虽具备更高的数据复用效率,但分布偏移与重要性采样权重的极端值会导致梯度估计高方差,加剧不稳定性。Score Centering通过对策略梯度中的分数函数项进行去均值处理,降低梯度估计方差,提供原理性的数值干预点,区别于经验性超参数调整。该工作为离策略LLM RL训练的可行性提供了新的推进,若得到充分验证,有望显著降低大模型强化学习的训练成本。

一个被忽视的问题:LLM 强化学习对数值极度敏感

大语言模型的强化学习训练(RL)近年来成为对齐与推理能力提升的核心手段,但一个长期被低估的事实是:LLM 的 RL 训练对数值问题极其敏感。来自 Together.ai 的研究者 Marek 与 Ryabinin 在其论文《Score Centering Stabilizes Off-policy Reinforcement Learning》中,将焦点对准了离策略(off-policy)强化学习中的稳定性难题。

在实际训练中,策略更新往往并非严格来自当前策略采样的数据,而是复用了此前采集的、由旧策略生成的样本——这正是离策略学习的典型场景。这种数据复用带来了效率优势,却也引入了分布偏移与梯度估计的高方差问题,使训练过程容易出现崩溃或不收敛。

reddit 讨论来源截图

Score Centering 的核心思路

论文提出的方法名为 Score Centering(分数中心化)。其基本出发点在于:在离策略场景下,用于估计策略梯度的分数函数(score function)本身携带的偏置与方差,是导致训练不稳定的关键来源之一。

所谓「中心化」,即对分数项进行去均值处理,使其围绕一个更合理的基准波动,从而降低梯度估计的方差。这类似于强化学习中经典的 baseline 技巧,但作者将其明确定位于离策略稳定性这一具体问题上,并给出了针对 LLM 训练管线的适配方案。

对于 LLM 而言,序列级别的奖励信号往往稀疏且尺度多变,任何未经处理的数值放大都可能在长序列上累积成灾难性的梯度爆炸。Score Centering 通过控制分数项的数值范围,为训练提供了额外的稳定裕度。

分数函数(score function)是策略梯度方法的理论基石。在 REINFORCE 等算法中,策略梯度可以写成奖励与对数策略梯度之积的期望,其中对数策略对参数的梯度项即称为 score function。其核心问题在于方差:即便期望方向正确,单次采样的梯度估计可能偏离真实值极远。经典的 baseline 减方差技巧(如用状态值函数 V(s) 作为基准)正是利用了「减去任意不依赖动作的量不改变梯度期望」这一性质。Score Centering 的思路与此一脉相承,但将基准的作用落点放在离策略校正后的分数项上,而非仅在奖励侧做处理。在离策略场景下还需叠加重要性采样权重(importance sampling ratio),该权重是当前策略与行为策略概率之比,极端值会大幅放大方差,因此在分数层面进行中心化能从根源上抑制这一放大效应。

为什么数值稳定性对 LLM RL 如此重要

帖子标题中特别强调了一句话:「LLM RL is extremely sensitive to numeric issues」(LLM 的强化学习对数值问题极度敏感)。这并非危言耸听。

与传统的小规模 RL 任务不同,LLM 的参数量巨大、训练序列长、奖励模型本身也存在噪声。在这种条件下,浮点精度、梯度尺度、重要性采样权重的极端值等因素,都可能让训练在某一步突然发散。工程实践中,研究者常常需要引入梯度裁剪、KL 惩罚、重要性权重截断等一系列「保险措施」才能勉强让训练跑通。

Score Centering 的价值在于,它从数值层面给出了一个相对原理性的干预点,而非单纯依靠经验性的超参数调整。这对于希望规模化、可复现地开展 LLM RL 训练的团队而言,具有实际意义。

与主流方法的关系

当前主流的 LLM RL 方法(如 PPO 及其各类变体)大多依赖 on-policy 或近似 on-policy 的数据。离策略方法虽然在样本效率上更有吸引力,但稳定性始终是拦路虎。Marek 与 Ryabinin 的工作可以看作是对离策略路线可行性的一次推进——如果离策略训练能够被稳定化,那么 RL 训练的数据复用效率将显著提升,进而降低整体训练成本。

需要说明的是,本文基于 Reddit 上的单一来源讨论整理,论文的完整实验数据、对比基线与消融分析尚需查阅原始论文以作确认。从公开信息看,该研究的核心贡献在于识别并针对性地解决了离策略场景下的数值稳定性问题。

PPO(Proximal Policy Optimization)是目前 LLM 对齐训练(如 RLHF)中最广泛使用的算法,其核心设计是通过截断重要性采样比率(clip ratio)将策略更新约束在旧策略的邻域内,从而近似实现 on-policy 的稳定性保证。这一设计本质上是在「样本效率」与「稳定性」之间做了保守的折中——每批数据通常只能被复用数轮(mini-epochs),否则截断失效。相比之下,纯粹的离策略方法(如基于经验回放的 Q-learning 类算法)可以任意复用历史数据,样本效率理论上更高,但分布偏移会导致重要性权重急剧增大,令梯度估计失控。Score Centering 试图在不牺牲数据复用灵活性的前提下压制这种数值失控,若实验验证有效,将为超越 PPO 范式的离策略 LLM 训练路线提供重要支撑。

对从业者的启示

对于正在或计划开展 LLM 强化学习训练的工程师和研究者,这项工作至少带来两点提示:

  • 重视数值层面的诊断:当 RL 训练出现莫名其妙的崩溃时,问题很可能不在算法逻辑,而在数值尺度与方差控制。
  • 离策略并非禁区:随着 Score Centering 这类稳定化技术的出现,离策略 RL 有望成为兼顾效率与稳定的可行选项。

随着 Together.ai 等机构持续在训练基础设施与算法层面投入,LLM 的强化学习正从「能跑通」逐步迈向「稳定、高效、可复现」的成熟阶段。

分享:

相关推荐