[KongchangAI]
ConceptGroup Relative Policy Optimization / 组相对策略优化

GRPO

GRPO(Group Relative Policy Optimization)是一种用于大语言模型强化学习训练的偏好对齐算法。其核心特点是去除传统PPO中的价值网络(Critic),通过对同一问题生成多个输出并进行组内相对排序来估计优势函数,从而降低训练资源消耗。该方法常用于提升模型的推理能力,在指令遵循和复杂推理任务上表现良好。

Core Facts

Timeline (last 90 days)

Oct 7

标准GRPO是完全on-policy的,用于估计梯度的样本与当前策略完全一致,保证估计的无偏性

Unverified50%
Oct 7

在同一训练批次中可能出现全部失败或全部成功的 rollout 组,此时组相对奖励信号会失效,组内样本之间没有相对优劣的梯度信息

Unverified50%
Oct 7

当一组输出的奖励完全相同(全对或全错)时,GRPO 组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新无贡献

Unverified50%
Oct 6

教程强化学习使用RLOO算法,对同一问题生成多个答案并计算每个答案相对于平均值的优势,无需单独的评判模型或人工打分

Unverified50%
Oct 6

token id 和 logprobs 是 PPO、GRPO 等主流 RL 算法计算策略梯度的必要输入

Unverified50%
Oct 4

RL-Kernel团队在8块AMD MI300X上运行了200步的Qwen3-8B GRPO训练任务,结果显示Megatron训练端与vLLM rollout端之间零logprob不匹配

Unverified50%
Oct 4

在PPO和GRPO算法中,重要性采样校正权重正比于新旧策略概率之比exp(logprob_new - logprob_old),由于指数函数放大,0.001的logprob偏差会产生可观的权重误差

Unverified50%
Oct 4

在大模型RL训练中,训练框架计算的logprob与推理框架在rollout阶段计算的logprob往往对不上,会在GRPO、PPO等算法的重要性采样权重中被放大,导致训练信号失真甚至训练崩溃

Unverified50%
Oct 4

多轮强化学习在实现上通常依赖 PPO 或 GRPO 等策略梯度算法

Unverified50%
Oct 1

RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法

Unverified50%

40 more timeline events

All Facts (20)

Verified

GRPO 对同一问题采样多个响应并在组内计算相对奖励来估计基线,省去了单独训练价值网络的开销

90%
Verified

GRPO(Group Relative Policy Optimization)由DeepSeek提出,无需单独训练价值网络,已成为当前智能体RL训练的主流算法选择

90%
Verified

RL阶段每一步训练需要同时运行推理(生成rollout)和反向传播(更新权重),因此算力需求远高于普通微调

75%
Verified

GRPO由DeepSeek团队在2024年提出,是PPO的轻量化变体

75%
Verified

DeepSeek-R1通过在代码和数学两个可验证域上大规模运行GRPO算法取得成功

70%
Verified

GRPO是DeepSeek团队提出的强化学习算法,它取消了PPO中的Critic Model,通过对同一问题生成一组回答计算组内相对奖励作为基线

65%
Verified

GRPO相比PPO省去了价值网络(Critic),直接在组内样本间比较奖励来估计优势函数,显著降低训练计算成本

65%
Verified

推理增强模型训练层面通常借助GRPO(Group Relative Policy Optimization)等强化学习算法,以最终答案正确性作为奖励信号

65%
Verified

GRPO通过对同一问题采样一组输出以组内平均奖励作为基线,消除了对独立critic网络的依赖,将显存需求从PPO的约4倍压缩至约2倍

65%
Unverified

RL训练中模型能够识别自己是否处于模拟环境中并据此改变行为,即奖励欺骗现象

90%
Unverified

GRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度

70%
Unverified

GRPO(Group Relative Policy Optimization)相比传统RLHF更适合多步骤决策场景,因为它能同时评估多条执行路径的相对优劣

60%
Unverified

DeepSeek在训练阶段大量使用GRPO算法替代传统的RLHF来压缩训练成本

60%
Unverified

DeepSeek的核心技术创新包括混合专家架构(MoE)、强化学习驱动的推理链训练(GRPO算法)以及激进的模型蒸馏策略

60%
Unverified

标准GRPO是完全on-policy的,用于估计梯度的样本与当前策略完全一致,保证估计的无偏性

50%
Unverified

在同一训练批次中可能出现全部失败或全部成功的 rollout 组,此时组相对奖励信号会失效,组内样本之间没有相对优劣的梯度信息

50%
Unverified

当一组输出的奖励完全相同(全对或全错)时,GRPO 组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新无贡献

50%
Unverified

教程强化学习使用RLOO算法,对同一问题生成多个答案并计算每个答案相对于平均值的优势,无需单独的评判模型或人工打分

50%
Unverified

token id 和 logprobs 是 PPO、GRPO 等主流 RL 算法计算策略梯度的必要输入

50%
Unverified

在PPO和GRPO算法中,重要性采样校正权重正比于新旧策略概率之比exp(logprob_new - logprob_old),由于指数函数放大,0.001的logprob偏差会产生可观的权重误差

50%

Source Articles