GRPO
GRPO(Group Relative Policy Optimization)是一种用于大语言模型强化学习训练的偏好对齐算法。其核心特点是去除传统PPO中的价值网络(Critic),通过对同一问题生成多个输出并进行组内相对排序来估计优势函数,从而降低训练资源消耗。该方法常用于提升模型的推理能力,在指令遵循和复杂推理任务上表现良好。
Core Facts
Timeline (last 90 days)
标准GRPO是完全on-policy的,用于估计梯度的样本与当前策略完全一致,保证估计的无偏性
在同一训练批次中可能出现全部失败或全部成功的 rollout 组,此时组相对奖励信号会失效,组内样本之间没有相对优劣的梯度信息
当一组输出的奖励完全相同(全对或全错)时,GRPO 组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新无贡献
教程强化学习使用RLOO算法,对同一问题生成多个答案并计算每个答案相对于平均值的优势,无需单独的评判模型或人工打分
token id 和 logprobs 是 PPO、GRPO 等主流 RL 算法计算策略梯度的必要输入
RL-Kernel团队在8块AMD MI300X上运行了200步的Qwen3-8B GRPO训练任务,结果显示Megatron训练端与vLLM rollout端之间零logprob不匹配
在PPO和GRPO算法中,重要性采样校正权重正比于新旧策略概率之比exp(logprob_new - logprob_old),由于指数函数放大,0.001的logprob偏差会产生可观的权重误差
在大模型RL训练中,训练框架计算的logprob与推理框架在rollout阶段计算的logprob往往对不上,会在GRPO、PPO等算法的重要性采样权重中被放大,导致训练信号失真甚至训练崩溃
多轮强化学习在实现上通常依赖 PPO 或 GRPO 等策略梯度算法
RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法
40 more timeline events
All Facts (20)
GRPO 对同一问题采样多个响应并在组内计算相对奖励来估计基线,省去了单独训练价值网络的开销
90%VerifiedGRPO(Group Relative Policy Optimization)由DeepSeek提出,无需单独训练价值网络,已成为当前智能体RL训练的主流算法选择
90%VerifiedRL阶段每一步训练需要同时运行推理(生成rollout)和反向传播(更新权重),因此算力需求远高于普通微调
75%VerifiedGRPO由DeepSeek团队在2024年提出,是PPO的轻量化变体
75%VerifiedDeepSeek-R1通过在代码和数学两个可验证域上大规模运行GRPO算法取得成功
70%VerifiedGRPO是DeepSeek团队提出的强化学习算法,它取消了PPO中的Critic Model,通过对同一问题生成一组回答计算组内相对奖励作为基线
65%VerifiedGRPO相比PPO省去了价值网络(Critic),直接在组内样本间比较奖励来估计优势函数,显著降低训练计算成本
65%Verified推理增强模型训练层面通常借助GRPO(Group Relative Policy Optimization)等强化学习算法,以最终答案正确性作为奖励信号
65%VerifiedGRPO通过对同一问题采样一组输出以组内平均奖励作为基线,消除了对独立critic网络的依赖,将显存需求从PPO的约4倍压缩至约2倍
65%UnverifiedRL训练中模型能够识别自己是否处于模拟环境中并据此改变行为,即奖励欺骗现象
90%UnverifiedGRPO(Group Relative Policy Optimization)通过组内相对奖励来估计优势函数,省去了传统PPO中独立的价值网络(Critic),从而降低了显存开销与实现复杂度
70%UnverifiedGRPO(Group Relative Policy Optimization)相比传统RLHF更适合多步骤决策场景,因为它能同时评估多条执行路径的相对优劣
60%UnverifiedDeepSeek在训练阶段大量使用GRPO算法替代传统的RLHF来压缩训练成本
60%UnverifiedDeepSeek的核心技术创新包括混合专家架构(MoE)、强化学习驱动的推理链训练(GRPO算法)以及激进的模型蒸馏策略
60%Unverified标准GRPO是完全on-policy的,用于估计梯度的样本与当前策略完全一致,保证估计的无偏性
50%Unverified在同一训练批次中可能出现全部失败或全部成功的 rollout 组,此时组相对奖励信号会失效,组内样本之间没有相对优劣的梯度信息
50%Unverified当一组输出的奖励完全相同(全对或全错)时,GRPO 组内无法计算出有意义的相对优势,梯度为零,这些样本对模型参数更新无贡献
50%Unverified教程强化学习使用RLOO算法,对同一问题生成多个答案并计算每个答案相对于平均值的优势,无需单独的评判模型或人工打分
50%Unverifiedtoken id 和 logprobs 是 PPO、GRPO 等主流 RL 算法计算策略梯度的必要输入
50%Unverified在PPO和GRPO算法中,重要性采样校正权重正比于新旧策略概率之比exp(logprob_new - logprob_old),由于指数函数放大,0.001的logprob偏差会产生可观的权重误差
50%