[KongchangAI]
ConceptGroup Relative Policy Optimization / 组相对策略优化

GRPO

GRPO(Group Relative Policy Optimization)是一种用于大语言模型强化学习训练的偏好对齐算法。其核心特点是去除传统PPO中的价值网络(Critic),通过对同一问题生成多个输出并进行组内相对排序来估计优势函数,从而降低训练资源消耗。该方法常用于提升模型的推理能力,在指令遵循和复杂推理任务上表现良好。

Timeline (last 90 days)

May 31

DeepSeek在训练阶段大量使用GRPO算法替代传统的RLHF来压缩训练成本

Unverified85%
May 31

Cursor在离线RL阶段使用了GRPO(Group Relative Policy Optimization)算法,这是DeepSeek提出的一种RL算法变体

Unverified90%
May 31

GRPO(Group Relative Policy Optimization)由DeepSeek提出,无需单独训练价值网络,已成为当前智能体RL训练的主流算法选择

Verified90%
May 31

DeepSeek的核心技术创新包括混合专家架构(MoE)、强化学习驱动的推理链训练(GRPO算法)以及激进的模型蒸馏策略

Unverified80%

Source Articles