ConceptGroup Relative Policy Optimization / 组相对策略优化
GRPO
GRPO(Group Relative Policy Optimization)是一种用于大语言模型强化学习训练的偏好对齐算法。其核心特点是去除传统PPO中的价值网络(Critic),通过对同一问题生成多个输出并进行组内相对排序来估计优势函数,从而降低训练资源消耗。该方法常用于提升模型的推理能力,在指令遵循和复杂推理任务上表现良好。
Timeline (last 90 days)
May 31
DeepSeek在训练阶段大量使用GRPO算法替代传统的RLHF来压缩训练成本
Unverified85%
May 31
Cursor在离线RL阶段使用了GRPO(Group Relative Policy Optimization)算法,这是DeepSeek提出的一种RL算法变体
Unverified90%
May 31
GRPO(Group Relative Policy Optimization)由DeepSeek提出,无需单独训练价值网络,已成为当前智能体RL训练的主流算法选择
Verified90%
May 31
DeepSeek的核心技术创新包括混合专家架构(MoE)、强化学习驱动的推理链训练(GRPO算法)以及激进的模型蒸馏策略
Unverified80%